← 最新论文
🤖 machine learning

TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling

TileQ 是一种无需微调的训后量化方法,它利用在输入和输出维度间共享的二维分块结构化低秩因子,并结合融合的单次推理技术,在保持精度的同时显著降低混合专家模型的内存占用和延迟。

原作者: Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座由众多专家( specialists)组成的庞大图书馆,他们为一家巨型人工智能公司工作。这家公司使用一种“混合专家”(MoE)系统。其工作原理是:当你提出一个问题时,人工智能并不会唤醒所有专家,而只是挑选出少数几位(例如从 100 位中选出 2 位或 4 位)最适合回答该特定问题的专家。这使得人工智能既非常聪明,又极其高效。

问题所在:
尽管人工智能每次只“使用”少数几位专家,但所有专家都必须驻留在计算机的内存(RAM)中,随时待命。这就像拥有一座图书馆,其中每一本书都必须放在桌面上,即使你每次只阅读其中一本书的一页。这占据了巨大的空间,并导致计算机速度变慢,因为它必须在庞大的书堆中翻找,才能找到那几本需要的书。

旧方案(及其失败原因):
科学家们曾尝试通过总结这些书籍(量化)或将它们拆分成更小的部分(低秩)来压缩这些专家。

  • 问题: 如果你单独总结每位专家,你仍然会有过多的总结。如果你尝试在专家之间共享总结,旧方法就像试图将书籍堆叠成一条长长的单线(一维)。虽然节省了一些空间,但计算机仍需要四处跳跃才能找到正确的页面,导致速度变慢。此外,“总结笔记”本身占用了过多的额外空间,抵消了节省下来的空间。

新方案:TILEQ
本文的作者提出了TILEQ。你可以将其想象成将图书馆重新组织成一个二维网格书架(像棋盘一样),而不是一条长长的单线。

以下是 TILEQ 工作原理的简明分解:

1. “二维分块”技巧(智能书架)

假设你有 64 位专家。TILEQ 不再将他们视为 64 个独立的个体,而是观察到:“嘿,第 1 号和第 5 号专家的想法非常相似,第 2 号和第 6 号专家也是双胞胎。”

  • 旧方法: 你总结第 1 号专家,然后是第 2 号,接着是第 3 号……从而生成 64 个独立的总结。
  • TILEQ 方法: 你将这 64 位专家排列成一个 8x8 的网格(像更大的井字棋棋盘)。
    • 同一中的专家共享一个“左侧笔记”(他们输入内容的通用总结)。
    • 同一中的专家共享一个“右侧笔记”(他们输出内容的通用总结)。
    • 结果: 你不再需要 64 个独特的总结,而只需要 8 个行笔记和 8 个列笔记。这大幅减少了存储这些“笔记”所需的内存。

2. “单次通过”推理(快速电梯)

当人工智能需要回答问题时,它通常必须为它挑选的每一位专家分别运行一次计算。这就像为每个人单独呼叫一次电梯,一个接一个。这既缓慢又低效。

  • TILEQ 的改进: 由于专家现在被整齐地排列在二维网格中并共享笔记,计算机可以一次性、流畅地处理所有“活跃”专家。这就像启动一条传送带,一次性将所有选定的书籍运送给读者,而不是逐一取书。
  • 优势: 这使得人工智能运行得更快(延迟更低),因为计算机硬件(GPU)可以处理一大块完整的数据,而不是零散的小碎片。

3. 无需“重新训练”

通常,当你压缩人工智能时,你必须重新教导它(微调),以确保它不会忘记如何表达。TILEQ 是一种“训练后量化”(PTQ)方法。

  • 类比: 这就像将一张已完成的高分辨率照片压缩成更小的文件大小,而无需重新拍摄。你只需处理现有的图像。这节省了海量的时间和计算能力。

结果

该论文声称,通过使用这种二维网格和“单次通过”方法:

  • 内存: 与旧方法相比,它将这些“笔记”所需的额外内存减少了高达10 倍
  • 速度: 它将回答问题的时间(延迟)缩短至这些特定模型部分原有时间的约5%
  • 准确性: 尽管体积更小、速度更快,人工智能回答问题时的表现依然与庞大、未压缩的版本一样出色。

总结:
TILEQ 是一种巧妙组织智能人工智能“内存笔记”的方法。它不是给每位专家都配备一个沉重的背包,而是将他们分组到共享轻便背包的团队中。这使得整个系统能够适应更小的计算机,运行速度更快,同时不损失任何智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →