← 最新论文
🤖 machine learning

EVA: Accelerating LLM Decoding via an Efficient Vector Quantization Architecture

本文介绍了EVA,这是一种软硬件协同优化的架构,通过将内存受限的向量量化查找转换为高效且无冲突的GEMM计算来加速大语言模型解码,与最先进的方法相比实现了高达11.17倍的加速比和7.17倍的能效提升。

原作者: Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Bowen Duan, Cong Guo, Chiyue Wei, Haoxuan Shan, Yuzhe Fu, Xinhua Chen, Yifan Xu, Ziyue Zhang, Changchun Zhou, Hai Li, Yiran Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一座庞大的知识库(即大型语言模型,或 LLM),它能写故事、解数学题,还能与你聊天。为了让这座知识库运转起来,计算机必须完成两项主要任务:一次性读取一大段文本(“预填充”阶段),以及逐字生成,反复进行(“解码”阶段)。

这篇论文指出,虽然读取速度很快,但在当前计算机上,逐字生成极其缓慢且浪费资源。来自杜克大学的一个研究团队构建了一个名为EVA的新系统来解决这一问题。

以下是 EVA 的工作原理,通过简单的类比进行解释:

问题所在:“逐字生成”造成的交通拥堵

将计算机的大脑(处理器)想象成一座拥有数千名工人(处理单元)的巨型工厂,他们随时准备进行数学运算。

  1. 预填充阶段(读取): 想象工厂收到了一大批 1,000 个箱子的货物。所有工人都可以同时抓取一个箱子并开展工作。这既快速又高效。
  2. 解码阶段(生成): 现在,想象工厂必须生产仅仅一个微小的物品,然后等待,接着再生产一个,再等待。尽管工厂拥有数千名工人,但只有一两名工人始终处于忙碌状态。其余的人则无所事事地站着。这就是论文中提到的"GEMV"问题:计算机受限于内存(等待数据),而非受限于计算(进行数学运算),从而导致巨大的交通拥堵。

旧方案:“字典查找”瓶颈

为了让工厂运转得更快,工程师们尝试使用一种称为**向量量化(VQ)**的技术来缩小“操作手册”(模型权重)。

  • 类比: 他们不再为每一个单词编写完整的指令,而是用短代码(如"A1"、"B2")替换冗长的指令,这些代码指向一个共享的字典(代码本)。
  • 新问题: 虽然这缩小了手册,但却制造了新的交通拥堵。每当工厂需要生成一个单词时,它都必须跑去字典,查找代码,并获取指令。
  • 冲突: 想象 100 名工人在同一时刻冲向字典中的同一个货架。他们互相碰撞,造成内存冲突。他们不得不排队等待,拖慢了整体进度。论文将这种现象称为“内存低效”。

EVA 解决方案:改变工作流程

EVA 的作者们意识到,他们不需要改变字典,只需要改变工人使用字典的方式。他们引入了一个两步魔术:

第一步:在查找代码之前先进行数学运算

EVA 颠倒了顺序,不再先查找代码再进行数学运算。

  • 类比: 想象工人们不再等待字典。相反,他们直接将输入(问题)与整个字典同时进行运算。
  • 结果: 这将“逐个”的数学问题转变为“大批量”的数学问题。在计算机术语中,他们将缓慢的GEMV(矩阵 - 向量)运算转变为快速的GEMM(矩阵 - 矩阵)运算。现在,所有工厂工人再次忙碌起来,并行地进行数学运算。

第二步:“无冲突”查找

一旦数学运算完成,工人们就得到了一份“中间结果”列表(输出代码本)。

  • 类比: 在旧系统中,所有人都跑向同一个货架。而在 EVA 中,结果被预先分类到不同的、独立的隔间中。当工人需要特定结果时,他们会前往自己专属的隔间。没有人会互相碰撞。
  • 结果: “内存冲突”完全消失。查找变得瞬间完成且并行化。

硬件:智能工厂车间

论文还描述了运行该系统的物理机器(芯片):

  • 可重构的工人: 工厂工人是智能的,可以切换模式。当计算机处于“读取”(预填充)状态时,他们使用简单、快速的 8 位数字工作。当处于“生成”(解码)状态时,他们切换到更精确的 16 位数字,以保持高质量。
  • 专用加法器: 生成单词的最后一步仅涉及数字相加。EVA 在流水线末端添加了一个特殊的“加法器”站点,它速度极快且不需要复杂的数学工具,使流水线保持顺畅运行。

结果:速度与效率

论文使用流行的 AI 模型(如 LLaMA)将 EVA 与现有的最佳系统(如 FIGLUT 和标准 GPU)进行了测试。

  • 速度: 与现有的最佳基于查找的系统相比,EVA 生成文本的速度快达11 倍
  • 能耗: 完成相同任务所需的能量减少了7 倍
  • 质量: 尽管模型被如此重度压缩(降至 2 位精度,这就像将高分辨率照片压缩成一个小图标),文本质量依然出色,准确率几乎没有损失。

总结

EVA 就像重新设计了一座工厂,让工人不再排队逐个领取指令,而是以大规模、有组织的批次处理指令,每个人都有自己的专用通道。这消除了交通拥堵,让所有工人保持忙碌,并使 AI 生成文本的速度和效率显著提高。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →