← 最新论文
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix 是一种无需训练、以分块为中心的混合精度算子,它通过在融合的稠密注意力操作中,将硬件对齐的注意力评分分块动态路由至 FP16 和 INT8 路径,从而在加速长上下文大语言模型推理的同时,恢复了统一低精度方法所损失的精度并提升了吞吐量。

原作者: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型已成为新一代人工智能背后的引擎,它们能够总结整本书籍、回答来自长文档的复杂问题,并进行跨越数千词的对话。为了实现这一点,这些模型依赖于一种被称为“注意力”(attention)的机制,该机制允许它们权衡句子中每个词相对于其他所有词的重要性。当文本较短时,这个过程非常迅速。但随着上下文增长到包含整个章节或法律合同,计算成本会呈爆炸式增长。模型必须为每一对可能的词对计算一个得分,从而产生一个巨大的数据网格,这需要极高的内存和处理能力。这种瓶za(瓶颈)使得在标准硬件上高效运行这些强大的工具变得困难,尤其是在处理法律分析或医疗记录审查等现实世界任务所需的长序列时。

研究人员曾试图通过简化数学运算来解决这个问题。一种常见的方法是降低计算机使用的数字精度,即从高精度计算切换到更快速、低精度的计算。这就像是从用实验室天平测量食材,切换到使用厨房勺子;虽然速度快得多,但如果你在复杂的食谱中每一步都这样做,最终的成品味道可能会出错。另一种方法是完全跳过某些计算,忽略那些看似不重要的词。虽然这节省了时间,但却面临着切断模型理解故事所需关键连接的风险。挑战在于,如何找到一种既能利用低精度数学的速度,又不牺牲高精度数学的准确性,同时还能保持模型观察全局的能力。

一个研究团队推出了一种名为 TileMix 的新方法,它通过将注意力过程视为不是一个单一、统一的工作块,而是一组较小的、可管理的“磁砖”(tiles)来解决这一问题。想象一下那个巨大的词对得分网格是一个大型马赛克。TileMix 不再是用一种类型的油漆涂抹整个马赛克,而是将其划分为小的、与硬件对齐的正方形区域。对于每一个这样的区域,系统都会做出一个瞬时的决定:这一组特定的词对是需要高精度的慢速计算,还是可以采用快速的低精度计算?这个决定是基于一个预先规划的地图进行的,该地图将这些磁砖组合在一起,使得计算机可以在不停止重新组织数据的情况下,在同一次操作中切换高精度和低精度。

这项创新的核心是一个充当计算机处理器“交通指挥员”的路由系统。它将这些决策打包成紧凑的代码,本质上是一串比特流,告诉处理器每个磁砖应该走哪条路径。如果一个磁砖被标记为高精度,处理器就会使用其最精确的数学单元;如果它被标记为低精度,则切换到最快速、最高能效的单元。至关重要的是,两条路径都会更新一个共享的内存状态,以追踪整体结果,确保最终输出的一致性。这使得系统能够保留模型的完整连通性——这意味着词与词之间的交互从未被忽略——同时仍能从那些可以容忍低精度的计算部分中获取速度优势。

在实验中,研究人员在包括 LLaMA、Qwen 和 Vicuna 在内的几种流行大语言模型上测试了这种方法,使用的序列长度从 16,000 到 64,000 个词不等。他们将这种方法与标准的全文高精度方法以及一种全量使用低精度数学的版本进行了对比。结果显示,对整个计算过程使用低精度数学往往会导致准确度显著下降,导致模型丢失细节或在检索任务中失败。然而,TileMix 能够恢复大部分损失的质量。通过精心路由特定的磁砖组进入高精度路径,该系统能够保持非常接近全高精度基准的准确度水平,同时实现了更快的处理速度。

研究还探索了决定哪些磁砖应获得高精度处理的不同模式。他们发现,排列方式至关重要;某些模式(即将高精度计算保持在词网格的特定空间区域内)的效果比其他模式更好,具体取决于任务。例如,某些为局部词交互保留高精度的布局在事实召回任务中表现更好,而另一些布局在通用问答任务中则更具鲁棒性。研究人员证明,这种方法可以在无需重新训练模型的情况下应用,这意味着它可以立即部署在现有系统上。他们还展示了该方法在处理变长批次和不同模型架构时表现良好,表明它是一个提高效率的灵活工具。

最终,TileMix 提供了一种在速度与准确度之间的可控平衡。它表明,高效的长上下文处理的未来并不需要在这两者之间做选择。相反,通过智能地混合两者,系统可以以接近硬件理论极限的速度处理长文档,而不会带来使用全量低精度数学所导致的严重准确度惩罚。这种方法为在大规模数据集实时分析或需要即时理解长且复杂上下文的交互式工具等对速度和精度要求极高的场景中部署大语言模型,提供了一条切实可行的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →