← 最新论文
🤖 machine learning

ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention

ThriftAttention 是一种选择性混合精度注意力机制,它仅动态计算一小部分关键的查询 - 键块(采用 FP16 精度),而其余部分则采用 FP4 精度处理,从而在无损低比特推理效率的前提下,有效恢复出接近全 FP16 性能的长上下文质量。

原作者: Joe Sharratt

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Joe Sharratt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图阅读一部长达 10 万页的巨著,只为回答一个问题。为此,你的大脑(即 AI 模型)必须回溯它已读过的每一页,以寻找正确的线索。这种“回溯”过程被称为注意力(Attention)

问题在于,随着书籍变长,回溯所需的精力会呈爆炸式增长。如果书只有 100 页,这很容易;但如果书有 10 万页,大脑就会不堪重负,速度降至爬行。

当前的困境:速度 vs. 准确性

为了加快速度,工程师们一直试图使用书籍的“速记”版本。他们决定不再以高清模式(如FP16,高质量但缓慢)阅读每个单词,而是改用模糊、低分辨率的速记模式(如FP4,超快但丢失细节)来阅读所有内容。

  • 问题所在:当你用模糊速记阅读一本 10 万页的书时,你开始错过关键细节。AI 变得困惑,犯错增多,其回答的质量显著下降。
  • 旧方案:有些人尝试直接跳过某些页面(稀疏性)。但如果你跳过了错误的页面,你就会完全错过答案,且无法找回该信息。

新方案:ThriftAttention

本文作者提出了一种巧妙的中间方案,称为ThriftAttention。这可以看作是一种“选择性高清”策略。

以下是类比:
想象你是一名侦探,正在审查一段繁忙城市街道的庞大监控录像(即长上下文)。

  1. 模糊策略(FP4):你以快进、模糊模式观看整段录像。你节省了时间,但可能会错过嫌疑人的脸。
  2. Thrift 策略:你以快进、模糊模式观看整段录像,但是,你有一位智能助手,能瞬间识别出录像中 5% 发生最重要动作的部分(例如有人奔跑或发生车祸)。
  3. 神奇之处:对于这特定的 5% 时刻,助手会瞬间将摄像头切换至高清(FP16)。而对于剩余 95% 无聊、空旷的街道,则保持模糊模式。

工作原理(“秘密配方”)

该论文声称,并非所有“注意力”部分都同等重要。

  • 发现:作者发现,“模糊”(量化误差)只有在 AI 查看单词之间最重要的连接时才会真正损害 AI。这些通常是“响亮”或“显著”的交互。
  • 修正:他们建立了一个快速、轻量级的规则(启发式方法),充当聚光灯。它会扫描连接并指出:“嘿,这个特定的交互很重要!让我们为这一个使用高质量摄像头。”
  • 结果:它在快速、模糊模式下计算 95% 的工作量,仅在缓慢、高质量模式下计算 5%。

为何这很重要

该论文在不同 AI 模型上针对非常长的上下文(高达 131,000 个单词)测试了此方法。以下是他们的发现:

  • 速度:它几乎与完全模糊(FP4)方法一样快。
  • 质量:它恢复了约**89%**的质量,这相当于如果你在所有地方都使用缓慢的高质量方法所能获得的质量。
  • 最佳平衡点:文本越长,此方法效果越好。在极长的书籍中,“模糊”方法会彻底失败,但 ThriftAttention 能保持高质量,因为它将有限的“高清”预算精准地集中在最需要的地方。

总结

ThriftAttention 就像拥有一笔用于“高清”观看的预算。与其尝试以高清(太慢)观看整部电影,或以标清(太模糊)观看整部电影,它智能地仅在最具戏剧性的场景切换到高清。这使得 AI 能够快速阅读巨著而不至于“崩溃”,并以闪电般的速度提供近乎完美的答案。

注意:该论文严格专注于使 AI 推理(阅读/生成文本)更快、更准确。它并未声称适用于训练新模型或医疗/临床应用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →