Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
Jet-Long 是一种无需微调、零样本的方法,它通过动态调整 RoPE 重缩放因子来平衡短上下文保真度与长上下文外推能力,并通过一种高效的双焦注意力机制,以极低的推理开销在长上下文基准测试中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人大脑(大型语言模型),它被训练用来阅读长度在 32,000 个单词以内的故事。现在,你想让它阅读一整本小说或一个巨大的代码库,其长度是原来的四倍。如果你直接把这么长的文本交给它,机器人就会感到困惑。这就像是在读一本书时,页码突然从 100 跳到了 1,000,000;机器人的内部指南针(称为 RoPE)会疯狂旋转,导致它开始产生幻觉或忘记故事的中段。
有一段时间,科学家们试图通过选择一个“魔术数字”来拉伸机器人的视野,以此来修复这个问题。但这是一个双输的游戏:如果拉伸得太厉害,为了看清书的结尾,机器人就会忘记开头;如果保持紧凑以记住开头,它就无法看到结尾。
于是,Jet-Long 出现了,它像是一个为机器人的眼睛提供动态双焦点镜片的新方法。
双焦点眼镜的妙招
Jet-Long 不再强迫机器人在整本书中使用单一的拉伸视角,而是同时给它两副眼镜:
- 近视镜片(局部窗口): 对于第一部分文本(“局部窗口”),机器人看到的每一处细节都与它受训时看到的一模一样。没有拉伸,没有畸变。这能让机器人的近期记忆保持清晰。
- 远视镜片(远程窗口): 对于剩余的文本(“远程窗口”),机器人使用了一个特殊的技巧。它不仅仅是拉伸视野,还会动态地将页面进行分组。随着书本变长,机器人会自动调整将多少页合并为一个“超级页”。
神奇之处在于,这个分组因子并不是固定的。它会根据当前文本的长度实时变化。如果文本很短,机器人会逐字查看;如果文本非常庞大,它就会将单词进行分组,程度恰到好处,使得机器人的内部指南针保持冷静,不会失控旋转。这意味着机器人对于短任务能保持完美的准确性,同时仍能阅读海量文档而不会迷失方向。
“免费午餐”般的速度
通常情况下,同时进行两种不同的计算(既看近又看远)会让机器人慢上一倍。但论文作者发现了一种巧妙的方法来合并这些计算。他们构建了一个特殊的引擎(“融合算子”),可以在一次处理中完成两种镜片的数学运算。
这就像一位厨师通常需要先切菜、再煮汤、最后煎炸,分三个锅进行;而 Jet-Long 就像一个神奇的锅,可以同时完成这三步且不损失任何风味。
- 结果: 当机器人阅读高达 128,000 个 token 的超长上下文时,在 H100 芯片上,Jet-Long 在起始阶段(“预填充”阶段)比标准方法(FlashAttention-2)快 1.39 倍。
- 代价: 当机器人逐个单词生成新文本时,它只比标准方法慢了约 4%。对于能够阅读整个图书馆而非仅仅是一本小册子的能力来说,这只是一个微小的代价。
它们测试了什么(以及没测试什么)
团队在三种不同规模的机器人大脑(17 亿、40 亿和 80 亿参数)上进行了测试,发现 Jet-Long 始终优于之前的最佳方法。
- 在一项名为 RULER 的测试中(该测试检查机器人能否在文本的“大海捞针”中找到隐藏的针),Jet-Long 在最小的模型上比最强的竞争对手高出 4.79 分,在最大的模型上高出 2.03 分。
- 在一项名为 HELMET-RAG 的测试中(模拟现实世界的搜索任务),它实现了最高的整体准确率。
- 在 PG-19 测试(阅读古籍)中,它将机器人的困惑度(Perplexity)保持在最低水平,而其他方法会让机器人的困惑度随着文本变长而飙升。
重要提示(关于限制): 论文明确排除了“需要从头开始重新训练机器人才能使其奏效”的观点。Jet-Long 适用于“零样本”(zero-shot)模型,这意味着你可以拿一个预训练好的机器人,直接插上这个“镜片”。然而,论文也指出,虽然 Jet-Long 解决了“指南针旋转”的问题,但它并没有解决另一个被称为“注意力弥散”(attention diffusion,即机器人被过多的选项淹没)的问题。那个问题通常需要改变机器人的架构本身,而不仅仅是添加一个镜片。
结论
Jet-Long 并不是让机器人变得无限聪明的魔杖,但它是一个高效、无需调优的工具,能让现有的机器人处理长达 128,000 个 token 的文本而不至于崩溃。它在保持机器人短期记忆完美的同时,动态调整其长程视觉,且运行速度几乎与标准方法持平。作者在真实硬件(H100 GPU)上进行了测量,并发现它在不同规模的模型甚至混合了不同类型注意力的混合型机器人大脑上都能奏效。对于任何想要让 AI 阅读更长内容的人来说,这是一个扎实且经过验证的升级方案。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。