← 最新论文
🤖 machine learning

RoVE: Rotary Value Embeddings Attention for Relative Position-dependent Value Pathways

该论文引入了 RoVE,这是一种无参数的改进方法,通过随键(keys)一同旋转值嵌入(value embeddings)使值路径具有位置敏感性,从而统一了各种注意力公式,并证明了其在长上下文和上下文学习任务中相比标准 RoPE 具有一致的性能提升。

原作者: Alejandro García-Castellanos, Maurice Weiler, Erik J Bekkers

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Alejandro García-Castellanos, Maurice Weiler, Erik J Bekkers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题:“盲目的信使”

想象一下,大型语言模型(比如你正在与之交谈的这个模型)就像一个巨大的工人团队,他们在互相传递便条。

  • 查询 (Query/读者): 一名工人提出了一个问题。
  • 键 (Key/索引): 其他工人举着牌子说:“我有你需要的答案!”
  • 值 (Value/信息): 一旦“读者”决定听谁的,这些工人就会递过他们实际记录的内容(数据)。

这篇论文指出了现代模型(使用一种被称为 RoPE 的技术)存在的一个缺陷。

  • 优点: 模型非常聪明,知道该听谁的。它知道站在 5 步之遥的工人和站在 50 步之遥的工人的信息是不一样的。它对距离的处理非常谨慎。
  • 缺点: 一旦“读者”决定听某个工人的话,那个便条里的“内容”无论工人离多远,都会被一视同同地对待。
    • 类比: 想象你正在听一位朋友讲故事。如果他站在你身边,你能清晰地听到他的声音。如果他在 100 英尺外,你听到的词汇依然和他在你身边时完全一样。模型未能意识到,“距离”应该改变对信息的解读方式,而不仅仅是决定谁有权发言

解决方案:RoVE(旋转值嵌入)

作者提出了一种简单且免费的修复方法,称为 RoVE

RoPE 只是旋转“牌子”(Keys)来展示距离,而 RoVE 则是在信息被读取之前,也将“便条”(Values)进行旋转。

  • 类比: 想象工人们都拿着地图。
    • 旧方法 (RoPE): “读者”确切知道工人在哪里站着。但当工人递过便条时,无论工人在哪里,便条上的字体都是标准的。
    • 新方法 (RoVE): 在工人递出便条之前,他们会根据距离远近旋转纸张。如果离得远,纸张会稍微倾斜;如果离得近,则是平放的。
    • 结果: 当“读者”拿到便条时,纸张的倾斜角度会告诉他们如何相对于自己的位置来解读这条信息。信息本身现在也“感知”到了它的距离。

为什么这很重要:“注意力卷积”

论文声称,这个微小的改变将模型的注意力机制变成了一种被称为**“注意力卷积”**的东西。

  • 隐喻: 把标准的注意力机制想象成一个聚光灯。它照向不同的人,但光线的颜色在任何地方都是一样的。
  • RoVE 的改变: RoVE 让聚光灯根据人距离中心的远近而改变颜色。
  • 益处: 这创造了一种“块托普利茨”(block-Toeplitz)结构(一个高级数学术语),作者说这种结构与卷积(计算机处理图像背后的数学原理)所使用的结构是一致的。
    • 简单来说:通过这样做,模型开始像处理图像或物理对象那样去处理语言,即位置和距离会从根本上改变数据的含义。

实验表明了什么

作者在两种规模的语言模型(小型和中型)上进行了测试,发现:

  1. 更好的记忆力: 模型在长距离记忆(长上下文检索)方面表现得更好。
  2. 更好的推理能力: 当被要求在只有极少示例的情况下解决谜题(少样本学习)时,它们的表现更出色。
  3. 更长的触达范围: 模型能够处理比训练时长得多的文本,而不会感到困惑(分布外困惑度)。

“免费”升级

这篇论文最令人兴奋的部分是,RoVE 不需要额外的训练或额外的内存。

  • 它没有增加新的“权重”(参数)。
  • 它不会显著降低计算机的速度。
  • 它是一个“即插即用”的替代方案。你可以把旧方法换成 RoVE,模型会立即变得更擅长处理距离和长篇故事。

总结

论文认为,对于语言模型来说,要真正理解一个故事,它不应该仅仅知道在说话;它还需要知道说话者离自己有多远,并据此调整对信息的解读。RoVE 是一个巧妙且零成本的技巧,它让“信息”(Value)感知到了自身的距离,使模型变成了一个更强大的倾听者,在处理长篇、复杂的任务时表现卓越。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →