Decoupling the "What" and "Where" With Polar Coordinate Positional Embeddings
本文介绍了极坐标位置嵌入(Polar Coordinate Positional Embeddings, PoPE),这是一种将 RoPE 中纠缠的内容与位置信息进行解耦的新型位置编码方案,通过与 RoPE 和 YaRN 等现有方法相比,在诊断任务、跨多领域的自回归建模以及零样本长度外推方面实现了更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一座巨大且混乱的图书馆中寻找一本特定的书。为了实现这一目标,你需要两 piece 信息:这本书是关于什么的(内容),以及它在书架上的位置在哪里(位置)。
在人工智能的世界里,特别是在一种被称为 Transformer(现代 AI 聊天机器人背后的引擎)的模型中,有一种被称为“注意力”(attention)的机制,它能帮助模型连接句子的不同部分。它既需要知道单词的“内容”(what),也需要知道它们在序列中的“位置”(where)。
长期以来,处理单词“在哪里”最流行的方法是一种叫做 RoPE(旋转位置嵌入)的方法。本文作者认为,RoPE 存在一个根本性的缺陷:它将“是什么”和“在哪里”混淆了。
问题所在:“纠缠”的图书馆
把 RoPE 想象成一位图书管理员,当你向他询问一本书时,他不仅仅是告诉你位置,而是根据位置来扭曲对书籍的描述。
- 如果这本书是关于“猫”的,且位于第 1 号书架,图书管理员会将其描述为“毛茸茸的猫”。
- 如果同一本“猫”的书位于第 10 号书架,图书管理员会将其扭曲为“带刺的猫”。
AI 模型会感到困惑。它无法轻易地做到:“无论在哪里,我都在寻找‘猫’这个概念”,或者“无论内容是什么,我都在寻找第 5 项物品”。“是什么”和“在哪里”像绳结一样纠缠在一起。这使得 AI 很难解决那些需要分离这两个概念的谜题。
解决方案:PoPE(极坐标位置嵌入)
作者提出了一种名为 PoPE 的新方法。PoPE 不再根据位置来扭曲书籍的描述,而是保持这两者的独立,就像一个整洁、有序的归档系统。
- “是什么”(内容): 这是书籍描述的幅度或“大小”。它保持纯净,不受位置的影响。
- “在哪里”(位置): 这是书籍的角度或“方向”。它会根据书架编号而改变,但不会干扰书籍本身的描述。
通过使用一种被称为极坐标(think of a compass where you have a distance and a direction,想象一个既有距离又有方向的指南针)的数学技巧,PoPE 确保了 AI 可以只寻找“猫”而不必担心书架编号,也可以寻找“第 5 号书架”而不必担心书籍的主题。它们是解耦(decoupled,即去纠缠)的。
他们是如何证明其有效的
研究人员通过三个主要实验测试了这种新方法:
“指针”谜题: 他们给 AI 一个任务,要求它根据规则寻找特定字母,例如“找到字母 'Z' 左边第 3 个位置的字母”。
- RoPE: 表现糟糕,成功率仅为 11% 左右。它无法将“Z”与“左边 3 个位置”区分开来。
- PoPE: 几乎完美地解决了问题(准确率达 95%)。它清晰地理解了这条规则。
音乐与 DNA: 他们在预测歌曲中的下一个音符和 DNA 序列中的下一个字母方面测试了 AI。音乐和 DNA 都高度依赖精确的模式和相对位置。
- 结果: PoPE 在这两个领域中的错误率(困惑度/perplexity)都比 RoPE 更低。它学习模式的速度更快,也更准确。
“长记忆”测试: 当前 AI 面临的最大问题之一是,如果它是在短篇故事上训练的,那么当要求它阅读长篇小说时,它会感到困惑。
- RoPE: 当测试其处理远长于训练长度的序列时,其性能大幅下降。
- PoPE: 它能够自然地处理长序列,无需额外的训练或特殊技巧。它可以“外推”(extrapolate,即推测模式)到比训练数据长 10 倍的长度。
核心结论
论文声称,通过仅仅改变 AI 计算单词“是什么”与“在哪里”之间关系的方式,他们创造了一个系统,该系统是:
- 更擅长逻辑谜题,即那些需要分离内容与位置的任务。
- 更擅长预测模式,如音乐、DNA 和语言。
- 更具鲁棒性,在阅读极长文本时无需重新训练即可应对。
作者强调,这是对这些模型如何“思考”序列的一种根本性的改进,使它们在不需要把模型做得更大的情况下,变得更加高效和准确。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。