← 最新论文
🤖 AI

Give it Space! Explicit Disentangling of Positional and Semantic Representations in Encoders

本文提出了一种编码器架构,将语义、绝对和相对位置信息显式地解耦到独立的流中,揭示了孤立的位置子空间自然地形成了捕获文档结构的低维流形,并证明了与标准的纠缠位置编码相比,该方法显著提升了语言表示能力。

原作者: Pierre-Antoine Lequeu, Camille Barboule, Benjamin Piwowarski

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Pierre-Antoine Lequeu, Camille Barboule, Benjamin Piwowarski

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将 Transformer(现代 AI 文本模型背后的“大脑”)比作一个繁忙的高速火车站。在这个车站里,列车上的每个词(token)要正确完成工作,都需要两样东西:

  1. 它是什么:这个词的含义(例如,“狗”、“跑”、“蓝色”)。
  2. 它在哪里:它在句子和文档中的位置(例如,“第一个词”、“第二段中间”)。

问题:杂乱的“背包”

在大多数当前的 AI 模型中,这两类信息被塞进每个词的同一个“背包”(同一组数值)里。论文指出,这种做法很混乱。

当模型尝试预测下一个词(这项任务称为“掩码语言建模”)时,它会过于专注于含义,从而在不经意间将位置信息从背包中踢出去,尤其是在网络的最后几层。这就像一名学生为了准备历史考试而背着一个装满地图的沉重背包;最终,为了腾出空间放历史笔记,他们不得不扔掉地图。

此外,那些试图仅在查看其他词时才计算位置的新模型(相对位置编码),往往忘记了文档的“大局”结构,比如段落从哪里开始、到哪里结束。

解决方案:“给它空间!”

作者构建了一种名为DSTG-NeoBERT的新型模型。他们不再使用一个杂乱的背包,而是为模型提供了三条独立的信息流

  1. 语义流(蓝色):承载词的含义。
  2. 绝对位置流(红色):承载“我在整个文档中的位置”信息。
  3. 相对位置流(绿色):承载“我相对于邻居的位置”信息。

关键在于,他们告诉模型:“当你试图猜测下一个词(即进行测试)时,只查看蓝色(含义)流。让红色(位置)流保持原样。”这防止了模型为了腾出空间来容纳答案而意外删除位置信息。

他们的发现(“顿悟”时刻)

1. 位置图坍缩成一条简单的线
当他们观察“红色”流(绝对位置)时,原本预期它会是一个复杂的、48 维的混乱状态。然而,它自发地组织成了一个简单的、2 维的地图。

  • 类比:想象一群混乱的人群。突然,他们全部排成一条完美的、低频的波浪线。模型意识到,它不需要复杂的 3D 地图就能知道自己在文档中的位置;一条简单、平滑的波浪线就足以捕捉整个文本的结构。

2. 车站工作人员实现了专业化
在旧模型中,每个“注意力头”(车站里的一名工人)都试图包揽一切。在新模型中,工人们分成了两个截然不同的团队:

  • 结构团队:这些工人只查看“红色”流。他们知道句子和段落的起止位置。
  • 含义团队:这些工人只查看“蓝色”流。他们理解词语。
  • 结果:他们不再互相踩脚。“相对位置”信息(绿色)变成了仅对含义团队有用的工具,帮助他们专注于附近正确的词语。

3. “大局”得以保存
在标准模型中,“大局”结构(例如,知道自己在长故事的第二个段落中)会在模型到达最后一层时丢失,因为预测词语的压力将其覆盖。

  • 修复方法:由于新模型将位置信息保留在一条独立的、受保护的流中,且该流不用于猜测词语,因此“大局”结构一直完好无损地保留到了最后。

结果

当他们用标准模型测试这个新模型时:

  • 标准测试:在通用语言任务(如回答问题或理解句子)上,它的表现与现有最佳模型一样好。
  • 深度理解:当他们测试模型对特定语言细节(如语法、逻辑或语篇)的理解能力时,新模型在65 个类别中的 49 个类别中获胜。
  • 原因:因为模型不必为了理解文本含义而牺牲其对文本位置的理解。

总结

这篇论文表明,通过让“位置”和“含义”在高速公路上拥有各自专用的车道,AI 就不会发生碰撞。位置信息会自我组织成一张简单、高效的地图,而模型在理解长文档结构的同时,也不会丧失理解词语的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →