← 最新论文
💬 NLP

Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D

本文表明,由于标准一维位置编码的局限性,前沿语言模型在复制文本方面表现挣扎,并提出了 2D-RoPE,一种将文本组织成二维网格的方法,以实现卓越的复制性能以及在合成任务和大规模预训练任务中的泛化能力。

原作者: Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

发布于 2026-07-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Haodong Wen, Yiran Zhang, Yingfa Chen, Kaifeng Lyu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人如何阅读和写作。你给了它一座巨大的图书馆,它学会了以惊人的准确度预测句子中的下一个词。这个机器人就是一个大语言模型(LLM),它是我们今天使用的许多人工智能工具背后的“大脑”。但问题在于,这些机器人并不像人类那样“阅读”。它们将文本视为一串长长的、单一的线上的珠子。为了了解自己在这一行中的位置,它们使用了一种叫做“位置编码”的技术。你可以把它想象成在每颗珠子上贴上的一组隐形标签,告诉机器人:“你是第5颗珠子,”或者“你是第100颗珠子。”

长期以来,科学家们一直认为这些机器人正变得越来越聪明,几乎可以解决任何谜题。但出现了一个奇怪且令人尴尬的故障,他们无法修复。如果你要求机器人完全照抄它看到的数字或字母序列,它有时会失败,即使这个序列短到足以放入它的记忆中。这就像要求一个人从书中抄写一个句子,而他们却因为弄不清自己在行中的位置而意外跳过了一个词或交换了两个字母。大问题在于:为什么一个能写诗并解决数学问题的机器,在仅仅抄写一个列表时却会感到吃力?

这篇论文研究了正是这个谜团。作者们——来自清华大学的研究团队——发现机器人的“标签”(即位置编码)其实才是问题所在。标准的文本标记方式让机器人很难找到它需要抄写的精确位置,尤其是当文本具有重复模式时。与其说它是在寻找特定的位置,不如说它会被附近看起来相似的文本块所干扰。为了解决这个问题,研究人员尝试了一个新想法:如果我们不再把文本视为一条长线,而是将其排列成一个网格,就像带有行和列的电子表格一样,会怎样?他们创建了一个名为 2D-RoPE 的新系统。

当他们测试这个新系统时,结果令人惊讶。在实验中,使用二维网格的模型可以完美地复制字符串,即使这些字符串比它们在训练期间见过的任何字符串都要长数百倍。相比之下,标准模型则持续失败。研究人员表明,通过将文本组织成行和列,复制任务对于机器人来说变得简单得多:它只需要看上一行中相同列的内容即可。他们还构建了一个更智能的版本,叫做 Auto-2D-RoPE,它甚至可以在文本没有清晰换行符的情况下,自动识别出网格结构。

该论文指出,这种改变我们组织文本数据方式的简单变化,可以使人工智能在处理诸如复制和格式化等基础任务时表现得更好,而这些任务对于将原始数据转化为代码至关重要。虽然研究人员通过数学证明了这种新方法在简单的复制任务中是有效的,并在大规模测试中展示了其有效性,但他们也指出,这仍是一个活跃的研究领域。他们希望这一发现能鼓励其他人重新思考人工智能如何“看待”文本,证明有时,从二维的角度而非一维直线去观察世界,效果会更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →