Mixing Mechanisms: How Language Models Retrieve Bound Entities In-Context
本文揭示,尽管语言模型最初依赖位置机制来检索上下文中的绑定实体,但随着上下文复杂度的增加,该方法变得不可靠,从而促使模型辅以词汇和反身机制,构建出一个稳健的因果模型,以准确预测其在多样且更长输入下的行为。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《混合机制:语言模型如何在上下文中检索绑定实体》的通俗解释,辅以生动的类比。
宏观图景:“迷失在中间”的问题
想象你在读一个故事,其中有一个角色介绍了一长串朋友及其喜欢的食物:
- Ann 喜欢 派。
- Joe 喜欢 果酱。
- Pete 喜欢 茶。
- Tim 喜欢 麦芽酒。
- ……以此类推,共有 20 个人。
然后,故事问道:"谁喜欢麦芽酒?"
如果你是人类,你可能会扫描列表。如果你是人工智能(语言模型),你必须弄清楚如何在你对该故事的记忆中找到答案。
长期以来,研究人员认为人工智能是通过简单地计算位置来解决这个问题的。它会想:“这个问题是关于第 4 个提到的人,所以我会看第 4 个名字。”这就像一位只知道按书架编号找书的图书管理员。
这篇论文说这位图书管理员错了。 人工智能不仅仅使用书架编号。事实上,当列表变长时,“书架编号”方法会陷入混乱,尤其是对于列表中间的人。为了解决这个问题,人工智能实际上同时使用了三种不同的技巧来找到正确答案。
三种技巧(机制)
作者发现,人工智能混合了三种特定的策略来记住谁喜欢什么。这就像侦探使用三种不同的工具来破案:
1. 位置机制(“书架编号”技巧)
- 工作原理: 人工智能查看信息在文本中出现的位置。如果"Ann"是第一个提到的人,人工智能就会记住“第一个人”。
- 何时有效: 这对于列表的最开头和最末尾的项目非常有效。就像完美地记住了书架上第一本和最后一本书一样。
- 何时失效: 随着列表变长,“中间”的书架变得模糊。人工智能会搞不清"Tim"是第 5 个还是第 6 个人。信号变得“嘈杂”且不可靠。
2. 词汇机制(“词语联想”技巧)
- 工作原理: 人工智能不是数数,而是查看词语本身。如果问题是“谁喜欢派?”,人工智能会在其记忆中搜索“派”这个词,并抓取与之关联的名字。
- 类比: 这就像一位不记得桌号,但记得“哦,点了派的那个人戴着红帽子”的服务员。
- 何时有帮助: 这非常敏锐且精确。当列表中间的“书架编号”变得模糊时,它能力挽狂澜。
3. 自反机制(“自指针”技巧)
- 工作原理: 这是最独特的一种。当人工智能读到"Tim 喜欢麦芽酒"时,它会创建一个秘密的、不可见的箭头,从单词“麦芽酒”指回"Tim"。稍后,当被问及“麦芽酒”时,它会直接跟随那个箭头。
- 类比: 想象“麦芽酒”上绑着一个微型 GPS 追踪器,直接指向"Tim"。人工智能不需要搜索;它只需跟随追踪器。
- 为何需要它: 有时问题在句子结构中出现在答案之前(例如,“谁喜欢麦芽酒?Tim 喜欢。”)。“词语联想”技巧很难向后工作,因此人工智能需要这种直接的“指针”来直接跳转到答案。
“中间”问题与解决方案
该论文发现了一个有趣的模式:
- 在列表的开头和结尾: 人工智能主要依赖位置技巧(计数)。在这里它既强大又自信。
- 在列表的中间: 位置技巧变得微弱且模糊(这被称为“迷失在中间”效应)。
- 解决方案: 在中间部分,人工智能切换到词汇(词语联想)和自反(指针)技巧的混合体。这些技巧更加敏锐,有助于人工智能忽略长列表中的噪音。
作者通过“修补”人工智能的大脑证明了这一点。他们从一则故事中提取人工智能的记忆,并将其与另一则故事的记忆进行交换。
- 如果交换了位置记忆,人工智能会根据新列表的顺序进行猜测。
- 如果交换了词汇记忆,人工智能会根据新列表的词语进行猜测。
- 如果交换了自反记忆,人工智能会跟随新的指针。
通过这样做,他们表明人工智能并非只使用一种方法;它不断地融合所有三种方法来获得正确答案。
“因果模型”(配方)
研究人员建立了一个简单的数学模型,将这三种技巧结合起来。
- 他们发现,如果你告诉模型使用所有三种(位置 + 词汇 + 自反),它可以以95% 的准确率预测人工智能接下来会说什么。
- 如果他们尝试仅使用旧的“位置”方法(即大家原本认为它工作的方式),准确率下降到约 45%——基本上是在瞎猜。
这在现实世界中有效吗?
该论文不仅在简单的列表上进行了测试,还在插入了“填充”文本(关于天气或交通的随机句子)的故事中进行了测试。
- 即使有这么多额外的噪音,人工智能仍然使用相同的三种技巧。
- 然而,随着文本变得非常长,“词语联想”(词汇)技巧变得稍微弱了一些,而“书架编号”(位置)技巧变得稍微嘈杂了一些。这解释了为什么人工智能有时在处理非常长的文档时会遇到困难——并不是人工智能忘记了;而是随着列表的增长,它的三种工具变得稍微不那么精确了。
总结
语言模型不仅仅是通过数数来阅读故事。它们使用一个混合系统:
- 计数(位置)用于边缘。
- 匹配词语(词汇)用于中间。
- 跟随指针(自反)用于直接连接。
通过理解这种混合,我们对人工智能如何在长对话中思考和记忆事物有了更清晰的画面。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。