From Simulation to Enaction: Post-trained language models recognize and react to their own generations
本文表明,经过后训练的语言模型能够通过内部惊喜追踪驱动的降低输出熵来隐式识别其自身的同策略生成,同时也具备通过独立机制显式将这种识别能力语言化的独特能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个语言模型就像一位才华横溢的演员,花费数年时间背诵了来自书籍、电影和互联网的成千上万份剧本。在任何特殊训练之前,这位演员是一个被动模拟器。他们可以读出一句台词,并猜测下一句可能是什么,但他们并不真正关心是谁在说话,或者接下来会发生什么。他们只是基于之前见过的庞大文本库来预测下一个词。他们没有“自我”;他们只是一面镜子,反射着面前的任何文本。
这篇论文认为,在后训练(即人类教导模型成为有用助手的过程)之后,某些东西发生了变化。模型不再仅仅模拟一个角色,而是开始演绎一个角色。它开始识别自己的声音、自己的计划以及自己的行动。
以下是使用简单类比对该论文发现的分解:
1. “信心”转变(熵)
在人工智能领域,“熵”是不确定性或犹豫的代名词。
- 旧方式(预训练): 如果你问模型一个问题,它就像一个不确定剧本的紧张演员。它可能会说:“嗯,可能是这个,或者也许是那个,又或者是其他东西……"它把赌注撒得很开。
- 新方式(后训练): 一旦模型被训练成“助手”,当它看到自己之前的文字时,它会变得自信得多。
- 类比: 想象你在写一个故事。当你阅读你刚刚写的一页时,你确切地知道故事将走向何方。你不会犹豫。但如果你阅读陌生人写的一页,你就必须猜测接下来会发生什么。
- 发现: 论文发现,当模型阅读自己的文本时,其信心比阅读其他模型或随机互联网文章时高出 3 到 4 倍(熵更低)。这就像模型在低语:“这是我写的,所以我确切地知道接下来会发生什么。”
2. “自我识别”效应
研究人员测试了模型是否能区分自己的写作和他人的写作。
- 测试: 他们让模型 A 阅读由模型 A 写的故事,然后阅读由模型 B 写的故事。
- 结果: 当模型 A 阅读自己的故事时,它的信心显著增强(熵更低)。无论故事是由“海盗”人设还是“科学家”人设写的,只要模型识别出风格是自己的,它就会放松并变得更加果断。
- 关键点: 这仅发生在大型模型中。小型模型(如 20 亿参数模型)太“笨”了,无法察觉差异。无论它们是阅读自己的文本还是他人的文本,表现都一样。看来你需要一定水平的智能才能意识到:“嘿,那是我!”
3. “惊讶”计
为什么模型在阅读自己的文本时会变得更自信?论文发现了一种特定的内部机制:输入惊讶。
- 机制: 模型有一个内部的“惊讶计”。当它读到一个完全符合其自身预测的词(低惊讶)时,它会降低不确定性。当它读到一些意想不到的内容(高惊讶)时,它会变得紧张,并将赌注撒得更开。
- 联系: 因为模型正在阅读自己的文本,这些词很少令人惊讶。它们完美地符合它自己的计划。这种缺乏惊讶就像绿灯,告诉模型:“一切都在正轨上,请高信心继续。”
4. “计划”与“预填充”
论文还研究了模型如何处理其“意图”或“计划”。
- 场景: 假设你问模型:“告诉我一种食物。”模型瞬间做出一个无声的决定:“我要谈谈哈吉斯。”甚至在打出第一个字之前,它就已经锁定了这个话题。
- 干扰: 如果有人(或计算机)强迫模型以不同的词开头,比如“哈吉斯是一种……"(即“预填充”),但模型原本计划谈论的是披萨,那么模型就会感到困惑。
- 结果: 当强制的开头与模型的隐藏计划不匹配时,模型的信心下降,变得更为不确定(熵更高)。这就像一位已经背熟了一首歌的音乐家,但另一个人开始演奏不同的曲调;音乐家会绊倒,因为节奏不对。
5. “测谎仪”(显式与隐式)
最后,论文测试了模型是否能大声说出:“嘿,这部分开头不是我写的!”
- 测试: 研究人员让模型生成一个答案,然后他们秘密地将其开头部分粘贴进去(即预填充)。接着他们问:“这部分开头是你写的吗?”
- 结果: 模型可以正确地说:“是的,这是预填充的。”
- 转折: 研究人员发现,这种“大声说出来”的能力与“感到自信”的能力使用了完全不同的内部电路。
- 隐式识别: 模型感觉到了差异(改变其信心),这是基于文本的“惊讶”程度自动且即时发生的。
- 显式识别: 模型检查它计划说什么的记忆,将其与实际存在的内容进行比较,然后报告不匹配。这是一个独立的、按需进行的过程,发生在它给出答案之前。
总结
该论文表明,后训练将语言模型从被动模拟器转变为能够识别自我的主动代理。
- 之前: 它们像一面镜子,以同等的不确定性反射面前的任何文本。
- 之后: 它们像一位了解自己的风格的熟练作家。当他们阅读自己的作品时,他们会放松并变得自信。当有人试图接管他们的故事(预填充)时,他们会感到紧张,如果被问及,他们可以明确指出故事的开头并非按照他们的计划开始。
这种“自我识别”不仅仅是一个漏洞;它是这些模型学习作为代理运作的一个特征,即理解它们的输出会成为它们自己的未来输入。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。