The Truth Lies Somewhere in the Middle (of the Generated Tokens)
本文表明,对自回归生成的令牌进行平均池化所产生的语义表示优于单个令牌状态,从而揭示信息分布于整个生成过程中,而非局限于单一位置。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图理解一个机器人(AI 语言模型)向你讲述的故事的“灵魂”或真正含义。机器人并不会一次性吐出整个故事;它是像画家一笔接一笔地添加笔触那样,逐字构建故事的。
很长一段时间里,研究人员认为,要理解这个故事,你只需要查看机器人写下的最后一个词,或者提示词(prompt)的第一个词。他们将机器人的内部“思想”(隐藏状态)视为最重要的信息被锁定在某个单一时刻。
但本文指出,真相实际上散布在整个故事之中。
以下是他们发现的拆解,使用了简单的类比:
1. “汤”与“单一食材”
想象机器人在做汤。
- 旧方法: 研究人员过去只尝最后一勺汤(最后一个 token),以此判断这是“鸡汤”还是“牛肉汤”。
- 新发现: 作者发现,如果你将机器人制作的每一勺汤都取出来混合在一起(这被称为“平均池化”),所得出的风味比任何单独的一勺都要清晰、准确得多。
论文表明,机器人对某个主题的理解并非锁定在某个特定的词中。相反,意义就像一幅马赛克。机器人生成的每个词都持有拼图的一小块互补碎片。当你将它们全部平均后,完整的画面就会变得清晰锐利。
2. “导游”类比
把机器人想象成一位带领你参观博物馆(即你询问的主题)的导游。
- 提示词: 你告诉导游:“给我看鸟类的画作。”
- 生成过程: 导游开始边走边讲。
- 最初的几步: “好的,我正在思考鸟类……"(通用思考)。
- 中间步骤: “让我回想一下滨鹬长什么样……"(回忆阶段)。
- 后续步骤: “这是一张滨鹬在沙地上啄食的图画……"(具体细节)。
论文发现,如果你只看导游说“好的”那一刻的表情,你就无法理解这次游览。如果你只看最后,就会错过背景。但如果你平均导游的整个旅程,你就能得到这次游览的完美总结。
令人惊讶的是,导游的自己的话(生成的文本)实际上比你对他们给出的原始指令更能帮助他们理解主题。通过一边回答一边讲述,机器人“思考”出了更清晰的理解。
3. 混合不同版本(“合唱团”效应)
研究人员还测试了一个有趣的想法:如果机器人用三个不同的随机“种子”讲同一个故事三次,会发生什么?
- 版本 A 可能会说:“这只鸟是蓝色的。”
- 版本 B 可能会说:“这只鸟有蓝色的羽毛。”
- 版本 C 可能会说:“这是一只蓝色的滨鹬。”
如果你将这三个版本的“思想”取出来混合在一起,结果会比任何单一版本都要好。这就像合唱团:单个歌手可能稍微有点跑调,但当你融合三位不同的歌手时,和声就完美了。这证明了信息是分布式的;没有任何一个词或任何一个版本掌握着全部真相。
4. “镜子”效应
论文还发现了机器人看待自己时的一种奇怪现象。
- 如果机器人 A 写了一个故事,然后机器人 A 读自己的故事,它能完美理解。
- 但如果机器人 B 读机器人 A 的故事,这种“理解”就会变得混乱。机器人 A 思考该主题的具体节奏丢失了。
这意味着,“意义”不仅仅在于纸面上的文字,还在于机器人到达那里所走的特定路径。机器人在生成过程中,其内部状态会发生变化,而这些变化是特定于该机器人的。
核心结论
论文总结道,要获得 AI 思维的最佳“总结”,你不应该只抓取它说的最后一个词。相反,你应该对它思考过程中所说的所有内容取平均值。
这就像试图理解一个人的情绪。你不会仅凭他们刚刚说的一句话就评判他们,而是根据他们整个对话的平均表现来评判。真相存在于所有生成的 token 的中间某处,而不是在最末端。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。