← 最新论文
🤖 machine learning

From Drift to Coherence: Stabilizing Beliefs in LLMs

本文表明,尽管大型语言模型在自回归答案重采样过程中最初会表现出违反鞅性质的信念漂移,但它们最终会自我稳定进入连贯的预测分布,这一现象被用于提出旨在减少漂移并提高连贯性且不牺牲准确性的提示和微调策略。

原作者: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、博学多才的机器人(大语言模型或 LLM),你向它提了一个问题。通常情况下,你期望它给出答案并坚持自己的推理。但这篇文章发现了一个奇怪的现象:如果你连续多次向这个机器人询问同一个问题,它的信心会发生动摇。

以下是作者如何修复这种“动摇”的故事,用简单的语言进行了解释。

问题所在:机器人的“摇摆大脑”

把机器人的大脑想象成一个正在猜测天气的人。

  1. 理想情况: 如果机器人是一个完美的贝叶斯思考者(这是一个形容完美的概率预测者的专业术语),它的信心应该是稳定的。如果它认为有 70% 的概率下雨,那么仅仅因为第二次思考了这个问题,这 70% 的概率不应该发生变化。
  2. 现实情况: 作者发现,当他们要求机器人生成一系列针对同一个问题的回答时,它的内部信心会发生漂移
    • 类比: 想象你问一位朋友:“会下雨吗?”他们说:“我有 70% 的把握。”然后,在没有再次查看窗外的情况下,你立即又问了一遍。他们可能会突然说:“实际上,我只有 50% 的把握了。”接着你又问,他们可能会说:“等等,也许有 80% 吧!”
    • 这种“摇摆”意味着机器人的信念在短期内是不稳定的。这就像一个指南针在最终指向北极之前,会疯狂地旋转。

发现:它最终会稳定下来

研究人员注意到一件有趣的事情:如果你持续向机器人询问同一个问题很多次(比如连续问 20 或 30 次),这种摇摆最终会停止。机器人的信心会趋于稳定,并落在一个一致的数值上。

  • 隐喻: 这就像摇晃一个混合在一起的玻璃瓶里的弹珠。起初,颜色在混乱地旋转。但如果你让瓶子静置一会儿,弹珠就会沉淀下来,你终于能看到真实的颜色比例。机器人需要一个“沉淀期”(称为“热身阶段”或 burn-in phase)来找到它真正的信念。

解决方案:两个阻止摇摆的小技巧

问题在于,等待机器人稳定下来既耗时又消耗计算资源。作者想出了两种方法,让机器人能够立即实现稳定。

1. “预热”技巧(答案种子/Answer Seeding)

作者不再让机器人从“冷启动”开始,而是先给它一个“预热”列表。

  • 运作方式: 他们先让机器人针对该问题生成几个随机答案,然后将这些答案作为提示词(prompt)的一部分反馈给机器人,然后再让它开始正式的序列生成。
  • 类比: 这就像音乐家在音乐会开始前调音。与其用刺耳、走调的音符开始演奏,不如先快速弹奏几个音符来定好音高。机器人利用这些“种子”答案直接跳入稳定区域,跳过了开始时的混乱摇动阶段。

2. “训练”技巧(自一致性损失/Self-Consistency Loss)

作者还通过改变机器人的学习方式,教会了它如何保持稳定。

  • 运作方式: 他们创建了一个特殊的数学课程(“损失函数”),向机器人展示它未来的答案。他们告诉机器人:“你现在的回答应该与你在 5 步之后所说的内容相匹配。”
  • 类比: 想象一个在考试中容易紧张并改变主意的学生。老师给了他们一个规则:“无论你在第 1 题写了什么,当你进行到第 10 题时,你都必须能够坚持你的观点。”通过练习这个规则,学生学会了从第一秒起就保持一致,因此不需要通过“摇摆”来寻找后来的信心。

实验结果

当他们在标准的单选题(如常识或科学测试)上测试这些技巧时:

  • 更少的摇摆: 机器人的信心停止了漂移,并保持了一致性。
  • 更好的预测: 机器人变得更擅长知道自己对答案的“确定程度”(即校准度/calibration)。
  • 同样的准确率: 至关重要的一点是,让机器人变得更稳定并没有让它变笨。它获得正确答案的频率与之前一样高,但现在它在判断自己何时正确时更加可靠。

核心结论

本文表明,虽然 AI 模型在生成序列时往往会表现出“摇摆”的信念系统,但它们天生就倾向于保持一致。通过使用少许的“预热”数据,或者通过训练它们去匹配“未来的自我”,我们可以让它们立即变得稳定且可靠,而无需等待它们自行沉淀。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →