When are likely answers right? On Sequence Probability and Correctness in LLMs
本文研究了大型语言模型中序列概率与正确性之间的关系,发现虽然在固定数据集中较高的概率通常能预测正确性,但它并不能作为通过改变解码方法来提高准确率,或是在区分针对同一提示词的正确响应方面的可靠指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大语言模型(LLM)视为一位想象力极其丰富的说书人,他几乎读遍了图书馆里的每一本书。当你给这位说书人一个提示(故事开头)时,他不仅仅会吐出一个结局;他可以生成成千上万种不同的可能结局。
这个研究提出的核心问题是:“如果一个故事的结局让说书人觉得非常‘合理’或‘自然’,这是否意味着它真的是‘正确’的答案?”
作者们将模型的“概率”(即模型认为一个句子有多可能出现)视为一个置信度计(confidence meter)。他们想知道,调高这个置信度的音量是否真的能带来更好的答案。
以下是他们的发现,通过简单的类比进行了拆解:
1. “图书馆”类比(在数据集内部)
研究发现: 如果你观察针对某一特定类型问题(比如数学测试)生成的整堆答案,那些模型认为最“可能”出现的答案通常也是正确的。
- 隐喻: 想象一位整理书架的图书管理员。如果你问:“这些书中哪一本是修理汽车的正确指南?”,图书管理员会指向那本他最有把握是正确的那本书。在面对不同的问题时,图书管理员通常是正确的。
- 陷阱: 这仅在你在不同问题之间进行比较时才有效。这并不意味着图书管理员仅仅因为对某一个特定问题感到自信,就能完美地选出那本正确的书。
2. “调音旋钮”类比(改变设置)
研究发现: 如果你试图通过改变设置(比如通过调节旋钮来减少随机性)来让模型变得“更自信”,你并不一定会得到更好的答案。事实上,你往往会得到一些听起来更自信、但质量却变差了的答案。
- 隐喻: 想象一台收音机。你可以转动“信号强度”旋钮来让音乐听起来更大声、更清晰。但如果你转得太高,你可能只会听到一些听起来很大声且清晰的杂音,尽管那根本不是正确的歌曲。
- 现实情况: 论文发现,通过调整模型设置来强制其选择“最可能”的序列,往往只会让模型听起来更笃定,但并不会让它变得更聪明。有时候,“最可能的”路径其实是一个陷阱。
3. “群众投票”类比(同一个问题,不同的答案)
研究发现: 如果你向模型提出完全相同的问题 32 次,那个“最可能”的答案并不总是正确的。模型可能会给你 32 个不同的答案,而它认为概率最高的那个可能却是错的。
- 隐喻: 想象在一个房间里向 32 个人提问同一个谜题。你问:“谁是这里最聪明的人?”那个举手声音最大的人(概率最高的人)并不一定是拥有正确答案的那个人。有时,房间里的意见是分裂的,而那个“大声”的答案可能只是一个流行的猜测,而非真相。
- 例外情况: 论文发现有一种特定的谜题类型(数学题),在这种情况下,“声音最大”的声音通常也是最聪明的。但对于其他类型的提问(如遵循指令或医疗建议),那个“大声”的声音往往和那些“安静”的声音一样容易出错。
4. “自我提升”陷阱
研究发现: 有些人试图通过让 AI 选择自己的“最佳”答案并从中学习来使 AI 变得更聪明。这篇论文警告说,这样做是有风险的。
- 隐喻: 想象一名学生试图通过只学习那些他认为是正确的答案来提高数学水平。如果这个学生本身数学并不好,他只会不断强化自己的错误,心里想:“哦,这个错题感觉很熟悉,所以它一定是正确的!”
- 教训: 只有当 AI 已经擅长某项任务时,你才能利用“置信度”来提升它。如果它本身还在挣扎,那么信任它自己的置信度只会让它错得更加理直气壮。
“经验法则”总结
该论文为使用这些模型提供了三个主要启示:
- 不要相信“音量”: 仅仅因为模型说一个答案是“高概率”的,并不代表它是正确的。
- 语境至关重要: “感到确定”与“做对”之间的关系取决于问题的类型(数学不同于代码,代码又不同于指令遵循)。
- 不要过度优化: 试图通过改变设置来强行让模型变得“更可能”通常没有帮助,甚至会有害。
简而言之: 当观察宏观图景时,模型的“直觉”(概率)是一个有用的线索,但作为导航单个特定问题的指南针,它却非常糟糕。你不能仅仅调高“置信度旋钮”,就指望答案会变得更好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。