How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures
本文识别并表征了语言模型中两种截然不同的标记级推理失败模式——以早期路径锁定为特征的“承诺型失败”(committed failure),以及以怀疑感累积为特征的“持续不确定性”(persistent uncertainty)——并证明这些特征在多种配置下均具有可复现性,且能够指导诸如自一致性等失败检测策略的优化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在观看一位侦探破解谜案。有时,侦探在早期犯了一个错误,锁定了一个错误的嫌疑人,然后接下来的整个过程中,他都在自信满满地论证为什么这个嫌疑人是有罪的,尽管那个人是清白的。另一些时候,侦探全程都处于真正的困惑中,翻阅着线索,在最后一秒之前都对答案拿不定主意。
这篇论文旨在研究,仅仅通过观察大语言模型(LLM)在撰写答案时的“思考过程”(思维链),就能判断出它犯了哪种类型的错误。研究人员发现,模型的失败并非只有一种方式;它们存在两种截然不同的模式,而识别出这种模式会改变我们捕捉错误的方法。
以下是使用简单类比对他们研究结果的拆解:
1. 两种错误类型
研究人员发现,当模型给出错误答案时,通常会出现以下两种情况之一:
类型 A:“过早承诺”(固执的侦探)
- 发生了什么: 模型在推理过程的极早期就选择了一条错误的路径。一旦选择了这条路径,它就会“锁死”。它不再探索其他可能性,而是不断编写更多的句子来支持那个错误的观点。
- 特征: 如果你观察模型在写作过程中的“不确定性”(它有多么不确定),你会看到不确定性在早期出现一个峰值,然后下降。模型变得过快地变得过于自信。
- 教训: 你不需要等整个故事讲完才知道它错了。事实上,阅读故事的结尾可能会让你感到困惑,因为模型对那个错误的答案如此自信,以至于看起来像是一个正确的答案。捕捉这种错误的最佳时机是在模型做出第一个重大错误之后。
类型 B:“持续不确定”(困惑的侦探)
- 发生了什么: 模型从未真正选定立场。它在推理中徘徊,全程都拿不定主意。直到最后一个字,它都在不断改变主意或犹豫不决。
- 特征: 模型的不确定性始终保持在高位,或者从头到尾缓慢上升。它从未锁定单一路径。
- 教训: 你必须读完整个故事才能知道它是否失败了。如果你在中途停止,你可能会认为它只是在表现得谨慎。只有当你看到整个混乱的思路轨迹时,错误才会变得清晰。
2. 他们是如何发现这一点的(“不确定性计量器”)
研究人员不需要进入模型的“大脑内部”(对于许多流行的 AI 模型来说,这是不可能的)。相反,他们观察了 log probabilities——这是一种技术性的说法,即“模型对它输入的每一个词有多大的把握”。
他们把模型的推理过程看作一部电影。他们观察“不确定性计量器”随着模型逐词输入而产生的跳动。
- 对于类型 A,计量器在早期显示出一个明显的峰值,然后趋于平缓。
- 对于类型 B,计量器会一直攀升或保持高位直到结束。
他们在 23 种不同的 AI 模型与任务组合(如数学、编程和科学)上进行了测试。在 23 种情况中的 20 种情况下,他们的理论都完美成立。他们仅通过观察这些模式,就能区分出是“固执”的错误还是“困惑”的错误。
3. 为什么这很重要:“第二意见”策略
论文还研究了一种被称为**自一致性(Self-Consistency)**的常用技巧。这指的是当你向 AI 提出同一个问题 10 次,并采用出现次数最多的那个答案。
- 对于“固执型”模型(类型 A): 向它提问 10 次是徒劳的。如果模型很固执,它会连续 10 次给出同一个错误答案。“多数投票”只会确认那个错误的答案。在这种情况下,观察单个答案的不确定性实际上比多次询问更有效。
- 对于“困惑型”模型(类型 B): 向它提问 10 次是非常有帮助的。由于模型是真的不确定,它每次给出的答案都会不同。它无法达成一致这一事实,就是一个巨大的警示信号。
核心结论
论文指出,我们不应该使用“一刀切”的方法来捕捉 AI 的错误。
- 如果 AI 在早期就锁定了错误的观点,我们应该通过观察其早期的置信水平来快速捕捉它,并且不要费力去寻求它的“第二意见”(因为它只会重复错误)。
- 如果 AI 是真的感到困惑,我们应该让它完成思考过程,然后要求它提供多个意见,看看它是否能达成一致。
通过了解 AI 是如何失败的,我们可以选择正确的工具来捕捉错误,从而节省时间并提高可靠性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。