← 最新论文
💬 NLP

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

本文揭示了推理模型中存在显著的“放大-提升差距”(Amplification-Lift Gap),即训练会放大诸如自我修正和不确定性确认等审慎行为,而这些行为并不一定能预示正确性,却未能充分提升诸如置信度校准和知识对齐等高价值行为。

原作者: Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

发布于 2026-08-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一位魔术师表演戏法。你看到他在夸张地挥动手部,自言自语,并在揭晓最后一张牌之前反复检查了三次牌。在观察者看来,这像是深思熟虑、极其谨慎。但如果这位魔术师实际上是在恐慌呢?如果所有的这些“思考”其实只是紧张的坐立不安,而戏法的真正秘密其实是一个瞬间完成的、简单且隐蔽的手法呢?

这正是科学家们试图用被称为“思考模型(thinking models)”的新一代人工智能来解决的谜题。这些 AI 系统经过训练,会在给出答案之前写出长长的、逐步的解释,就像学生在数学考试中展示解题步骤一样。核心问题在于:写下更多的文字和表现出更多的犹豫,真的意味着 AI 更聪明吗?还是它仅仅是在演戏?为了理解这一点,我们需要知道,AI 研究人员一直试图通过让计算机生成这些长长的思维链来教会它们“推理”。人们曾寄希望于如果 AI 能把问题说透,它就会犯更少的错误。但直到现在,我们还没有一种好的方法来分辨 AI 到底是在正确地思考,还是仅仅在装模作样。

一个研究小组决定扮演侦探的角色来调查这个问题,他们分析了来自 15 个不同 AI 模型的 15,000 多个推理轨迹。他们创建了一个特殊的清单,或者说“分类法(taxonomy)”,用来识别特定的行为。他们寻找的行为包括“自我修正”(承认错误并修复它)、“假设测试”(尝试不同的想法)以及“不确定性承认”(说“我不确定”)。他们还观察了一些更微妙的迹象,如“置信度校准”(知道何时该大胆,何时该谨慎)和“知识对齐”(使用正确的工具/事实来完成任务)。

研究人员引入了一种巧妙的新方法来衡量这些行为,称为“行为提升(Behavioral Lift)”。把它想象成一个风向标。如果某种行为(比如说“我不确定”)是正确答案的一个好兆头,风向标就会指向“晴朗”;如果这种行为通常出现在 AI 回答错误时,风向标就会指向“暴风雨”。他们比较了这些行为在新的“思考型”模型与旧的“指令型”模型中出现的频率,并检查了这些行为是否能预测正确答案。

这里是他们发现的转折点:这些“思考型”模型非常擅长“演戏”。它们说“我不确定”或尝试不同想法并随后改变主意的概率要高出 3 到 7 倍。它们充满了戏剧性的犹豫和自我修正。然而,研究人员发现,这些大声且戏剧化的行为并不是那些能够预测正确答案的行为。事实上,说“我不确定”往往是 AI 感到困惑且很可能得出错误答案的迹象。

真正的英雄是那些安静、稳定的行为,而“思考型”模型在这些方面并没有真正变得更好。与获得正确答案关联最紧密的行为是置信度校准(根据证据准确判断自己的确定程度)和知识对齐(使用正确的工具来完成工作)。这些行为在旧的、简单的模型中与在新的、华丽的“思考型”模型中同样常见。新的模型只是变得更吵闹、更犹豫了,但并不一定更准确。

这项研究表明,这些“思考型”模型其实非常擅长做一件事:恢复(recovery)。当一项任务很难且需要长期的、逐步的工作时(比如解决复杂的数学问题),思考型模型能更好地发现自己犯了错并进行修复。它们从错误中恢复的能力比旧模型高出约 2 到 3 倍。但在那些只需要快速识别模式的任务上,思考型模型有时表现得更差,因为它们会被自己冗长、迂回的思考所分散注意力。

因此,论文得出结论:仅仅因为一个 AI 听起来在努力思考,并不代表它真的在思考。这种脱节被称为“放大-提升差距(Amplification-Lift Gap)”:即训练让 AI 表现得更多的行为(如犹豫和自我修正),并不等同于让它变得更正确的行为。为了让 AI 更聪明,我们不应该只是告诉它要“思考得更久”或“表现得更犹豫”。相反,我们需要教它如何进行更好的校准——即知道自己何时是对的,何时是错的——以及如何使用正确的知识,而不是仅仅用戏剧性的怀疑来填满页面。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →