← 最新论文
🤖 machine learning

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

本文通过实证研究刻画了思维模式视觉语言模型中答案熵行为的三种不同模式,证明了推理链熵是比答案熵更可靠的不确定性信号,并实现了一种能够显著提升在对抗性和推理任务上准确率且无成本的弃权机制。

原作者: Mayank Singal

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Mayank Singal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它非常喜欢解谜题。通常情况下,当你问它一个问题时,它会思考一瞬间,然后脱口而出答案。但最近,新一代的这类机器人开始做一些不同的事情了:在给出最终答案之前,它们会在一个特殊的 ... 框内写下一整条“思维链”——一段关于其推理过程的长长的、步进式的日记。这就像是在看它们在点咖啡之前,先在餐巾纸上涂鸦笔记一样。

核心问题是研究人员提出的:如果这些机器人在如此努力地思考,我们能否判断它们何时感到困惑或即将犯错?

答案中的“无声尖叫”

传统上,为了检查机器人是否不确定,我们会观察其最终答案有多“抖动”。如果机器人很自信,它的答案就很稳定;如果它很困惑,答案就会摇摆。这被称为答案熵(answer entropy)

但这里有一个转折,这篇论文发现了:对于这些会“思考”的新型机器人,观察最终答案就像是在飓风中试图听清一声耳语。

当研究人员测试名为 Qwen3-VL-8B-Thinking 的模型时,他们发现,在机器人完成思维链的那一刻,它完全锁定了它的最终答案。这种“抖动”消失了。机器人的最终答案变得如此自信,以至于不确定性信号降到了 0.492(这基本上就是抛硬币,或者说是纯粹的随机概率)。就好像机器人完成了所有的思考,决定了一条路径,然后大声喊出答案,以至于你根本听不到任何怀疑的声音。

论文明确反对这样一个观点,即我们可以仅仅通过观察最终答案来发现这些思考型模型的错误。事实上,对于 Qwen 模型来说,观察最终答案甚至比随机猜测还要糟糕,因为机器人在错误的答案上表现得过于自信了。

真正的线索:思维日记

那么,如果最终答案是一个死胡同,我们该看哪里呢?论文建议我们去看思维链本身——即机器人在说话之前写的那些“餐巾纸笔记”。

研究人员发现,思考的过程 蕴含着秘密。他们测量了思维链内部的“混乱度”或“摇摆度”。

  • 对于 Qwen 模型: 思维链的信号得分是 0.647,这比最终答案那毫无用处的 0.492 要好得多。
  • 对于另一个模型 GLM-4.1V-9B-Thinking: 最终答案其实还可以 (0.716),但思维链甚至更好 (0.759)。
  • 对于第三个模型 InternVL3-8B: 它仅在约 50% 的问题上使用思维链。当它进行思考时,思维链的信号略好于答案,但最重要的线索仅仅在于它是否决定进行思考。如果它跳过了思维链,它出错的可能性就更高。

论文指出,思维链起到了“预承诺”信号的作用。它是机器人的内在挣扎。如果机器人在弄清楚答案的过程中非常吃力(思维链熵值高),它稍后出错的可能性就更大。如果它思考得很快且平滑,它很可能就是正确的。

“拒绝”之门

这些机器人还有另一种奇怪的行为。有时,它们并不给出答案,而是直接停止。它们“弃答”(abstain)。

  • 在一项测试(POPE)中,Qwen 机器人有 22.1% 的时间拒绝回答。
  • 在另一项测试(HallusionBench)中,比例为 12.6%

论文注意到一个有趣的模式:当询问不存在的事物(缺席物体)时,机器人比询问存在的事物时更容易选择退出。这就像机器人是在说:“我看不见你说的那个幽灵,所以我不会瞎猜。”

研究人员展示了,如果我们建立一个简单的“门控”机制,即:“如果机器人的思维链太长或太乱,或者如果它拒绝回答,那我们就直接跳过这个问题”,我们可以大幅提升准确率。

  • 没有门控时,机器人的正确率为 71.0%
  • 使用门控后(并跳过了约 37% 最难的问题),机器人在剩余问题上的准确率跃升至 93.8%

这并不是解决所有问题的万能药,但它是一个实用的技巧:如果机器人在“流汗”(思维链长且乱)或者拒绝参与,那么它的答案很可能是不值得信任的。

其他类型的问题如何?

研究人员还在开放式问题(不仅是“是/否”问题)上进行了测试。他们发现了同样的模式:思维链比最终答案更能预测错误。

  • 对于自由形式的答案,最终答案的信号非常糟糕 (0.467,比抛硬币还差)。
  • 但思维链的信号很强 (0.733)。

这表明问题不仅仅在于“是/否”问题;思维链是比最终目的地更可靠的信心地图。

总结

论文得出结论,对于这些新型的“思考型”机器人,你不能通过最终答案来判断它们是否不确定。 思考的行为使它们的不确定性坍缩了,让它们看起来即便在错误时也极其自信。

相反,我们必须倾听思考过程本身。推理链中的“混乱”才是真正的信号。虽然这在他们测试的模型(Qwen 和 GLM)中效果很好,但作者建议我们需要检查这是否也适用于更大的模型,或者当我们改变机器人的思考方式(例如让它随机猜测而不是总是选择最优解)时是否依然成立。不过目前来看,如果你想知道一个思考型机器人是否在产生幻觉,不要看它说了什么,要看它是如何思考的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →