← 最新论文
💬 NLP

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

本文介绍了 MM-THEBench,这是一个旨在评估多模态大语言模型中间推理步骤中幻觉现象的全面基准测试,填补了现有评估忽略后训练推理模型内部思维过程的空白。

原作者: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一支由超级聪明、多才多艺的侦探组成的团队(这些就是多模态大语言模型,简称 MLLMs)。这些侦探非常擅长观察一张图片、阅读一张图表或观看一段视频,然后破解谜团。

在过去,这些侦探只会大声喊出他们的最终答案:“嫌疑人是管家!”但最近,他们接受了训练,学会了在开口说话之前先大声思考。他们会写下一长串线索和逻辑步骤(称为思维链CoT),以此来解释他们是如何得出结论的。

问题在于,有时即使侦探写下了一长串华丽的步骤,其中某些步骤也可能是彻头彻尾的谎言(幻觉)。然而,凭借纯粹的运气或者跳过了这些谎言,他们仍然能喊出正确的最终答案。

这篇论文介绍了一个名为 MM-THEBENCH 的新工具,专门用于在侦探思考的过程中抓住他们撒谎的行为。

新的侦探训练场:MM-THEBENCH

MM-THEBENCH 想象成一个高科技的“测谎仪”,它专门针对思考过程,而不仅仅是最终答案。

1. 三种类型的谎言(分类法)
作者意识到,当侦探撒谎时,通常会属于以下三类之一。他们创建了一个清单来识别它们:

  • “虚假记忆”谎言(知识): 侦探编造了一个他们在学校学到的事实。例如:“我确信埃菲尔铁塔在伦敦。”(事实并非如此)。
  • “视力不佳”谎言(感知): 侦探看着照片,却看到了并不存在的东西。例如:“我看到一辆红色的车,”而那辆车实际上是蓝色的。
  • “逻辑错误”谎言(推理): 侦探看到了正确的事物,但连接逻辑的方式错了。例如:“这辆车是蓝色的,而蓝色的车很快,所以这辆车是法拉利。”(逻辑错误)。

2. 评分系统(细则)
MM-THEBENCH 不仅仅检查最终答案的正误,而是将侦探的思考过程分解为微小的原子级步骤。

  • 想象一道数学题。其“金标准”解法包含 5 个特定的步骤。
  • 系统会将侦探 20 步的思考过程与这 5 个金标准步骤进行对比。
  • 它会询问:“你真的看到那辆车了吗?你知道关于三角形的规则吗?你的计算正确吗?”
  • 它会对每一个步骤进行评分,精准标记出“谎言”发生的具体位置。

他们的发现(结果)

作者使用这个新测试对 14 个世界上最聪明的侦探模型(包括 GPT-5、Claude 和 Gemini 等知名模型)进行了测试。以下是他们的发现:

1. “正确答案”陷阱
仅仅因为侦探得到了正确的最终答案,并不意味着他们思考得正确。

  • 类比: 想象一个学生在参加数学考试。他写下了一段胡言乱语,编造了数字,逻辑也是错的,但他最后猜对了最终数字并拿到了正确答案。
  • 发现: 许多模型即使其“思考步骤”充满了幻觉,也能得到正确答案。思考过程并不是对他们如何解决问题的忠实解释。

2. “视力不佳”与“逻辑错误”的区别
这是一个令人惊讶的发现:

  • 感知幻觉(视力不佳): 这些现象经常发生。模型经常会误认物体或颜色。然而,这很少会毁掉最终答案。 模型可能认为车是红色的而不是蓝色的,但它仍然能判断出车是在移动。
  • 推理幻觉(逻辑错误): 这些很罕见,但致命。 如果模型搞错了逻辑(例如,本该是“如果 A 则 C”,它却认为是“如果 A 则 B”),最终答案几乎总是错的。
  • 启示: 有一个视力不佳的侦探,总比有一个大脑坏掉的侦探要好。

3. “过度思考”问题
研究发现,当模型被要求进行更长时间的思考(更多步骤)时,它们并不一定会变得更聪明。

  • 类比: 想象一个不停写笔记的侦探。前 5 条笔记非常精彩,接下来的 15 条笔记只是他在喃喃自语、重复自己或者编造新的事实。
  • 发现: 随着思考过程变长,“精确度”会下降。模型会生成大量多余的、无用的或幻觉式的步骤,仅仅是为了填补空间。他们在“过度思考”,并逐渐偏离真相。

核心结论

论文认为,我们不能再仅仅信任模型给出的最终答案。我们需要观察他们是如何得出答案的。

MM-THEBENCH 就像一个放大镜,迫使我们去观察侦探的笔记本。它向我们展示了,虽然这些 AI 模型在解决问题方面变得越来越好,但它们的内部“思考”过程往往是混乱的,充满了小小的谎言,有时甚至与现实完全脱节。要让它们真正可靠,我们需要修复它们的思考过程,而不仅仅是它们的最终答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →