← 最新论文
💻 computer science

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

本文介绍了 PatternEval,这是一个揭示了混合思考型多模态大语言模型(MLLM)在思考模式与非思考模式之间存在系统性响应模式失配的诊断基准,并提出了 PatternRL,一种带有特定模式惩罚的强化学习框架,旨在对齐这些行为并同时保持任务性能。

原作者: Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Ya
发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在和一个超级聪明的机器人朋友聊天,它能看懂图片、阅读图表并解决棘手的谜题。有时,你会要求这个机器人“深思熟虑”后再回答,给它额外的时间来逐步拆解问题。而有时,你想要一个快速的答案,所以你会让它“直接猜一个”或者直接给出响应,而不进行冗长的思考过程。这就是**多模态大语言模型(MLLMs)**的世界——即能够同时理解文本和图像的 AI 系统。科学家们正在追问的大问题不仅仅是“答案是否正确?”,而是“无论是在深思熟虑还是在快速猜测时,机器人的表现是否一致?”如果机器人在经过思考后给出了完美的答案,但在被要求快速回答时却泄露了它的内心独白、重复自身、或前后矛盾,那就是个问题。我们希望我们的 AI 无论给予多少时间去思考,都能保持可靠且得体。

这篇题为**《超越正确性:基准测试并对齐混合思维 MLLM 中的响应行为》(Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs)**的论文,深入探讨了正是这样一个问题。研究人员发现,即使是最聪明的 AI 模型也存在一种奇怪的“人格分裂”。当它们被允许缓慢思考时,它们的表现就像冷静、专业的专家。但当被迫快速且不进行思考时,它们往往会变得混乱:它们会不小心将内部的“思考过程”泄露到最终答案中,重复同样的句子,同时表达两个相反的观点,或者在没有实际进行任何推理工作的情况下假装在推理。

为了证明这一点,研究团队构建了一个特殊的测试,名为 PatternEval,它就像一场专门设计用来捕捉这些混乱行为的“捉虫”考试。他们测试了 25 种不同的 AI 模型(包括 Qwen、Kimi 和 Claude 等知名模型),涉及 2,415 个复杂的图文谜题。结果令人大开眼界:即使是最先进的模型,在“思考模式”和“非思考模式”之间也表现出了巨大的差距。事实上,对于许多模型来说,快速、非思考模式在遵循基本对话规则方面失败的频率接近 48%,而慢速思考模式则要整洁得多。

为了解决这个问题,作者创建了一种新的训练方法,称为 PatternRL。你可以把它想象成不仅教学生把数学题做对,还要教他们写字工整,不要涂鸦或重复。他们训练了一个“裁判” AI(称为 PatternRM)来识别这四种特定的坏习惯:

  1. 思维链泄露(Chain-of-thought leakage): 将秘密的“思考”步骤泄露到最终答案中。
  2. 响应重复(Response repetition): 无缘无故地重复说同样的话。
  3. 逻辑矛盾(Logical contradiction): 对同一件事同时说“是”又说“不是”。
  4. 表演式推理(Performative reasoning): 在没有使用任何实际证据的情况下,假装在进行分析。

当他们将这种新训练应用于两个特定模型(Qwen3-VL-4B 和 Qwen3-VL-8B)时,快速模式下的混乱行为显著下降了约 13 到 14 个百分点,且并未损害模型获取正确答案的能力。然而,研究人员也注意到一个小小的权衡:模型在处理极难的数学和逻辑任务时,准确率略有下降,这表明强制要求它们变得“整洁”有时会阻碍它们探索那些虽然混乱但具有创造性的解题方式。

简而言之,这篇论文表明,仅仅因为一个 AI 能解决问题,并不意味着它已经准备好与人类交流了。要成为真正有用的工具,AI 不仅需要接受关于“说什么”的训练,还需要接受关于“如何说”的训练,以确保无论是在长时间思考还是快速回答时,都能保持礼貌且一致。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →