← 最新论文
💻 computer science

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

本文介绍了 StepSTEM,这是一个包含 283 道题目的严谨研究生级别基准测试,并配备了一种新颖的细粒度评估框架,旨在评估多模态大语言模型中的细粒度跨模态推理能力,结果表明当前最先进的模型仍严重依赖文本捷径,而非真正的图文融合。

原作者: Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何解决一个复杂的科学谜题,比如弄清楚桥梁是如何支撑的,或者计算卫星的轨道。你向机器人展示一张桥梁的图片以及问题的文字描述。

问题:“作弊码”机器人
目前,最智能的 AI 机器人(称为多模态大语言模型)就像那些擅长阅读但拙于观察的学生。当你给它们一个带有图表的科学问题时,它们往往会完全忽略图片。它们只是阅读文字,根据记忆猜测答案,然后说:“我解出来了!”

这篇论文将这种现象称为“模态坍塌”。这就像一名学生参加数学考试,看到了图表,却决定只读题目文字而忽略图表,因为这样更简单。现有的测试往往让它们蒙混过关,因为它们只检查最终答案是否正确。如果机器人不看图片就猜对了数字,测试就会说:“干得好!”但机器人实际上并没有学会如何利用视觉线索。

解决方案:STEPSTEM(“严格老师”)
作者们创建了一个名为STEPSTEM的全新、非常严格的测试。这就像是为机器人举办的一场“研究生级别”的考试,迫使它们展示解题过程。

  1. 陷阱:他们设计了 283 个棘手的问题,如果不看图就无法解决。仅凭文字是死胡同;图片才是关键。这就像一场寻宝游戏,地图(图像)是找到宝藏的唯一途径,而线索(文字)如果没有地图则毫无用处。
  2. 要求:机器人不能只给出答案;它必须一步步展示解题过程,在撰写文字和绘制图片之间交替进行。这就像要求学生解决物理问题时,先写一段解释,然后画一个受力分析图,接着写下一步,再画一个新的示意图,如此循环。
  3. 评分:作者们没有只检查最终数字,而是构建了一个“智能评分器”,审视每一个步骤。
    • 机器人是否查看了图片的正确部分?(他们使用“边界框”作为数字便利贴来检查这一点)。
    • 文字是否与绘图相符?
    • 机器人是否遵循了逻辑路径,还是直接跳到了结论?

结果:机器人仍在学习
当他们让顶尖机器人通过这个严格测试时,结果令人惊讶:

  • “仅文本”专家:那些只能撰写文本的最强大机器人(如 Claude Opus 4.6 和 Gemini 3.1 Pro)答对了约**38%**的题目。它们在文本部分表现尚可,但在绘图部分完全失败,因为它们根本无法绘图。
  • “全能型”机器人:那些既能阅读又能绘图的机器人(如 Gemini 2.5 Flash Image)在绘图方面表现更好,但它们仍然难以给出正确答案。它们能画出图片,但往往逻辑错误。
  • 巨大差距:论文发现,即使是最优秀的机器人,也远未成为真正的“视觉思考者”。它们过度依赖文本,尚未学会真正地将“看”与“思”结合起来。

核心启示
论文认为,我们需要停止只问机器人“答案是什么?”,转而问“向我展示你是如何得出这个结论的”。

想象一名侦探。如果一名侦探解决了案件,却没有查看指纹或犯罪现场照片,即使他们猜对了名字,我们也不会相信他们的结论。STEPSTEM就是这样一个工具,它迫使 AI 侦探查看证据(图像),并一步步解释这些证据是如何推导出结论的。

作者们总结道,虽然 AI 正变得越来越聪明,但在能够像人类专家那样真正“看见”并“思考”科学问题之前,它还有很长的路要走。他们希望这项新测试能帮助研究人员构建出不仅会猜测,而且能真正理解视觉世界的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →