想象一下,你正在教一个机器人如何解决一个复杂的科学谜题,比如弄清楚桥梁是如何支撑的,或者计算卫星的轨道。你向机器人展示一张桥梁的图片以及问题的文字描述。
问题:“作弊码”机器人
目前,最智能的 AI 机器人(称为多模态大语言模型)就像那些擅长阅读但拙于观察的学生。当你给它们一个带有图表的科学问题时,它们往往会完全忽略图片。它们只是阅读文字,根据记忆猜测答案,然后说:“我解出来了!”
这篇论文将这种现象称为“模态坍塌”。这就像一名学生参加数学考试,看到了图表,却决定只读题目文字而忽略图表,因为这样更简单。现有的测试往往让它们蒙混过关,因为它们只检查最终答案是否正确。如果机器人不看图片就猜对了数字,测试就会说:“干得好!”但机器人实际上并没有学会如何利用视觉线索。
解决方案:STEPSTEM(“严格老师”)
作者们创建了一个名为STEPSTEM的全新、非常严格的测试。这就像是为机器人举办的一场“研究生级别”的考试,迫使它们展示解题过程。
- 陷阱:他们设计了 283 个棘手的问题,如果不看图就无法解决。仅凭文字是死胡同;图片才是关键。这就像一场寻宝游戏,地图(图像)是找到宝藏的唯一途径,而线索(文字)如果没有地图则毫无用处。
- 要求:机器人不能只给出答案;它必须一步步展示解题过程,在撰写文字和绘制图片之间交替进行。这就像要求学生解决物理问题时,先写一段解释,然后画一个受力分析图,接着写下一步,再画一个新的示意图,如此循环。
- 评分:作者们没有只检查最终数字,而是构建了一个“智能评分器”,审视每一个步骤。
- 机器人是否查看了图片的正确部分?(他们使用“边界框”作为数字便利贴来检查这一点)。
- 文字是否与绘图相符?
- 机器人是否遵循了逻辑路径,还是直接跳到了结论?
结果:机器人仍在学习
当他们让顶尖机器人通过这个严格测试时,结果令人惊讶:
- “仅文本”专家:那些只能撰写文本的最强大机器人(如 Claude Opus 4.6 和 Gemini 3.1 Pro)答对了约**38%**的题目。它们在文本部分表现尚可,但在绘图部分完全失败,因为它们根本无法绘图。
- “全能型”机器人:那些既能阅读又能绘图的机器人(如 Gemini 2.5 Flash Image)在绘图方面表现更好,但它们仍然难以给出正确答案。它们能画出图片,但往往逻辑错误。
- 巨大差距:论文发现,即使是最优秀的机器人,也远未成为真正的“视觉思考者”。它们过度依赖文本,尚未学会真正地将“看”与“思”结合起来。
核心启示
论文认为,我们需要停止只问机器人“答案是什么?”,转而问“向我展示你是如何得出这个结论的”。
想象一名侦探。如果一名侦探解决了案件,却没有查看指纹或犯罪现场照片,即使他们猜对了名字,我们也不会相信他们的结论。STEPSTEM就是这样一个工具,它迫使 AI 侦探查看证据(图像),并一步步解释这些证据是如何推导出结论的。
作者们总结道,虽然 AI 正变得越来越聪明,但在能够像人类专家那样真正“看见”并“思考”科学问题之前,它还有很长的路要走。他们希望这项新测试能帮助研究人员构建出不仅会猜测,而且能真正理解视觉世界的机器人。
技术摘要:揭示细粒度视觉痕迹:评估多模态 STEM 任务中的多模态交错推理链
问题陈述
多模态大语言模型(MLLMs)已展现出令人瞩目的推理能力,但其在科学、技术、工程和数学(STEM)等专业领域的表现仍难以进行严格评估。当前的基准测试存在三个主要局限:
- 模态冗余与捷径:许多现有数据集允许模型仅依赖文本描述而绕过视觉证据,导致“模态坍塌”,即视觉 grounding 能力薄弱。
- 缺乏结构化视觉推理:训练数据中科学图表、示意图和曲线的代表性不足,且模型难以生成带有精确符号和逻辑约束的结构化视觉内容。
- 结果导向的评估:现有协议几乎完全关注最终答案的准确性。这忽视了中间推理步骤的质量、忠实度和连贯性,使得难以区分真正的跨模态推理与表面的捷径。
方法论
作者提出了STEPSTEM,这是一个旨在强制实施严格的文本 - 视觉互补性并在步骤级别评估推理的基准测试与评估框架。
1. 数据构建(STEPSTEM 基准测试)
- 范围:该数据集包含工程、物理、化学、数学、生物学及其他领域的 283 道研究生级别问题。
- 互补性强制:问题的筛选确保解决方案无法仅从文本或仅从视觉中推导得出。这包括“强依赖”问题(需要几何/空间推理)和“推理简化”问题(视觉内容可减少语义歧义)。
- 多解轨迹:每个问题均标注了一个或多个真实解轨迹。这些轨迹是文本推理与视觉证据(图像/图表)的交错序列。
- 视觉标注:针对视觉推理步骤,专家使用边界框(BBoxes)标注相关的局部证据,以实现图像对齐的细粒度监督。
- 任务多样性:该基准测试包含 14 个绘图任务,其最终输出为图像,将评估范围从“图像 - 文本到文本”扩展至“图像 - 文本到图像”。
2. 评估框架
作者提出了一种超越最终答案准确性的步骤级评估协议:
- 局部对齐分数:
- 文本步骤:利用基于注意力展开的语义相似度(通过 Qwen3.5-9B)结合单调动态规划,将预测步骤与参考步骤进行对齐,允许跳过琐碎步骤但保留时间顺序。
- 视觉步骤:比较基于 BBox 锚定的参考特征与来自预测图像的滑动窗口特征。应用多样性惩罚以防止单张通用图像满足多个不同的视觉步骤。
- 全局逻辑覆盖:基于大语言模型的评判器评估完整预测轨迹是否涵盖了参考解决方案所需的所有关键文本命题和视觉证据,奖励语义蕴含而非逐字匹配。
- 指标融合:局部分数与全局分数通过加权均方根(RMS)进行融合。当存在多个参考解决方案时,该框架报告融合分数的最大值,以避免惩罚有效的替代推理路径。
- 最终答案评估:文本和视觉最终答案分别评估其正确性。
主要贡献
- STEPSTEM 基准测试:一个精心构建的包含 283 道研究生级别 STEM 问题的数据集,强制实施严格的文本 - 视觉互补性以消除单模态捷径。它包含带有交错文本和视觉步骤的多解轨迹。
- 细粒度评估框架:一种新颖的步骤级评估协议,评估中间多模态推理步骤(局部对齐和全局覆盖),而不仅仅是最终结果。它利用动态规划和多样性惩罚来处理交错的图像 - 文本推理。
- 全面的实证分析:对代表性 MLLM(包括统一模型、交错生成模型和仅理解模型)的评估揭示了当前能力的显著差距。研究表明,步骤级分数与最终答案准确性高度相关,但能提供更具有诊断性的模型行为视角。
实验结果
实验在各类模型上针对 269 个文本答案问题和 14 个图像答案问题展开:
- 整体难度:当前的 MLLM 在研究生级别的多模态 STEM 推理方面表现显著吃力。表现最佳的仅理解模型(Gemini 3.1 Pro, Claude Opus 4.6)在文本答案问题上的准确率仅为38.29%。表现最佳的统一模型(Gemini 2.5 Flash Image)在图像答案问题上的准确率为50.80%。
- 模态局限性:
- 仅理解模型(如 Claude Opus 4.6)在文本相关过程指标(Local-T, Global-T)上得分较高,但在所有图像相关指标(Img. Acc., Local-I, Global-I)上得分为0%,证实它们无法生成视觉中间步骤。
- 统一模型(如 GPT-5.4 + GPT-Image)取得了最高的融合过程分数(71.52)和强大的图像生成能力,但最终的文本答案准确率仍然有限(33.21%),表明它们能生成合理的视觉结构,但在将其有效整合以解决复杂问题方面存在困难。
- 交错生成模型(如 Janus-Pro, OmniGen2)显示出产生中间视觉内容的非平凡能力,但未能产生正确的基于图像的最终答案(准确率为 0%)。
- 过程与结果:步骤级分数与最终答案的正确性高度相关。导致正确答案的轨迹 consistently 获得了更高的融合过程分数。然而,步骤级评估揭示,某些模型可能通过推理轨迹不佳却得出正确答案,而另一些模型遵循连贯路径却在最后一步失败。
- 多参考效用:使用多个真实解被证明至关重要。单参考评估可能会不公平地惩罚有效但结构不同的推理路径。多参考方法提高了评估的稳定性和公平性。
意义与主张
本文主张 STEPSTEM 定位为多模态推理细粒度评估的基准。其意义在于:
- 揭示模态差距:它突显了即使是最先进的模型也严重依赖文本推理,缺乏真正的跨模态 STEM 推理能力。
- 转变评估范式:它认为最终答案的准确性不足以应对复杂的多模态任务。所提出的步骤级框架提供了更具信息量的诊断信号,区分偶尔猜对答案的模型与遵循合理、基于 grounding 的推理过程的模型。
- 未来研究方向:作者认为 STEPSTEM 将支持多模态过程监督、面向推理的数据构建以及更忠实跨模态推理系统开发的未来研究。
本文结论指出,虽然当前模型展现出希望,但在真正的跨模态 STEM 推理方面仍有“巨大的提升空间”,且评估推理过程本身对于推动该领域发展至关重要。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。