← 最新论文
🤖 AI

SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning

本文介绍了 SeePhys Pro 基准,该基准揭示了当前多模态模型在从文本到图像的模态迁移方面存在困难,并表明多模态 RLVR 训练带来的表面提升往往源于残留的文本线索,而非真正的视觉推理能力。

原作者: Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhe
发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang, Junjie Yu, Jiacong Lu, Shangrui Huang, Heng Li, Likui Zhang, Kunkun Liu, Changzheng Zhang, Yangle Fang, Boqiang Guo, Hui-Ling Zhen, Dandan Tu, Yinya Huang, Xiaodan Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生如何解决一道物理题。你有两种提供信息的方式:1. 教科书法:你用文字写出题目,描述场景、数值和规则。2. 图解法:你画出场景的示意图,标注各部分,并将数值直接写在图上。直观上,只要信息相同,你会预期聪明的学生无论收到文字还是图片,解题能力都同样出色。但这篇名为 SEEPHYS PRO 的论文发现,对于当前的人工智能模型而言,事实并非如此。事实上,当你从文字切换到图片时,它们的表现会显著变差。以下是研究人员发现的要点,辅以简单的类比说明。### 1. “同一故事,不同格式”测试研究人员创建了一项名为 SEEPHYS PRO 的特殊测试。你可以将其视为人工智能的“翻译挑战”。对于每一道物理题,他们创建了四个版本,讲述完全相同的故事,但改变信息的呈现方式:* 等级 1(纯文本):“一个物块重 5 千克,位于斜坡上。”(所有信息均为文字)。* 等级 2(结构在图中):他们画出了斜坡和物块,但文字仍显示"5 千克”。(形状是图片,数值是文字)。* 等级 3(变量在图中):他们画出了斜坡和物块,并在图片中的物块上直接写上"5 千克”。(形状数值现在都在图片中)。* 等级 4(全图):整个题目,包括指令和数值,都手写在一页纸上,并扫描为一张图片。发现:当人工智能模型尝试这些测试时,随着信息从文字转移到图片,其表现急剧下降。* “读取标签”瓶颈:性能下降最显著发生在 等级 3。这是人工智能必须查看图片并“锚定”变量的时刻(例如:“好吧,那条波浪线是导线,旁边数字'12'代表 12 伏特”)。* 类比:想象一位能完美遵循书面食谱(等级 1)的厨师。如果你递给他们一张带有标签的食材照片(等级 3),他们突然忘了如何烹饪。他们能看到图片,却无法将标签"2 杯面粉”与照片中实际的面粉袋对应起来。他们被视觉绑定搞糊涂了。### 2. “蒙眼训练”实验随后,研究人员提出了第二个问题:如果我们使用强化学习(RL)在数千道带图的物理题上训练这些人工智能,它们会变得更擅长阅读图片吗?为了测试这一点,他们设计了一项“盲训”实验。 正常训练:人工智能看到题目文字图片。 盲训:人工智能看到题目文字,但图片被完全涂黑(遮蔽)。这就像在给学生进行物理题训练时让他们戴上眼罩,但老师仍给予相同的“正确答案”奖励。令人震惊的结果:尽管人工智能是在完全没有图片(只有黑屏)的情况下进行训练的,它们在包含图片的未遮蔽测试中表现依然有所提升。* 类比:想象一名学生在车窗被涂黑的车里练习驾驶考试。他们从未见过道路。然而,当他们最终在车窗打开的情况下参加真实考试时,驾驶得更好了。* 原因:研究人员发现,人工智能并非在学习如何“看”路。相反,它在学习捷径。它记住了文本中的模式、问题的风格或典型的答案。它学会了根据文本的“氛围”来猜测正确答案,而不是真正分析视觉图表。### 3. 准确率的“魔术”论文得出结论:当我们看到人工智能的分数上升时,不应仅仅欢呼。我们需要问:它们是真的学会了“看”,还是仅仅变得更擅长根据文本线索进行猜测? * “盲增”:即使训练图像毫无用处(黑色),人工智能的分数依然提高了。这证明提升来自于文本和数据集的模式,而非视觉理解。* 差距依然存在:即使经过训练,人工智能在处理图片密集型版本(等级 3 和 4)时,表现仍比纯文本版本更差。“模态差距”(文本表现与图片表现之间的差异)并未缩小。### 总结* 问题:当前的人工智能模型是“文本主导”的。它们非常擅长阅读物理题,但在“看”题方面表现极差,尤其是当它们需要直接从图表中读取数值和标签时。* 陷阱:标准的训练方法(强化学习)可以通过提升其基于文本的猜测能力,使人工智能看起来更聪明,即使它从未真正学会解读视觉证据。* 教训:要真正让人工智能“看”懂,我们不能仅仅衡量它是否得出了正确答案。我们必须测试它得出正确答案是否* specifically 是因为它查看了图片*,而不仅仅是因为它识别出了文本模式。这篇论文本质上说的是:不要被高分蒙蔽。如果一个人工智能在不看图片的情况下就能解决问题,那它就没有真正学会“看”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →