Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems
本文介绍了 Sci-Rho,这是一个包含 4,242 个跨越五个学科和七种语言的可执行 STEM 问题模板的多语言、视觉落地符号基准测试,它揭示了当前最先进的视觉语言模型在面对最差情况变体而非静态平均值进行评估时,存在显著的鲁棒性差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在测试一名新学生的科学解题能力。过去,研究人员会给学生一张单一的、静态的练习册,上面只有一张图片和一个问题。如果学生答对了,就算通过。但这篇文章指出,这就像只在一条空旷直行的路上测试驾驶员。它无法告诉你驾驶员是否能应对突如其来的坑洼、绕行或不同的天气状况。
这篇论文的作者们开发了 Sci-ρ,他们决定为 AI “学生”(特别是视觉语言模型,即 VLMs)设计一场更艰难、更动态的驾驶测试。
以下是他们所做工作及发现的简单拆解:
1. “变形”测试(数据集)
研究人员并没有直接给 AI 606 个静态科学问题,而是构建了一个数字工厂。
- 蓝图: 他们为数学、物理、化学、生物和计算机科学创建了 606 个“模板”。你可以把这些看作是母版蓝图。
- 工厂: 他们编写了计算机代码(Python),可以将这些蓝图瞬间打印出 10 个略有不同的版本。
- 示例: 如果一个数学题要求计算正方形的面积,工厂可能会打印出一个边长为 5 的版本,另一个边长为 7 的版本,或者一个颜色不同、甚至形状完全不同的版本。
- 多语言转折: 他们不仅用英语进行测试。他们将指令翻译成了 7 种语言(包括斯瓦希里语、印地语和阿拉伯语),同时保持图像不变。
- 结果: 他们最终得到了 42,420 个独特的问题。这就像是给了 AI 一个巨大的图书馆,里面的每本书都有 10 个不同的版本,它们都在询问相同的核心逻辑问题,但在外观上略有差异。
2. “平均值” vs. “最差情况”陷阱
研究人员在这座庞大的图书馆上测试了 17 种不同的 AI 模型。他们观察了两个分数:
- 平均准确率: AI 在处理一个问题的 10 个版本时,答对的频率。
- 最差情况准确率: AI 能够答对全部 10 个版本的频率。
重大发现:
AI 模型在“平均值”得分上表现出色。但当研究人员观察“最差情况”得分时,这些模型却崩溃了。
- 类比: 想象一个学生在 10 道数学题中答对了 9 道。他们看起来很聪明。但如果你要求他们再次解决这相同的 10 道题,只是稍微改变一下数字,而他们这次却错了 4 道,那么他们并不是真的在进行“逻辑推理”。他们很可能只是在记忆模式,或者根据数字的外观进行猜测。
- 发现: 即便是最强大、最昂贵的 AI 模型(如 GPT-5.4)也表现出了巨大的差距。它们可以轻松解决一个问题,但如果改变图表的颜色或微调数字,它们往往会失败。规模较小、成本较低的模型失败得更加严重。
3. 语言障碍
研究人员检查了 AI 是否在指令使用非英语语言时表现得更吃力。
- 大型模型: 那些巨型、昂贵的模型就像是通晓多国语言的人;它们处理英语、中文和斯瓦希里语的能力几乎一样好。
- 小型模型: 较小的开源模型则像是只会说英语的游客。当指令切换到较不常见的语言(如斯瓦希里语)时,它们的表现显著下降。尽管科学问题本身没变,但它们似乎会被语言的变化搞糊涂。
4. “眼睛 vs. 大脑”问题
研究人员窥探了一个 AI 模型内部是如何“思考”的。他们测量了模型对图片与文本的注意力分配。
- 发现: 模型的注意力会随着语言的变化而转移。
- 当文本是中文时,模型对图片的依赖程度降低,而对文本的依赖程度增加。
- 当文本是哈萨克语或印地语时,模型则高度依赖图片。
- 隐喻: 这就像是 AI 在想:“我不理解这种语言,所以我干脆根据图画来瞎猜。”当它完美理解语言时,它会更信任文字。这表明 AI 并不是以人类的方式在“看”图像;它只是在文本变得模糊时,将图像作为一种支柱。
5. AI 卡在了哪里
当 AI 出错时,研究人员对错误进行了分类:
- 读错图片 (63%): AI 无法正确数出图表中的点,或无法正确读取图表上的数字。
- 逻辑错误 (29%): AI 知道正确的公式,但将其应用到了错误的对象上,或者编造了并不存在的实事。
- 计算错误 (8%): AI 逻辑正确,但在简单的算术运算上出错。
核心结论
论文得出结论:静态测试在欺骗我们。 仅仅因为一个 AI 能解决某个特定的科学问题,并不意味着它理解了这项科学知识。它可能只是识别出了训练期间见过的一种模式。
要真正了解一个 AI 是否聪明,我们需要摇晃这张桌子,改变数字,更换语言,并观察它是否仍能解决问题。如果它不能,那它不是在推理,而是在猜测。Sci-ρ 就是旨在“摇晃这张桌子”的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。