M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models
本文介绍了 M3Kang,这是第一个源自袋鼠数学竞赛的大规模多语言、多模态数学推理数据集,它通过 108 种语言将最先进的视觉语言模型与人类表现进行基准测试,并揭示了它们在基础数学和基于图表的推理方面的当前局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下一场名为“袋鼠数学竞赛”(Kangaroo Math Competition)的巨型全球数学竞赛。每年,来自 90 多个国家、超过 六百万名 18 岁以下的青少年都会参与其中。他们解决各种棘手的数学谜题,有些只是文字描述,但许多题目需要观察图表、形状和图片才能得出答案。
现在,想象一下来自高通 AI 研究院(Qualcomm AI Research)的研究团队决定将这场竞赛变成一场针对人工智能的大规模测试。他们构建了一个名为 M3Kang 的新工具。你可以把 M3Kang 想象成一个集“通用翻译官”和“数学老师”于一身的数据集。
以下是他们所做工作的简单拆解以及他们的发现:
1. 这个宏大项目:构建终极数学测试
研究人员将原始的数学题目(原本主要为加泰罗尼亚语和英语)翻译成了 108 种不同的语言。
- 规模: 他们不仅仅是翻译了文字;他们还将题目中的图片和图表也保留了下来。这最终形成了超过 111,000 道独特的数学题。
- 目标: 他们想看看 AI 模型(聊天机器人和图像生成器背后的“大脑”)是否能在非英语环境下解决数学问题,以及它们是否真的能“看到”并理解图表,而不仅仅是阅读文本。
2. 他们是如何构建它的(流水线作业)
创建一个如此大规模的数据集就像建立一条工厂流水线。
- 第一步: 他们将原始的 PDF 文档转换成干净的文本图像。
- 第二步: 他们使用 AI 先将问题翻译成英语,并反复检查这种翻译是否破坏了数学逻辑。
- 第三步: 他们使用了一种聪明的“回译”技巧来检查其他 108 种语言。想象一下,将一个句子从西班牙语翻译成英语,然后立即将其从英语翻译回西班牙语。如果结果与原文不符,说明翻译质量很差。他们利用这种方法自动过滤掉错误的翻译。
3. 结果如何:AI 表现得怎么样?
他们用这个全新的测试题对现有的最智能的 AI 模型(包括免费/开源的和昂贵/闭源的模型)进行了测试。以下是他们的发现:
- “英语优势”是真实存在的: 就像一个只在英语环境下学习的学生可能会在法语课堂上感到吃力一样,AI 模型在处理英语数学问题时表现得更好。随着语言变得在互联网上不那么常见(如斯瓦希里语或马耳他语),AI 的表现显著下降。这就像 AI 在更换语言后就“忘记”了如何做数学。
- 规模很重要(但并非万能): 更大的 AI 模型通常表现更好。然而,即使是最大的、最聪明的模型,在基础逻辑和图表方面也表现挣扎。
- “盲区”问题: 这是最令人惊讶的发现。当人类参加测试时,他们实际上觉得带有图片的题目比纯文字题目更容易;但对于 AI 来说,情况正好相反!当涉及图片时,AI 模型的表现明显变差。这就像一个擅长读文字题的学生,一旦遇到图表就会不知所措。AI 似乎难以将文本与图像中的信息联系起来。
- AI 对比人类: 他们将 AI 的得分与 68,000 名真实学生的得分进行了对比。
- 最优秀的 AI(Gemini-2.5-Pro)在英语环境下表现得像一名顶尖学生,但其表现会随着语言切换到低资源语言而降至“平均”或“低于平均”水平。
- 有趣的是,AI 并没有像人类那样随着题目难度增加而表现得越来越好。有时 AI 能搞定最难的题目,却在简单的题目上栽跟头,这表明它可能是在“猜测”或者在使用一种与人类儿童不同的推理方式。
4. 我们能修复它吗?
研究人员尝试了一些“训练技巧”来帮助 AI 更好地使用其他语言。
- “翻译官”技巧: 他们发现,如果告诉 AI:“先在脑海中将这个问题翻译成英语,解决它,然后再给出答案”,AI 在处理其他语言的数学问题时表现会好得多。这就像在考试前给学生一本字典。
- “引导”技巧: 他们尝试引导 AI 的内部思考过程,使其即便在说其他语言时也更具“英语思维”。这虽然有一定帮助,但“翻译官”技巧效果更佳。
核心结论
论文总结道,尽管 AI 正在变得极其聪明,但它仍然有一个巨大的盲点:它难以在不同语言之间结合阅读、视觉和思考。
研究人员公开了所有的相关数据和代码(开源),以便其他科学家可以使用这个“袋鼠测试”来构建更好的、更具包容性的 AI——这种 AI 不仅仅是会说英语,而是能在任何语言环境下,无论是配合图片还是纯文字,都能真正进行数学运算。他们希望这能帮助创造出真正全球化的、公平的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。