← 最新论文
💬 NLP

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

本文介绍了 Math-PT,这是一个包含 1,729 道源自欧洲和巴西本土竞赛及考试的数学问题的新基准数据集,该数据集揭示出:尽管最先进的语言模型在多项选择题上表现良好,但其在视觉和开放式任务上的能力却有所下降。

原作者: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLMs)就像那些几乎读遍了世界图书馆中所有书籍的杰出学生。多年来,我们一直使用完全以英语编写的考试来测试它们的数学能力。这就像只给学生用英语进行驾驶测试,然后便假设他们能用任何语言完美驾驶,仅仅因为他们通过了那一次测试。

MATH-PT 这项研究指出,这种方法存在巨大的盲点。它引入了一种全新的“驾驶测试”,专门用葡萄牙语(包括欧洲葡萄牙语和巴西葡萄牙语变体)编写,旨在检验当语言发生变化时,这些人工智能学生是否真正掌握了数学。

以下是其研究发现的简要解析,辅以简单的类比:

1. 问题所在:“仅英语”的图书馆

大多数数学基准测试(如 MATH 或 MathVista)就像一座所有书籍都用英语写成的图书馆。即使研究人员试图测试其他语言,他们也仅仅是翻译了英语书籍。作者指出,这是不公平的,因为这无法告诉我们人工智能是否真正理解了数学概念,还是仅仅死记硬背了英语模式。他们希望建立一个数学题库,其中的题目诞生于葡萄牙语,取材于真实的葡萄牙和巴西数学奥林匹克竞赛及学校考试。

2. 新测试:MATH-PT

该团队创建了一个名为MATH-PT的数据集,包含1,729 道题目

  • 来源:他们并非简单翻译,而是深入挖掘了如葡萄牙数学奥林匹克(Olimpíadas Portuguesas da Matemática)和巴西OBMEP等竞赛的原始档案。
  • 多样性:该测试涵盖了从五年级的谜题到大学入学前的挑战等所有内容。
  • 格式:它包含选择题(类似答题卡)和开放式问题(需要从头写出答案)。关键在于,许多题目包含图表和插图(如几何图形),团队通过代码精心保留了这些内容,以便人工智能能够“看见”它们。

3. 结果:“聪明者”与“挣扎者”

他们测试了 13 种不同的人工智能模型,从最强大的“前沿”模型(超级天才)到较小的开源模型(普通学生)。

  • 选择题的优势:将选择题想象成一种“找不同”的游戏。人工智能模型在这方面表现非常出色。即使是较小的模型,也常常能猜出正确的字母(A、B、C、D 或 E)。
  • 开放式问题的挣扎:当测试转向开放式问题(人工智能必须自行生成答案)时,得分大幅下降。这就像是在一排人中认出某张脸,与凭记忆画出那张脸之间的区别。当人工智能必须自己“思考”并写出答案,而不仅仅是进行选择时,它遇到的困难更大。
  • “图像”问题:这是最大的障碍。如果问题包含图表(图像),人工智能的性能就会急剧下降。即使是最聪明的模型,在需要解读文本旁边的视觉形状时也会陷入困惑。这就像让一个学生蒙着眼睛解几何题;他能读懂文字,却无法“看见”形状。

4. 赢家与输家

  • 冠军:“前沿”模型(如 GPT-5 和 Qwen3-235B)是明确的赢家。它们很好地应对了葡萄牙语数学,尤其是选择题部分。
  • 挣扎者:较小的开源模型(如 Llama-3 和 Gemma-3)觉得数学要困难得多。一旦问题变得更难或包含图像,它们的准确率就会急剧下降。
  • 缩放效应:该研究发现,对于 Qwen 系列模型,增大模型规模(增加更多的“脑力”)非常有效。这就像从自行车换到跑车;较大的模型在处理复杂的推理任务方面比较小的模型表现好得多。

结论

这项研究得出结论:人工智能虽然在数学方面表现日益出色,但仍存在“语言偏差”,并且在测试变得更难(开放式)或更具视觉性(图表)时会遇到困难。通过发布这个葡萄牙语数据集,作者向研究人员提供了一把新的、公平的尺子,用以衡量人工智能在英语之外的语言中实际思考的能力。他们并非声称人工智能已经完美;他们说:“这是一个新测试,能准确告诉我们人工智能还在哪里学习。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →