U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs
本文介绍了 U-MATH,这是一个包含 1,100 道涵盖六个核心学科且具有 20% 多模态内容的开放式大学水平问题的全新基准测试,以及用于评估解题判定的 -MATH 数据集,旨在揭示当前大语言模型在多模态推理及准确评估数学解题能力方面的显著局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图给大学数学作业批改作业的老师。长期以来,你用来给学生(AI 模型)评分的“测试”就像是小学测验:简单的选择题,最聪明的孩子也能轻松应对。但现在,这些学生(AI)在这些简单测试中的表现已经太好了,以至于这些测试已无法分辨谁是真正的天才,谁只是在瞎猜。
你分享的论文介绍了 U-MATH 和 µ-MATH,它们就像是一场全新的、专门为大学水平数学设计的、难度极高的期末考试,并附带了一份特殊的“教师指南”,旨在帮助更公平地评分。
以下是他们工作的详细拆解,使用了简单的类比:
1. 新的考试:U-MATH
问题所在: 之前的测试要么太简单,要么覆盖范围太窄。它们大多涵盖高中话题,或者仅仅是多项选择题,AI 可以不实际做题就猜出正确答案。此外,它们很少包含图片或图表,尽管现实中的数学经常会用到这些。
解决方案: 作者创建了 U-MATH,这是一个包含了 1,100 道全新、未发表的题目 的集合,直接取自美国真实的大学课程。
- 难度: 这些不是简单的测验。它们是开放式的,这意味着 AI 必须写出完整的解题过程,而不仅仅是选择“A、B、C 或 D”。
- 视觉元素: 大约 20% 的题目包含图像,如图形、几何形状或数据表。这就像是要求 AI 在看一张蓝图的同时解决数学问题,而不仅仅是阅读一段文字。
- 学科领域: 它涵盖了从代数到微积分的六个核心大学学科。
结果: 当他们在这些新考试上测试最聪明的 AI 模型时:
- 纯文本形式: AI 在处理仅含文字的问题时表现得相当不错(正确率约为 93%)。
- 视觉形式: 当涉及图片时,AI 的表现显著下降,正确率跌至约 58%。这就像是一个 AI 虽然能完美读懂食谱,但一旦需要看着食材的照片来判断该做什么菜时,就会陷入混乱。
2. 教师指南:µ-MATH
问题所在: 如何给这些开放式答案评分?如果一个学生写的是 x/2,而标准答案是 0.5x,这算对吗?如果负责给作业评分的 AI 犯了错,我们如何知道?通常情况下,我们只是信任 AI 为其自身评分,但论文表明,AI “评委”往往存在偏见或不一致性。
解决方案: 他们创建了 µ-MATH(读作 "mu-math")。你可以把它想象成一个针对教师的“元考试”(meta-exam)。
- 他们选取了部分 U-MATH 题目,并让四种不同的顶尖 AI 模型生成了答案(其中包含正确和错误的答案)。
- 然后,他们要求其他 AI 模型充当“评委”来为这些答案评分。
- 至关重要的一点是,他们让人类专家验证了正确答案,因此他们确切知道谁是对的,谁是错的。这使得他们能够测试这些“评委”AI 到底有多好。
结果:
- 评分很难: 即便是最好的 AI 评委,也只能做到大约 90% 的评分准确率。它们并不完美。
- 优秀的学生不代表优秀的老师: 一些 AI 模型在解决数学问题方面非常出色,但在评分方面却表现糟糕;另一些模型则恰恰相反。
- 偏见: 评委们有自己的“偏好”。例如,有些评委对某些 AI 模型的答案过于严苛,而对另一些模型则过于宽松,而这与数学本身是否正确无关。
3. 核心启示
- “视觉差距”: AI 在结合数学与图像方面仍然很弱。这就像是一个学生能在脑海中进行心算,但一看到图表就会不知所措。
- 专业化至关重要: 专门针对数学进行过训练的小型 AI 模型(如专门的数学辅导老师)在处理这些难题时,往往能击败庞大的通用型模型。
- “评委”问题: 我们不能仅仅信任 AI 来给 AI 评分。论文表明,判断数学与解决数学是两种完全不同的技能,目前的 AI 评委仍容易出错并表现出偏见。
总结
作者构建了一个大学水平的数学测试(U-MATH),以观察 AI 真正的智能水平;并构建了一个评分测试(µ-MATH),以观察 AI 评分员是否公正。他们发现,虽然 AI 在基于文本的数学方面做得很好,但在视觉数学方面仍然很吃力,而且目前还不具备作为完美的老师来为自己的工作评分的可靠性。他们将所有这些数据免费开放,以便研究人员能够构建更好、更诚实的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。