← 最新论文
🤖 machine learning

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

本文介绍了“Math-Vision Diagrams”,这是首个旨在通过统一文本到代码(text-to-code)和文本到图像(text-to-image)范式,来评估大语言模型根据文本提示生成数学精确图表能力的全面基准测试,并揭示了该项关键技能目前存在的显著局限性。

原作者: Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何绘制一张完美的房屋蓝图。你不会仅仅对它说“画一个房子”,然后就指望它能画出笔直的墙壁并将门放在正确的位置。你需要精确地解释每个角在哪里,梁有多长,以及屋顶必须是一个特定的角度。这就是数学图表生成的世界。它处于两种超能力的交汇点:数学推理(知道三角形内角和必须是180度的逻辑大脑)与视觉创作(实际画出图像的艺术能力)。长期以来,计算机已经非常擅长观察图片并回答相关问题,或者编写代码来制作简单的图表。但要求一台计算机阅读一道文字题,然后从零开始绘制出完全符合数学逻辑的精确图表?这就像是要求一位厨师读完食谱后,立即烤出一个外观与照片完全一致的蛋糕,且奶油挤得完美无瑕、蛋糕层也均匀一致。这是一个巨大的挑战,因为数学是不允许“差不多就行”的。如果一条线偏离了一毫米,或者标签放错了位置,整个图表就会变得毫无用处,就像一张会把你带下悬崖的地图。

这正是 Pandita AI Inc. 的研究团队决定解决的问题。他们意识到,虽然我们有很多测试可以查看机器人是否能利用图片来解决数学问题,但我们并没有一种公平的方法来测试机器人是否能够首先创建这些图片。因此,他们建立了一个新的游乐场,名为 Math-Vision Diagrams。把它想象成一个巨大的、严谨的 AI 艺术课,老师(基准测试)给学生(AI)一段文字描述,并要求其画出一幅不仅要好看,而且在数学上必须完美无瑕的图画。

研究人员首先收集了来自真实竞赛的 3,040 道复杂数学题,涵盖了从几何到统计的所有内容。他们将这些题目筛选至 2,920 道高度依赖视觉图表的题目。然后,他们巧妙地结合了其他 AI 模型和人类数学专家,将原本有时含糊不清的问题陈述转化为清晰明确的指令。例如,不再只是简单地说“画一个圆”,新提示词会说:“画一个圆,其水平直径和垂直直径在中心点相交,并标记为‘O’”。他们甚至让专家进行双重检查,确保这些指令足够清晰,足以让一个人完美地画出该图,并按 1 到 5 分的规模进行评分。

一旦准备好这些“考题”,他们便对 11 种不同的 AI 模型进行了测试。其中一些模型就像是编写详细蓝图(代码)的建筑师,由计算机将代码构建成图像(文本转代码);另一些则像是数字画家,尝试直接根据描述进行绘画,而不先编写任何代码(文本转图像)。研究人员使用多种工具来衡量绘图与原始数学问题的匹配程度:检查线条和边缘是否完美对齐、整体视觉效果与目标的相似度,以及代码是否能正常运行而不崩溃。

结果既展示了令人印象深刻的进展,也带来了令人清醒的现实警示。研究发现,没有任何单一的 AI 模型是全才。“建筑师”模型(代码生成器)通常在处理数学和结构方面表现更好——比如确保正方形确实有四条相等的边——但它们经常无法完成任务,因为它们的代码无法编译,崩溃率约为 10% 到 30%。而“画家”模型(直接图像生成器)极其可靠,几乎总能生成图像,但它们的绘图往往缺乏精确的数学结构,线条略显歪斜,或者标签位置不对。

一个非常有趣的发现是,即使是最先进的模型,包括一些 AI 界的大名鼎鼎之辈,也面临着巨大的挑战。表现最好的模型 Claude Opus 4.6 虽然能让视觉外观和数学结构非常接近,但仍会出错。与此同时,一个名为 GPT-5.4 的模型表现得异常糟糕,经常创建过于复杂的绘图,但在数学上却是错误的,这表明有时“思考”过度反而会干扰绘图过程。研究人员还注意到,虽然简单的几何图形对于这些 AI 来说正变得易于掌控,但更复杂的课题,如统计图表或抽象的拓扑形状,仍然是一个巨大的障碍。

最终,这篇论文表明,我们仍处于这项技术的早期阶段。虽然 AI 现在可以生成看起来不错的图表,但它尚未掌握严肃数学和科学所需的“完美精度”。该团队已将其所有的资料、代码和测试工具向所有人开放,希望通过揭示这些模型在何处失败,来帮助构建下一代能够真正做到每次都能画出一个完美圆形的 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →