Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
本文介绍了 Diagram-MMU,这是一个包含 3.7k 个科学图表和 18.3k 个经过验证的问题的多模态基准测试,用于评估多模态大语言模型(MLLMs)在图表到代码解析、编辑及问答方面的能力,研究揭示了虽然模型在推理方面表现出色,但在非智能体设置下,它们在代码生成任务上仍面临困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正在撰写关于新发现论文的科学家。你有一张精美的图表展示你的数据、一张实验的电路图,或者是一个新药的分子结构。在过去,你可能会手绘这些内容,或者使用计算机程序制作一个图片文件(如 PNG 或 JPG)并将其粘贴到文档中。但现代科学家通常使用一种叫做 LaTeX 的特殊语言来编写论文,因为它的排版非常专业,且能完美处理数学公式。在 LaTeX 内部,有一个超级强大的工具叫做 TikZ。你可以把 TikZ 想象成一个精准的“机器人艺术家”指令集。你不是给机器人一张完成后的图片,而是给它一系列指令,比如“在这里画一个红色的圆”、“将这条线连接到那个点上”以及“在这里写下数字 5”。如果机器人完美地执行了这些指令,它就能画出你所需的精确图表,并且能完美融入你的论文中。
现在,想象你拥有一个超级聪明的计算机大脑,叫做多模态大语言模型(MLLM)。你可能会想:“如果这个大脑能读懂一张图片并理解其含义,它能不能直接看着我的图表并为我写出 TikZ 指令呢?”这正是这篇论文要解决的核心问题。科学家们希望这些 AI 大脑能够观察一个图表,理解背后的科学原理,然后编写代码来重现它,甚至根据简单的请求对其进行修改(比如将柱状图变成折线图)。这是所谓的“氛围写作”(vibe writing)趋势的一部分——你只需描述你想要什么,AI 就会完成繁重的体力活。但 AI 真的具备这种能力吗?还是它只是在假装理解?
Diagram-MMU 的研究人员决定建立一个巨大的、严谨的测试来查明真相。他们创建了一个基准测试(标准化测试),其中包含 3,744 个独特的科学图表和 18,305 个不同的问题与任务。这些图表涵盖了六个不同的科学领域:图表(如坐标图)、平面几何、3D 形状、网络图、化学分子和电路图。他们不仅要求 AI 观察图片,还针对三个具体的挑战对其进行了测试:
- 解析(Parsing): 观察一个图表并从零开始编写绘制它的代码。
- 编辑(Editing): 观察一个图表及其对应的代码,然后根据新的指令修改代码(例如“把电阻器变成蓝色”或“把这个并联电路变成串联电路”)。
- 问答(Question Answering): 观察图表并回答有关其中科学内容的疑问(例如“总电阻是多少?”)。
他们还测试了 AI 是否能作为一个知道何时查找信息的得力助手。他们给了 AI 一个特殊的“搜索工具”来查找 TikZ 语法(即该语言的规则),以防它卡壳;并且测试了 AI 是否能够规划步骤:“首先,我需要理解图片,然后我会查找规则,接着我会编写代码。”
那么,他们的发现是什么呢?结果既让人“惊叹”,又让人“担忧”。AI 模型在思考图表方面表现得其实非常好。当被问及“哪根柱子最高?”或“这两个组件是否相连?”这类问题时,模型大多都能答对(准确率高达 86%)。它们理解科学!
然而,当涉及到编写代码来绘制这些图表时,模型却表现得非常吃力。即使是最优秀的模型,也只能将大约 31% 到 57% 的基础构建块(如圆圈、线条和文本)放在正确的位置。这就像 AI 可以详细地描述一座完美的房子,但当它尝试用砖块实际建造时,却把窗户装在了屋顶上,把门装在了地板上。论文指出,虽然这些模型擅长逻辑推理,但在将图像转化为精确代码所需的细粒度视觉感知方面,仍然相当糟糕。
研究还观察了给 AI 提供“搜索工具”(让它查找规则)是否有帮助。对于编辑任务,这确实有一点帮助。但对于问答任务,这往往会让情况变得更糟,因为 AI 会被过多的信息搞混,或者提出错误的问题。其中一个模型 Claude-4.6 Opus 脱颖而出,它是最稳定的,在获得搜索工具后,它在所有三项任务中的表现都有所提升,但大多数其他模型都表现得并不理想。
简而言之,这篇论文揭示了一个有趣的差距:今天的 AI 可以成为一位完美理解你图表的博学科学家,但当它试图使用 TikZ 语言进行绘画时,它仍然是一个笨拙的艺术家。作者希望这项测试能帮助开发者构建更好的工具,以便在未来,科学家们可以真正通过“氛围感”将图表构思变为现实,而不必担心代码问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。