← 最新论文
💬 NLP

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

本文介绍了 ChartAnno,这是一个包含 1,200 张真实世界图表的基准测试,旨在评估多模态大语言模型生成图表注释的能力,并揭示了虽然特定的指令和专有模型能产生更好的结果,但推断抽象意图和利用图表图像仍然是重大的挑战。

原作者: Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名宇宙飞船的船长,你的计算机刚刚绘制了一张美丽而复杂的星图。这张地图非常完美,但它是沉默的。它展示了星星,但没有告诉你它们为什么在那里,哪些是最危险的,或者宝藏藏在哪里。为了让这张地图变得有用,你需要添加注释、箭头和标签——这就是图表注释(chart annotation)。这是一种将原始图像转化为任何人都能理解的故事的艺术。

在人工智能的世界里,有一些超级聪明的机器人叫做多模态大语言模型(Multimodal Large Language Models, MLLMs)。你可以把它们想象成能够同时阅读文本、观察图片并编写计算机代码的机器人。我们已经教会了它们理解图表,甚至从零开始绘制新的图表。但存在一个棘手的差距:这些机器人能否看着一张现有的图表并添加出正确的注释来解释它?这不仅仅是画一条线那么简单;它关乎于弄清楚这条线意味着什么,然后编写代码将标签精准地放在它该在的位置。这就是这项研究试图解决的挑战:教导 AI 成为数据的得力导游,而不仅仅是一个绘图员。

于是,CHARTANNO 应运而生——这是研究人员创建的一个全新的“训练场”,用于测试这些 AI 机器人执行这项特定工作的水平。研究人员构建了一个包含 1,200 张真实世界图表(涵盖了从新闻图表到科学论文的各种类型)的海量库,并为每张图表配上了一组指令。他们并没有只给机器人一种类型的指令;他们通过三个不同详细程度的等级进行了测试,就像带有难度递增的电子游戏一样:

  1. “模糊目标”等级: 机器人被告知:“突出显示最重要的趋势。”它必须猜测这意味着什么以及如何展示它。
  2. “行动计划”等级: 机器人被告知:“在 1890 年到 1900 年之间画一个紫色方框,并在中间放一个标签。”它知道要做什么,但必须搞清楚确切的颜色和大小。
  3. “蓝图”等级: 机器人得到了一份食谱:“从 x=0 到 x=10 画一个紫色方框,使用特定的紫色调,并将文本放置在坐标 (4, 15) 处。”

研究人员随后要求 10 种不同的 AI 模型(包括一些由大型科技公司开发的模型和一些开源模型)编写用于添加这些注释的计算机代码。他们检查了代码是否真的有效、图表看起来是否正确、含义是否清晰以及设计是否美观。

以下是他们的发现,结果可谓喜忧参半。首先,大厂模型(如来自 Google 和 OpenAI 的模型)仍然是冠军,它们在理解“模糊目标”并创造精美设计方面表现最好。然而,一些开源模型正在快速追赶,其中一个名为 Kimi K2.5 的模型表现得几乎与那些昂贵的闭源巨头不相上下。

这项研究还揭示了关于这些机器人思维方式的一些惊人真相。当指令非常具体时(“蓝图”等级),机器人的表现非常好。但当指令很模糊时(“模糊目标”等级),它们经常出错,难以猜测图表中最重要的部分究竟是什么。这就像给一位厨师一份带有精确测量值的食谱,与仅仅说“做点好吃的”之间的区别:机器人非常擅长遵循食谱,但在如何成为一名具有创造力的厨师方面仍在学习中。

另一个有趣的发现是关于机器人需要看到什么。你可能会认为,向机器人展示图表的图片会对它很有帮助。但研究人员发现,将创建该图表的代码交给机器人则要重要得多。图片对让注释看起来更美观确实有一定帮助,但如果没有代码(代码包含了实际的数据数字和结构),机器人就会迷失方向。事实上,如果只给它们看图片而隐藏代码,它们的表现会大幅下降。事实证明,对于这些 AI 机器人来说,了解图片背后的数学逻辑比仅仅看图片本身更有用。

最后,研究人员指出,随着图表复杂度的增加,任务难度也会随之上升。如果一个图表拥有大量数据点,或者需要一段漫长且复杂的代码更改来添加注释,即使是最聪明的机器人也会开始犯错。它们可能会写出无法运行的代码,或者把标签放在错误的位置。

简而言之,CHARTANNO 表明,虽然 AI 在绘制和阅读图表方面已经做得非常出色,但教导它通过注释来解释图表仍处于开发阶段。这些机器人非常擅长遵循严格的指令,但在自主理解“大局观”方面仍需要帮助。研究人员希望这个新的测试能帮助构建更好的 AI 工具,使它们有一天能够将任何令人困惑的图表转化为清晰、有用的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →