ChartAnno: Evaluating MLLMs for Chart Annotation Generation
本文介绍了 ChartAnno,这是一个包含 1,200 张真实世界图表的基准测试,旨在评估多模态大语言模型生成图表注释的能力,并揭示了虽然特定的指令和专有模型能产生更好的结果,但推断抽象意图和利用图表图像仍然是重大的挑战。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名宇宙飞船的船长,你的计算机刚刚绘制了一张美丽而复杂的星图。这张地图非常完美,但它是沉默的。它展示了星星,但没有告诉你它们为什么在那里,哪些是最危险的,或者宝藏藏在哪里。为了让这张地图变得有用,你需要添加注释、箭头和标签——这就是图表注释(chart annotation)。这是一种将原始图像转化为任何人都能理解的故事的艺术。
在人工智能的世界里,有一些超级聪明的机器人叫做多模态大语言模型(Multimodal Large Language Models, MLLMs)。你可以把它们想象成能够同时阅读文本、观察图片并编写计算机代码的机器人。我们已经教会了它们理解图表,甚至从零开始绘制新的图表。但存在一个棘手的差距:这些机器人能否看着一张现有的图表并添加出正确的注释来解释它?这不仅仅是画一条线那么简单;它关乎于弄清楚这条线意味着什么,然后编写代码将标签精准地放在它该在的位置。这就是这项研究试图解决的挑战:教导 AI 成为数据的得力导游,而不仅仅是一个绘图员。
于是,CHARTANNO 应运而生——这是研究人员创建的一个全新的“训练场”,用于测试这些 AI 机器人执行这项特定工作的水平。研究人员构建了一个包含 1,200 张真实世界图表(涵盖了从新闻图表到科学论文的各种类型)的海量库,并为每张图表配上了一组指令。他们并没有只给机器人一种类型的指令;他们通过三个不同详细程度的等级进行了测试,就像带有难度递增的电子游戏一样:
- “模糊目标”等级: 机器人被告知:“突出显示最重要的趋势。”它必须猜测这意味着什么以及如何展示它。
- “行动计划”等级: 机器人被告知:“在 1890 年到 1900 年之间画一个紫色方框,并在中间放一个标签。”它知道要做什么,但必须搞清楚确切的颜色和大小。
- “蓝图”等级: 机器人得到了一份食谱:“从 x=0 到 x=10 画一个紫色方框,使用特定的紫色调,并将文本放置在坐标 (4, 15) 处。”
研究人员随后要求 10 种不同的 AI 模型(包括一些由大型科技公司开发的模型和一些开源模型)编写用于添加这些注释的计算机代码。他们检查了代码是否真的有效、图表看起来是否正确、含义是否清晰以及设计是否美观。
以下是他们的发现,结果可谓喜忧参半。首先,大厂模型(如来自 Google 和 OpenAI 的模型)仍然是冠军,它们在理解“模糊目标”并创造精美设计方面表现最好。然而,一些开源模型正在快速追赶,其中一个名为 Kimi K2.5 的模型表现得几乎与那些昂贵的闭源巨头不相上下。
这项研究还揭示了关于这些机器人思维方式的一些惊人真相。当指令非常具体时(“蓝图”等级),机器人的表现非常好。但当指令很模糊时(“模糊目标”等级),它们经常出错,难以猜测图表中最重要的部分究竟是什么。这就像给一位厨师一份带有精确测量值的食谱,与仅仅说“做点好吃的”之间的区别:机器人非常擅长遵循食谱,但在如何成为一名具有创造力的厨师方面仍在学习中。
另一个有趣的发现是关于机器人需要看到什么。你可能会认为,向机器人展示图表的图片会对它很有帮助。但研究人员发现,将创建该图表的代码交给机器人则要重要得多。图片对让注释看起来更美观确实有一定帮助,但如果没有代码(代码包含了实际的数据数字和结构),机器人就会迷失方向。事实上,如果只给它们看图片而隐藏代码,它们的表现会大幅下降。事实证明,对于这些 AI 机器人来说,了解图片背后的数学逻辑比仅仅看图片本身更有用。
最后,研究人员指出,随着图表复杂度的增加,任务难度也会随之上升。如果一个图表拥有大量数据点,或者需要一段漫长且复杂的代码更改来添加注释,即使是最聪明的机器人也会开始犯错。它们可能会写出无法运行的代码,或者把标签放在错误的位置。
简而言之,CHARTANNO 表明,虽然 AI 在绘制和阅读图表方面已经做得非常出色,但教导它通过注释来解释图表仍处于开发阶段。这些机器人非常擅长遵循严格的指令,但在自主理解“大局观”方面仍需要帮助。研究人员希望这个新的测试能帮助构建更好的 AI 工具,使它们有一天能够将任何令人困惑的图表转化为清晰、有用的故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。