← 最新论文
🤖 AI

AnnoBench: A Benchmark for Visualization Annotation Generation

本文介绍了 AnnoBench,这是一个旨在通过在多种图表类型和提示词规范下,利用 VLM-as-a-judge 评估方法系统地测试视觉、语义和风格约束,从而评估并推进可视化注释自动化的新型基准测试。

原作者: Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在看一张地图。地图非常适合展示事物的位置,但有时你需要一个小小的注释来提醒:“注意,这里有一条龙!”或者“这条路通往宝藏。”在数据世界中,这些注释被称为标注(annotations)。它们是帮助我们理解图表的文字标签、箭头或高亮显示。但制作这些注释非常棘手。如果你把注释放错了位置,它可能会遮盖掉它本该解释的数据。如果你写错了事实,你可能会误导人们,让他们以为趋势在上升,而实际上是在下降。

长期以来,计算机在阅读这些地图和图表方面已经变得非常出色。我们构建了“智能”计算机大脑(称为大语言模型和视觉语言模型),它们可以观察图表的图片并告诉你它表达了什么。但“阅读”图表与“修复”图表之间存在着巨大的鸿沟。这就像是一个能读懂外语路标的游客,与一位能够重新编写路标而不导致建筑物坍塌的当地导游之间的区别。我们一直缺乏一种好的方法来测试这些“计算机导游”是否真的能胜任这项工作。这正是本论文所解决的问题。

新的测试:AnnoBench

来自犹他大学的研究团队决定构建一个巨大的、高度组织化的测试,名为 AnnoBench。你可以把它想象成一个专门设计的超级障碍赛场,用来测试计算机是否能在不弄乱任何东西的前提下,给图表添加一个便签。

以前,如果你想测试计算机阅读图表的能力,你会问它类似这样的问题:“最高的柱状图是多少?”或者“描述一下这张图片。”但要求计算机“添加”一个标签要困难得多。它必须同时完成三件事:

  1. 找到正确的位置: 它必须准确知道应该指向图表的哪个部分。
  2. 讲述真相: 它必须确保它所写的实事确实有数据支持。
  3. 不破坏图表: 它在添加注释时不能遮盖数据,也不能让图表看起来很奇怪。

为了进行这项测试,团队创建了一个包含约 342 张图表的数据集。这些不仅仅是简单的绘图;它们来自真实的专业新闻文章(如《纽约时报》和《经济学人》)以及流行的编程库。他们通过改变挑战的“成分”来确保测试的公平性。有时他们给计算机一张图表的图片(如 JPEG 格式),有时给它构建图表的代码(就像一份食谱),有时则两者兼有。他们还改变了向计算机下达指令的方式:有时给出一个模糊的提示,如“高亮显示大波浪”;有时给出极其具体的指令,如“在 1980 年到 2020 年之间的波浪周围画一个框”。

重大发现:计算机擅长听令,但不擅长猜测

当他们运行测试时,发现了一些非常清晰的模式。他们学到的最重要的一点是,你如何提问比你想象的更重要。

如果你给计算机一个模糊的提示(意图提示/intent prompt),它往往会变得偷懒。它可能会添加一个简单的文本标签,而实际上该图表需要的是一个阴影框或一个特定的箭头。这就像是你请一位朋友,“让这个房间看起来更好看一点”,而他们只是移动了一盏灯。但如果你给他们具体的指令(执行提示/execution prompt),比如“把灯移到角落并把墙涂成蓝色”,他们就会做得好得多。论文指出,目前的计算机非常擅长遵循严格的规则,但在自主构思最佳设计策略方面仍然相当糟糕。

另一个巨大的发现是关于你向它们展示什么样的图表。研究人员发现,给计算机一张图表的图片(位图图像/raster image)简直是一场灾难。尽管计算机能看到图片,但当它尝试添加注释时,它往往会意外地改变数据。它可能会拉伸一个柱状图或移动一条线,仅仅是为了给文本腾出空间。这就像是用记号笔在照片上写字;你可能会不小心把照片中的脸涂掉。

然而,当他们给计算机构建图表的代码(特别是 D3.js 代码)时,计算机的表现要好得多。它们可以完美地添加注释而不会破坏底层数据。事实证明,计算机在编辑“食谱”(代码)方面比编辑“蛋糕”(图片)要擅长得多。

“裁判”问题

团队还尝试使用其他智能计算机来对结果进行评分,这种方法被称为“VLM 作为裁判”(VLM-as-a-Judge)。他们想看看一个计算机能否判断另一个计算机做得好不好。他们发现,这些计算机裁判在处理基于代码的图表时表现尚可,但在处理基于图片的图表时表现得很差。当一个计算机在图片上添加了一个注释并意外扭曲了数据时,计算机裁判往往会说“看起来很好!”,因为它认为注释在视觉上的位置是正确的。但人类看着同样的结果会说:“等等,你改变了数字!”这表明我们目前还不能完全信任计算机来评判这些任务,尤其是在涉及图片的时候。

这意味着什么

这篇论文并不声称计算机已经解决了图表标注的问题。事实上,它表明计算机还有很长的路要走。主要的启示是,要让计算机编写好的图表注释,我们需要给它们正确的工具(例如代码,而不是仅仅是图片)以及非常清晰的指令。

研究人员建立了一个专门的网站——AnnoBench Browser,以便任何人都可以亲自尝试这些测试。他们希望这能帮助开发者构建更好的工具。就目前而言,教训很明确:如果你想让计算机为图表做标注,不要只给它一张图片然后说“修一下”。给它代码,告诉它具体要做什么,并且可能还需要保持人类的监督,以防万一。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →