VisEditBench: Can Vision-Language Models Edit Visualization Code from Multimodal Feedback?
本文介绍了 VisEditBench,这是一个包含 1,395 个人工标注任务的综合基准测试,旨在评估视觉语言模型根据多模态反馈编辑可视化代码的能力,揭示了当前模型存在的显著性能差距,并提出了 VisEditAgent,一个能够大幅提高编辑准确性的渲染落地框架。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位刚刚从食谱中学会如何做完美蛋卷的厨师。你可以遵循指令、打蛋,并翻转平底锅。但如果你的朋友吃了一口,皱起眉头说:“太咸了,而且底部的芝士焦了。”或者,如果他递给你一张不同蛋卷的照片并说:“我想让我的这个看起来和这张一模一样。”突然间,你的工作不再仅仅是遵循食谱;而是关于如何修复一个错误,或是在保持鸡蛋和热度恰到好处的同时模仿一种风格。这就是数据可视化的世界,计算机试图将数字转化为像图表和图形这样的图像。
一段时间以来,科学家们一直在教计算机如何从头开始编写制作这些图像的“食谱”(代码)。但在现实世界中,我们很少只是想要一张全新的图片;我们通常是已经有一张看起来有点奇怪的现有图片,或者我们想改变它的风格以匹配一份报告。这被称为多模态反馈:利用文本指令、实际的图表图像以及生成该图表的代码的组合,来告诉计算机需要修复什么。核心问题在于:这些智能计算机是否真的能“看到”图表哪里出了问题,并在不破坏底层数据的情况下将其修复?
这篇题为 VisEditBench 的论文引入了一个全新的游乐场,专门用于测试这一点。研究人员构建了一个包含 1,395 个真实世界编辑挑战的大型集合,就像是为 AI 制图师准备的一场“路考”。他们发现,虽然最优秀的 AI 模型在编写代码方面正变得越来越好,但在根据视觉反馈修复图表方面仍然相当笨拙。顶尖模型 Claude-4.6-Sonnet 成功通过了约 74.46% 的测试,但大多数开源模型表现挣扎,保持在 50% 以下。最难的部分在哪里?是改变图表风格以匹配参考图像;即使是最强的模型也只做对了 55.71%。
为了帮助这些模型变得更好,作者创建了一个名为 VisEditAgent 的新工具。可以将它想象成给 AI 一个“尝试、失败并修复”的循环。这个代理不仅仅是猜测一次答案,而是编写几种不同版本的代码,实际绘制出图表,检查它们看起来是否正确,然后不断微调直到完美为止。当他们使用这种方法配合一个强大的模型时,成功率从 55.75% 跳升至 67.99%。这表明,修复图表的秘诀不仅在于聪明,更在于能够审视自己的作品,意识到错误,并尝试再次改进。论文总结道,尽管我们正在取得进展,但要教会计算机像人类设计师那样细致地编辑可视化图表,仍是一个正在进行中的课题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。