Vector-Bench: Can Models Surgically Edit SVG Code?
该论文介绍了 Vector-Bench,这是一个包含 40 个 SVG 修复任务的严谨基准测试,旨在评估基于指令的矢量编辑能力,结果显示即使是最强的模型也难以在不改变未请求元素的情况下进行手术式地应用请求的更改,其完全符合规范的成功率仅为 15.0%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为一名数字艺术家。你给它一张由代码构成的图片——就像是用指令而非颜料构建的数字绘画——然后对它说:“嘿,这张图里的太阳太大了;把它缩小,但不要碰云朵或山脉。”这就是**矢量图形(vector graphics)**的世界。与由彩色点组成的网格状标准照片不同,矢量图像是一个活生生的程序。它是一系列告诉计算机如何绘制线条、形状和颜色的指令列表。正因为它是由代码组成的,如果机器人改错了某一行,它不仅仅是让图片看起来很奇怪,它可能会破坏整个文件,导致以后无法打开或编辑。
科学家们提出的核心问题是:这些智能 AI 模型是否真的能够遵循指令来修复这段代码的特定部分,而不破坏其余部分?这有点像要求一位厨师在不改变温度、锅具或旁边面包配方的情况下,替换汤里的盐。如果 AI 只是让汤的味道对了,却把面包烤焦了,那就是失败,即使汤看起来很好。这就是**基于指令的编辑(instruction-based editing)*所面临的挑战:做到你要求的每一件事,并且仅*做你要求的事,同时保持代码的隐形结构完美无瑕。
于是有了 Vector-Bench,一个旨在测试 AI 模型是否能成为真正的“外科手术式编辑器”的新型且棘手的测试。研究人员创建了 40 个特定的谜题,其中一个 SVG 图像被“损坏”了——也许是火车门漂浮在了错误的位置,或者水母失去了触手。他们给了 AI 模型一条简单的、人类语言编写的指令,比如:“琥珀色信号灯熄灭了;修复它并让车站保持原样。”模型必须重写代码来修复信号,同时不能意外移动火车、删除站台,或破坏文件格式。
实验结果带来了一次现实的打击。研究人员测试了 34 种不同的 AI 模型,从廉价的小型模型到目前最强大的“前沿”模型。表现最好的模型 Claude Sonnet 5,能够完美完成整个任务——即修复错误、保持其他部分安全并生成有效文件——的成功率仅为 15.0%。没错:即使是最智能的 AI,在超过 10 次尝试中有 8 次以上都无法完全遵循指令。
然而,故事并不全是关于失败;它还关乎模型是如何失败的。论文发现,模型实际上在“修复”这一部分做得相当不错。平均而言,它们在请求的修复工作上取得可见进展的概率约为 43.7%。它们通常能让信号变亮或让门离得更近。但它们在“保持其余部分不变”这一部分表现得很糟糕。它们经常重命名不该改的名字,移动无关的对象,或者破坏代码结构导致文件失效。
这项研究明确排除了“看起来好看”等同于“运行正确”的可能性。一个模型生成的图像在人类眼中可能看起来修复好了,但如果底层的代码被重写或损坏了,那就是失败。研究人员通过使用一个严格的、计算机化的裁判证明了这一点,这个裁判不仅检查图片,还检查代码本身。他们发现,虽然模型可以进行一些修复,但要在不造成附带损害的情况下进行外科手术式的代码编辑,仍然是一个巨大的障碍。
简而言之,这篇论文表明,虽然 AI 在绘画和修复图片方面正在变得越来越好,但它在成为能够精确、谨慎地编辑使这些图片运作的代码的编辑器方面,仍然感到吃力。在“做出改变”与“做出正确的改变且不破坏其他任何东西”之间,仍然存在着巨大的鸿沟。作者发布了所有的实验数据、代码和结果,表明即使是最昂贵、最强大的模型,目前也更像是那种虽然解决了问题却不小心撞倒了书架的热情实习生,而不是我们所需要的精准外科医生。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。