Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation
本文介绍了 Vision2Code,这是一个无需参考代码、面向多领域的基准测试与评估框架,它通过渲染模型输出并使用领域特定的评分标准对其进行打分,从而评估图像到代码的生成能力,揭示了在空间与复杂视觉领域存在的显著性能差距,同时证明了经过筛选的输出能够有效提升模型训练效果。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一幅复杂的绘图,比如房屋蓝图、化学结构图或财务图表。现在,想象你要求计算机查看这张图片,并写出从头开始重绘该图所需的精确指令集(代码)。
这正是论文Vision2Code所探讨的内容。它是一项新的“测试”(基准),旨在评估人工智能模型将图像还原为可编辑代码的能力。
以下是该论文核心思想的分解,辅以简单的类比:
1. 问题所在:“像素与蓝图”之间的鸿沟
将图像想象成蛋糕的照片。如果你只看照片,你能看到蛋糕,但若不编辑像素(这会让画面显得杂乱),你就难以轻松更改糖霜的口味或移动樱桃。
然而,如果你拥有食谱(即代码),你就可以轻松地将糖霜改为巧克力味,或移动樱桃。
- 旧测试:以往针对人工智能的测试类似于提问:“你能画出一个看起来像这张照片的蛋糕吗?”这些测试要么聚焦于狭窄的主题(例如仅限图表),要么要求人工智能手头持有原始食谱以便进行比对。
- 新测试(Vision2Code):这项测试提问的是:“你能看着这张蛋糕照片,写出一份新食谱,使得按照该食谱制作的蛋糕在外观和表现上与原版完全一致吗?”关键在于,测试并不向人工智能提供原始食谱,仅提供照片。
2. 挑战:并非只有一种类型的绘图
作者们意识到,绘制条形图与绘制 3D 房间或电路板截然不同。
- 类比:想象一场要求你绘制地图的测试。
- 图表/图形:就像绘制地铁线路图。线条需要连接,站点名称必须正确。
- 化学:就像绘制分子结构。如果你将一个原子替换为另一个,整个结构就错了。
- 文档:就像复制一页密集的新闻报纸。每个单词和每一列都至关重要。
- 3D 场景:就像绘制具有深度的房间。如果桌子看起来像是漂浮的或扁平的,绘图即告失败。
Vision2Code涵盖了这六大类别中的15 种不同类型的图像。这就像是为人工智能绘图举办的“多项运动”奥运会,而不仅仅是针对某一种特定图像类型的短跑比赛。
3. 评分系统:“严苛的艺术评论家”
你如何给人工智能的绘图打分?
- 旧方法:一些测试只是将新图像与旧图像逐像素进行比较(就像检查两张照片是否完全相同)。这并不好,因为线条的微小偏移对人类来说可能看起来完美,却会在像素检查中失败。
- Vision2Code 的方法:他们使用VLM 评分器(一种人工智能评委),其角色如同严苛的艺术评论家。
- 人工智能生成代码。
- 代码运行并生成新图像。
- “评论家”将新图像与原始图像进行比较。
- 转折:“评论家”针对不同任务使用不同的规则手册。
- 对于化学结构图,规则手册规定:“如果原子错误,即使颜色看起来不错,也得零分。”
- 对于图表,规则手册规定:“如果坐标轴上的数字错误,则不及格。”
- 他们还设有“护栏”。如果人工智能犯下巨大且明显的错误(例如将分子倒置绘制),分数会自动被压低,从而防止人工智能用一张漂亮但错误的绘图来欺骗系统。
4. 结果:人工智能在某些方面表现良好,在其他方面则不然
该论文测试了 9 种不同的人工智能模型(有些免费,有些昂贵)。
- 好消息:最好的模型在绘制图表和图形方面正变得非常出色。它们可以观察条形图并编写代码,几乎完美地重现该图。
- 坏消息:模型在处理复杂、特定任务时仍显吃力。
- 3D 场景:它们经常将 3D 物体扁平化为 2D,丧失了深度感。
- 化学与电路:它们会混淆符号或连接关系。
- 文档:它们会遗漏文本或弄乱布局。
- 结论:仅仅因为人工智能擅长绘制简单图表,并不意味着它理解电路图的深层结构。这种技能是“领域依赖”的。
5. “自我训练”技巧
该论文还尝试了一种巧妙的技巧,旨在无需更多人类教师的情况下提升人工智能的能力。
- 理念:人工智能尝试绘制图像,“评论家”对其进行评分。
- 筛选:如果人工智能在第一次尝试中获得了高分,但在被要求再次重绘其自己的绘图时却失败了,这意味着人工智能只是运气好或记住了某种模式,而非真正理解了结构。
- 结果:通过仅在那些“首次得分高但第二次尝试失败”的示例上训练人工智能,他们帮助模型掌握了“棘手”的部分。这显著提升了较小模型(Qwen3.5-9B)的性能,证明了这种“评论家”能够教导人工智能如何更好地绘图。
总结
Vision2Code是一项更新、更公平且更全面的人工智能测试。它不再询问“这看起来像照片吗?”,而是开始询问“这段代码是否真正重建了图像的结构?”它表明,虽然人工智能在绘制简单图表方面已取得长足进步,但在完美重现复杂科学图表、3D 场景或密集文档之前,仍有很长的路要走。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。