← 最新论文
🤖 machine learning

Symbolic Graphics Programming with Large Language Models

本文介绍了用于评估大语言模型生成符号图形程序(SVG)能力的 SGP-GenBench,并提出了一种具有可验证奖励的强化学习方法,该方法显著提升了生成质量和语义对齐度,使开源模型的性能能够媲美前沿系统。

原作者: Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图向一位从未见过某幅画的朋友描述它。你可能会说:“在蓝色自行车旁边画一辆红色的汽车。”但自然语言是混乱的,充满了变数。你的朋友可能会画出一辆过大的汽车,或者一辆悬浮在空中的自行车,又或者那抹红色看起来更像粉色。这就是计算机试图将文字转化为图像时每天面临的挣扎。长期以来,科学家们一直教计算机使用像素来“梦见”图像,就像数字画家在画布上涂抹色彩一样。但还有另一种方法:符号图形编程(Symbolic Graphics Programming)。这种方法不是涂抹像素,而是让计算机编写一份精确的食谱——一套数学指令——来逐步构建图像,就像组装乐高积木或遵循严格的建筑蓝图一样。这种方法极其精确,但也很难做对。

于是,**大语言模型(LLMs)**登场了。这些是能够编写代码、讲笑话和回答问题的超级智能 AI 大脑。它们擅长遵循指令,但它们能编写出构建完美图像所需的特定“蓝图”吗?这就是这篇论文要解决的核心问题。研究人员想要知道:这些 AI 大脑能否学会成为视觉场景的高级建筑师,编写出绘制复杂世界所需的精确代码?如果它们自己做不到,我们能否教会它们变得更好?

论文的故事:教 AI 用代码绘图

研究人员首先测试了当前的最前沿技术。他们构建了一个巨大的测试,名为 SGP-GenBench,这就像是 AI 画家的“驾照考试”。他们给各种 AI 模型提供了一系列提示词,从简单的(“一辆红色的车”)到复杂的(“三个人骑在象背上”)。目标是看 AI 是否能编写出能够精确渲染出所要求内容的图像代码(具体来说是一种叫做 SVG,即可缩放矢量图形的类型)。

结果喜忧参半。“前沿”模型——即那些被大型科技公司使用的、昂贵的闭源模型——表现得相当不错。它们大多能把形状和颜色处理得当。但开源模型(即任何人都可以免费使用和研究的模型)却表现挣扎。它们经常写出完全无法运行的代码,或者画出的东西与提示词完全不符。这就像是在要求一个新手盖房子;他们可能把屋顶盖好了,但墙壁是歪的,或者门完全漏掉了。

于是,团队提出了疑问:我们如何修复这些开源模型?

他们并没有仅仅喂给模型更多用于记忆的例子。相反,他们使用了一种叫做**强化学习(RL)**的技术。你可以把它想象成训练一只狗,只不过对象是计算机。

  1. 尝试: AI 尝试编写图像的代码。
  2. 检查: 计算机将代码渲染成一张真实的图像。
  3. 奖励: 一个超级智能的“评委”(另一个经过训练、能够理解图像的 AI)会将结果与原始描述进行对比。
    • 如果 AI 写的代码导致崩溃或无法渲染,它会得到零分。
    • 如果图像看起来符合提示词,它会得到高分。
    • 如果图像接近但有少量错误,它会得到中等分数。

AI 随后利用这些分数进行学习。它会意识到:“噢,当我把太阳放在左上角时,分数就会提高。当我忘了给汽车装轮子时,分数就会降低。”经过数千次的尝试,AI 学会了游戏的规则。

出人意料的结果

结果令人印象深刻。经过这次“训练营”的磨练,开源模型(Qwen-2.5-7B)不仅有了进步,而且实现了一个飞跃,达到了可以与顶尖闭源模型竞争的水平。它从绘制混乱、破碎的涂鸦,进化到了能够创建整洁、细腻且准确的矢量图形。

但最引人入胜的部分不仅是最终的分数,还有 AI 在学习过程中是如何改变其行为模式的。研究人员观察了 AI “思维过程”的演变,并发现了它开始使用的两个酷炫技巧:

  1. 拆解任务: 在开始阶段,AI 会尝试用一大块混乱的代码来绘制一个复杂的物体(比如摩托车)。随着学习的深入,它开始将摩托车拆解成更小、更易于管理的部件:“首先,我来画车身。然后,我加上轮子。现在,让我们加上车把。”这就像一位厨师不再试图把所有食材一次性扔进锅里,而是开始仔细准备每一种食材。
  2. 添加“可选”细节: AI 开始添加一些并未明确要求、但能让画面感觉更真实的元素。如果你要求“人们坐在桌子旁吃蛋糕”,AI 可能会开始在蛋糕上添加糖粒或在桌子上添加碎屑。如果你要求一个海滩场景,它可能会添加波浪或沙子。这些并不是错误,而是让场景显得完整且自然的创意选择,表明 AI 开始理解场景的“语境”,而不仅仅是字面意思。

为什么这很重要

这篇论文表明,这种方法是一种强大的方式,可以教计算机如何在不需要数百万个完美范例作为起步的情况下学会“观察”和“绘画”。通过使用一个检查图像是否匹配文字的奖励系统,AI 学会了将其语言能力与视觉能力对齐。

研究人员发现,这种方法非常有效,以至于最初表现挣扎的开源模型,最终达到了与最先进的商业系统并驾齐驱的水平。他们还发现,AI 不仅仅是在死记硬背答案;它学会了一种策略,即将复杂的任务分解为更小、更可控的步骤,并添加有助于提升最终效果的细节。

简而言之,这篇论文展示了通过正确的训练方式——即让 AI 获得关于其“绘画”是否符合描述的即时反馈——我们可以将一个基础的语言模型转变为一个精确、富有创意且能力极高的图形程序员。这是迈向 AI 不再仅仅是“猜测”图像长什么样,而是真正懂得如何通过一行行精确的代码来“构建”图像的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →