← 最新论文
💻 computer science

Scaling Properties of Text Conditioning in Visual Generation

本文揭示了扩散损失随提示词中结构化语言的量而变化,从而产生了一个能够增强可扩散性和可提示性,进而使系统在组合性和推理基准测试上超越开源模型并足以媲美顶级闭源模型的系统。

原作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人艺术家如何画画。长期以来,秘诀似乎是给机器人读更多的文字。其逻辑很简单:如果你用简短的句子描述一个场景,机器人可能会遗漏细节。因此,人们开始编写更长、更华丽的段落,希望更多的词汇等于更好的图像。这个研究领域被称为“文本生成图像”(text-to-image generation),即计算机将书面描述转化为视觉艺术。但问题在于:机器人不仅仅是在阅读文字,它还在尝试将这些文字与它以前见过的像素进行匹配。如果文字模糊不清或仅仅是重复,无论你使用多少词汇,机器人都会感到困惑。研究人员一直在探讨的一个重大问题是:描述的“长度”重要,还是“有用信息的量”重要?

这篇论文深入探讨了这个谜团。研究人员发现,仅仅在提示词中增加词汇量就像是用一根漏水的软管去填满一个水桶;最终,你只会弄湿脚,却填不满水桶。他们发现,真正的魔力发生在当你停止编写长篇故事,转而开始编写结构化、有组织的“蓝图”时。与其写一段话,不如使用一组具体的实事,比如“坐标 (10, 20) 处的一个红球”或“一只坐在蓝色椅子上的猫”。通过这种方式组织信息,机器人艺术家在开始绘画之前,实际上能在脑海中看到这幅图像。论文指出,这种结构化的方法让计算机的学习速度更快,并能创造出更好的图像,尤其是在处理包含许多物体的复杂场景时。

“更多词汇”的迷思 vs. “更好地图”的现实

多年来,AI 艺术界一直基于一个简单的假设:如果你想要更好的图片,就写更长的描述。这看起来很合逻辑。如果你对人类说,“画一只狗”,他们可能会画一只普通的狗。如果你说,“画一只毛茸茸的金毛寻回犬,戴着红色项圈,在阳光明媚的海滩上奔跑”,他们画出的东西会具体得多。因此,研究人员和爱好者开始向 AI 模型喂入海量的段落,希望更多的文本能迫使 AI 注意到更多细节。

但来自 ByteDance Seed 的本文作者决定测试这个“越多越好”的规则是否真的成立。他们使用一种“重建探针”(reconstruction probe)设计了一个巧妙的实验。想象你有一张完美的客厅照片。然后你要求 AI 用四种不同的方式来描述这个房间:一个短句、一个中等长度的段落、一篇长文章和一部超长的小说。至关重要的一点是,所有这些描述谈论的都是完全相同的事物;它们只是变得更加冗长和重复。

当他们将这些描述反馈给 AI,观察它是否能重新画出这个房间时,令人惊讶的事情发生了。随着描述变得越来越长,重新绘制的房间质量并没有变得更好。它保持得完全一样。AI 遇到了瓶颈。事实证明,一旦 AI 掌握了基本事实(有一张沙发,有一个灯),添加更多的形容词和华丽的辞藻并不能帮助它更好地理解图像。多余的词汇只是噪音。论文明确排除了仅仅增加 Token 数量(单词数量)就能提高图像质量的可能性。事实上,对于许多现有模型来说,让提示词过长反而会让结果变差。

秘密武器:结构化提示词

如果长段落不起作用,那么什么才有效呢?作者提出了从“讲故事”向“绘蓝图”的转变。他们引入了一种被称为**结构化提示词(Structured Prompt, SP)**的东西。与其写像“一辆银色的皮卡车在街上行驶,后车斗里装着一些箱子”这样的句子,结构化提示词将图像分解为一个严谨、有组织的实事列表,几乎就像计算机代码或 JSON 文件一样。

这就像是给厨师一个关于食物的模糊故事,与给他们一份带有精确测量值的精确食谱之间的区别。

  • 自然语言(故事): “一辆银色皮卡车运送着纸箱、包装圆柱体和可口可乐罐,行驶在街道上。”
  • 结构化提示词(蓝图):
    • 车辆: 银色皮卡车
    • 货物: 纸箱、包装圆柱体、可口可乐罐
    • 位置: 街道
    • 方位: [皮卡车的特定坐标]
    • 深度: [皮卡车距离有多远]

论文发现,当 AI 在这些结构化蓝图上进行训练时,图像质量得到了显著提升。蓝图越详细(添加深度、特定位置以及物体之间的关系等内容),AI 绘制场景的能力就越强。

为了证明这不仅仅是巧合,研究人员使用两个巧妙的工具测量了提示词中的“信息量”:

  1. GPG(地面困惑度增益/Grounded Perplexity Gain): 这衡量了图像在多大程度上帮助 AI 理解文本。这就像是在问:“看到这张图片是否让这句话变得更有意义?”
  2. ED(有效细节度/Effective Detailness): 这检查文本中有多少个具体事实实际上与图片相匹配。

他们发现了一个直接的联系:提示词中的“信息”(事实)越多,AI 的训练误差就越低。这是一条直线关系。事实越多 = 学习效果越好。词汇越多(但不含新事实) = 没有变化。

两步舞步:书写者与画家

论文将整个过程分解为两个截然不同的角色,他们称之为可扩散性(Diffusability)可提示性(Promptability)

  1. 可扩散性(画家的技巧): 这是关于 AI “画家”阅读指令的能力。研究人员发现,如果你给画家一个结构化的蓝图,他们可以更快地学习这项工作并减少错误。他们在将数千张图像转换为这些蓝图的基础上训练了他们的 AI 模型。结果如何?该模型变得极其擅长遵循复杂的指令,例如在只有第二把和第五把椅子有人坐的情况下,画出五把椅子。

  2. 可提示性(书写者的技巧): 这是将用户的简单请求(如“画一个酷炫的机器人”)转化为那份完美的结构化蓝图的挑战。由于用户不会用蓝图式语言说话,团队构建了一个特殊的“提示器”(Prompter,一种大型语言模型)来进行这种转换。

    • 首先,他们通过展示示例(监督微调)教会了这个“提示器”如何编写蓝图。
    • 然后,他们使用了一种“冷启动”方法,让 AI 利用逻辑来填补空白,从而想象出它看不见的细节。
    • 最后,他们使用了一个“验证器”系统。AI 编写蓝图,画家进行绘画,然后由一个评判者观察结果。如果画作不好,评判者会准确告诉书写者哪里出了问题(例如,“你忘记了机器人手臂的深度”),然后书写者会再次尝试。这个过程被称为强化微调(Reinment Fine-Tuning),它让“提示器”变得异常敏锐。

结果:一个新的标准

当他们将超级有组织的蓝图与超级智能的“提示器”结合在一起时,结果令人印象深刻。他们的系统在需要复杂推理的测试中击败了几乎所有其他开源 AI 模型,例如计数物体、理解空间关系(左 vs 右)以及遵循详细指令。

例如,当被要求绘制一个具有特定光照和多个物体的场景时,他们的系统比那些仅依赖冗长、混乱段落的模型更能准确捕捉细节。他们甚至展示了你可以轻松编辑图像的特定部分。如果你想把一把椅子的“材质”从木头改为金属,你只需更改蓝图中对应的那个字段,AI 就会在不破坏房间其余部分的情况下重绘椅子。

这对未来意味着什么

论文表明,AI 艺术的未来不在于编写更长的文章,而在于更好地组织信息。通过将图像生成视为一个结构化的工程问题而非创意写作练习,我们可以获得更加可靠和详细的结果。

作者还测试了如果让 AI “思考”更长时间会发生什么。他们创建了一个循环,让 AI 生成草稿、接受批评并进行修正。他们发现,虽然几轮修正会有所帮助,但经过训练的系统本身已经非常擅长首次就做到正确,因此不需要太多尝试。这表明,训练 AI 进行结构化思考比仅仅给它更多的时间去猜测更为强大。

简而言之,这篇论文认为我们一直试图通过向 AI 艺术家大声喊叫更多的词汇来教导他们。真正的突破在于教导他们阅读一张清晰、有组织的地图。重要的不是你说了多少,而是你表达得多么清晰。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →