← 最新论文
💻 computer science

Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation

本文介绍了 INSET,这是一种统一的视觉生成模型,它将图像作为原生词汇标记嵌入文本指令中,并利用一个包含 1500 万交错样本的可扩展数据引擎,在多图像一致性和复杂指令遵循方面显著优于现有方法。

原作者: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yabo Zhang, Kunchang Li, Dewei Zhou, Xinyu Huang, Xun Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图向一位艺术家下达一个非常具体且复杂的指令。

旧方法(“索引卡片”问题)
目前,大多数 AI 图像生成器的工作原理就像一位只懂数字的图书管理员。如果你想要一张包含特定照片中的某只狗、另一张照片中的特定帽子,以及第三张照片中的特定背景的图像,你就必须说:“使用图像#1 中的狗、图像#2 中的帽子和图像#3 中的背景来画一幅画。”

AI 必须在尝试绘画的同时记住哪个数字对应哪张图片。随着你添加更多图片,AI 会变得困惑。它会忘记哪顶帽子对应哪只狗,或者干脆完全忽略额外的图片。这就像蒙着眼睛玩杂耍五个球;最终,你总会把它们弄掉。

新方法:“句子中的图像”(Inset)
这篇论文介绍了一种名为 Inset(句子中的图像)的新模型。Inset 不再将图像视为带有编号的独立文件,而是将图像视为句子中的单词

想象一下你在写一个故事,但你不是写下“狗”这个词,而是将那只特定狗的微小、完美的图片直接粘贴到句子中。

  • 旧方法: “把图像 1 中的狗放在椅子上。”
  • Inset 方法: “把 [狗的图片] 放在椅子上。”

因为图片就在句子中“椅子”这个词的旁边,AI 就不需要猜测或记住数字。含义就在那里,一目了然。这使得 AI 能够在不混淆的情况下处理包含许多不同图像的复杂指令。

他们如何训练 AI(“数据工厂”)
为了教会 AI 做到这一点,研究人员无法仅仅从互联网上找到足够的示例,因为这类示例很罕见。因此,他们构建了一个可扩展的数据引擎(一个用于数据的机器人工厂)。

  1. 针对照片: 他们收集了数百万张照片,并利用其他智能 AI 将它们分解。他们识别出每一个物体(如“红色花瓶”或“蓝色猫”),写下一句关于它的描述,然后将该物体的实际图片直接插入到描述所在的位置。
  2. 针对视频: 他们查看视频以教会 AI 事物如何变化。如果一段视频显示一只猫在跳跃,他们会创建这样的指令:“取起始处的猫 [坐着的猫的图片] 并让它跳跃 [跳跃的猫的图片]。”这教会了 AI 理解运动和变换,而不仅仅是静态复制。

他们创建了 1500 万 个这样的“图片 - 句子”来训练该模型。

结果
他们在名为 InterleaveBench 的困难挑战上测试了这个新模型,该挑战涉及将许多不同的图像混合到一个复杂的请求中。

  • 得分: 当被要求使用 2 张图像时,Inset 表现良好。但当被要求使用 5 张图像时,旧模型分崩离析,而 Inset 却持续表现更好。它在保持物体外观与原作一致以及遵循文本指令方面,准确度显著提高。
  • 额外优势: 由于 AI 学会了将图像视为指令的一部分,它还可以进行编辑。你可以给它看一件特定衬衫的图片,并说:“把这件衬衫穿在照片中的人身上”,它就会复制那件衬衫的精确设计,而不仅仅是猜测“衬衫”长什么样。

总结
该论文声称,通过停止让 AI 使用“数字”来引用图像,而是让它像阅读单词一样“阅读”图像,我们可以创造出更强大的工具,用于生成和编辑复杂图像。他们通过构建一个庞大的练习示例库,并证明他们的新模型在所有当前的开源竞争对手中都表现出色,特别是在任务变得复杂时,证实了这一点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →