DreamOmni3: Scribble-based Editing and Generation
该论文介绍了 DreamOmni3,这是一个统一的模型,通过一种新颖的数据合成流水线以及一个结合了原始图像与草图图像以实现精确视觉控制的联合输入框架,通过实现灵活的基于涂鸦的编辑与生成,推动了基于 GUI 的创作。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在和一位超级聪明的艺术家交谈,她可以根据你的描述画出任何东西。如果你说,“画一只猫”,她就会照做。如果你说,“让这只猫戴上一顶帽子”,她就会修改图片。这就是AI图像生成与编辑的世界——在这个领域,计算机通过学习你的语言来创造和修改图像。长期以来,与这些数字艺术家交流的唯一方式是文本。但问题在于:语言有时是笨拙的。试图精确描述要在哪里放置一个新物体,或者如何修改一张凌乱图画中的特定部分,就像是试图用一张没有地标的地图给朋友指路一样。你可能会说,“把树放在左边”,但 AI 可能会把它放在最左边,或者错误的左边。
为了解决这个问题,科学家们一直在探索一种新的方式来与这些艺术家对话:涂鸦(scribbling)。与其仅仅输入文字,不如直接在屏幕上抓起一支数字笔,画出圆圈、方框或凌乱的涂鸦,以向 AI 展示你确切的意思。这就像是在地图上指着一个点说“这里!”,而不是去描述街道名称。这篇名为 DreamOmni3 的论文深入探讨了如何让这种“指向并绘制”的方法完美运行。它解决了教计算机不仅要理解你的文字,还要理解你凌乱的手绘线条,并将两者结合起来以实现极高精度的图像创建与编辑这一难题。
问题所在:当语言不再足够时
想象一下你正在玩一个编辑照片的游戏。你想把一个红圈里的玩具换成一个手提包。如果你只输入“在这里放一个手提包”,AI 可能会感到困惑。哪个玩具?“这里”是指哪里?圆圈是红色的还是黑色的?是第一张图还是第二张图?语言擅长表达宏大的概念,但在指向屏幕上特定的、微小的细节方面表现得很糟糕。
这篇论文的作者意识到,虽然 AI 在遵循文本指令方面已经变得非常出色,但在处理复杂情况时,它往往会忽略“在哪里”和“如何做”的问题。用户需要一种更直接的方式。他们需要能够围绕一个脸部画一个圈并说“改变这里的头发”,或者画一条波浪线并说“把车放在这里”。这就是**基于涂鸦的编辑与生成(scribble-based editing and generation)**的概念。它的核心在于让用户将文本、图像和自己的自由手绘相结合,来控制 AI。
解决方案:DreamOmni3
DreamOmni3 的团队决定构建一个将涂鸦视为与文本和图像同等地位的“一等公民”的模型。但面临着一个巨大的障碍:数据。AI 模型就像学生;它们需要看到成千上万个例子才能学会。目前还没有现成的“教科书”(数据集)能向 AI 展示如何解读一个凌乱的手绘圆圈并将其转化为完美的编辑效果。
因此,作者们做的第一件事就是发明了一个数据工厂。他们利用现有的图像,通过一套巧妙的流水线创建了数百万个新的训练样本。
- 对于编辑任务: 他们提取照片中的物体,然后通过人工(或借助辅助 AI)在上面画上圆圈、方框和涂鸦。他们创建了四种类型的任务:
- 涂鸦 + 文本: “在红圈里放一辆车。”
- 涂鸦 + 文本 + 图像: “把这张图片里的车放到红圈里。”
- 图像融合: 在涂鸦的引导下,将一个物体从一张照片中提取并粘贴到另一张照片中。
- 涂鸦编辑: 将一个粗略的草图变成照片中真实的物体。
- 对于生成任务: 他们做了同样的事情,但不是从照片开始,而是从一张空白的白画布开始,教会 AI 根据你涂鸦的位置来绘制新的事物。
他们生成了一个庞大的数据集,包含数万个此类示例(其中多模态编辑有 32,000 个,多模态生成有 29,000 个,以及其他任务的更多示例),以此来教会模型如何通过你的绘画来读取你的心意。
魔法技巧:模型如何“看见”涂鸦
这是论文中最巧妙的地方。通常,当你想要编辑图像的特定部分时,你会使用二值掩码(binary mask)。把掩码想象成一个模板:它是一个黑白图像,白色表示“修改这里”,黑色表示“保持原样”。
作者认为掩码过于僵硬。如果你想在一个画面中改变三个不同的东西,你就需要三个不同的黑白掩码。这很麻烦,也很难用语言描述。相反,DreamOmnichi3 使用了彩色涂鸦(colored scribbles)。你可以为汽车画一个红圈,为树木画一个蓝方块,为天空画一条绿线。AI 可以轻松通过颜色将它们区分开来。
但问题在于:如果你在汽车上画了一个红圈,AI 就看不见汽车了,因为红色的墨水遮住了它!为了解决这个问题,DreamOmni3 使用了联合输入方案(joint input scheme)。
- 它同时向 AI 输入两张图像:原始照片 以及 带有涂鸦之上的照片。
- 它使用一种特殊的编码系统(一种像素标记方式),告诉 AI:“嘿,这张图里的红圈就在那张图中汽车的精确位置。”
- 这使得 AI 既能看到涂鸦(从而知道你的意图),又能看到原始像素(从而知道它正在修改什么),确保编辑精准且图片的其余部分保持完美。
大脑:教 AI 理解“凌乱”
作者还意识到,人类的绘画通常是凌乱的。一个圆圈可能看起来像个蛋;一条线可能也是歪歪扭扭的。为了帮助 AI 理解这些不完美的绘画,他们引入了一个 视觉语言模型(VLM)——一种非常擅长推理的 AI 类型。
他们在训练图像生成器的同时,也对这个 VLM 进行了训练。这个 VLM 充当了一个翻译官。它观察你的涂鸦和写的文字,推断出你真正的意思(例如:“哦,他们画了一个歪歪扭扭的圆,但他们显然想要一辆车”),然后准确地告诉图像生成器该怎么做。这种**联合训练(joint training)**确保了 AI 不仅仅是盲目地遵循规则,而是真正理解了涂鸦背后的意图。
结果:它有效吗?
团队在他们创建的一个包含真实世界图像和复杂任务的新基准测试中测试了 DreamOmni3。他们将其与包括 GPT-4o 和 Nano Banana 在内的其他顶级模型进行了对比。
结果令人印象深刻。DreamOmni3 在编辑任务中的成功率始终优于其他开源模型,并能在许多领域匹配或超越商业巨头。
- 人类评估员(真实的人类)评定 DreamOmni3 在编辑任务中的成功率为 55.88%,这高于 GPT-4o(在某项指标中为 59.56%,但 DreamOmni3 在其他方面表现得更稳定),并且显著高于 Omnigen2(2.94%)等其他模型。
- 在生成任务中,DreamOmni3 达到了 54.55% 的成功率,再次击败了大多数竞争对手。
- 论文指出,虽然商业模型很强大,但它们有时难以处理特定的涂鸦指令,经常会留下涂鸦痕迹或者比例出错。然而,DreamOmni3 专门针对这些细微差别进行了设计,能够产生更干净的结果,使涂鸦消失且编辑看起来非常自然。
这为什么重要
DreamOmni3 不仅仅是为了让 AI 变得更聪明,更是为了让 AI 变得更人性化。它弥合了我们想象与我们所能描述的内容之间的鸿沟。通过让我们进行绘画、指向和涂鸦,它将图像编辑从一项技术性的繁琐工作转变为一场创意的对话。这篇论文表明,这种方法——将文本、图像和自由手绘结合,并辅以智能数据合成和联合训练——是未来我们与数字创作工具交互的方式。它表明,当我们不再强迫计算机去理解我们模糊的语言,而是开始让它们通过我们的直接行动来感知时,结果会变得更加神奇。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。