Keep The Essentials: Efficient Reference Conditioned Generation via Token Dropping
该论文引入了 Sparse Context,这是一种通过对扩散模型进行微调以使其对随机标记丢弃具有鲁棒性,并在推理阶段应用任务感知型标记选择的方法,从而在不损害视觉质量的前提下,显著加速基于引用的扩散模型并将其计算成本降低高达 4 倍。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位试图根据一张原图照片和一份指令来重现一道复杂菜肴的大厨。
在当前 AI 图像生成的阶段,这个“大厨”(AI 模型)在开始烹饪之前,会盯着参考照片观察,试图研究其中的每一个像素。如果你给出一张高分辨率的照片,这就像是递给大厨一本书,里面有数百万条关于每一粒碎屑、阴影和纹理的微小笔记。即使大厨只需要知道盘子的大致形状或酱汁的颜色,他们也被迫要阅读每一条笔记。这使得烹饪过程极其缓慢,并且需要一个巨大的厨房(计算机内存),尤其是当你要求他同时看五六张照片时。
论文 《保留精华》(Keep The Essentials) 提出了一种更聪明的方法来完成这项工作。以下是其核心思想的拆解:
1. 问题所在:过多的噪声
作者注意到,参考照片中充满了冗余。
- 类比: 想象你在向朋友描述一只坐在地毯上的猫。你不需要描述地毯上每一根纤维的纹理或空气中的尘埃,你只需要说:“中间有一只猫,下面铺着一块地毯。”
- 现实情况: 现有的 AI 模型将参考图像视为由数百万个“Token”(微小数据块)组成的密集网格。研究发现,如果在不改变模型的情况下随机丢弃 80% 的这些 Token,AI 仍然可以推断出场景的大致布局。这就像是在读一本其中 80% 的字母都缺失的书,但你仍然能理解故事的大意。
2. 解决方案:“稀疏上下文”(Sparse Context)
团队创建了一种名为**“稀疏上下文”**的方法。把它想象成教会 AI 成为一名“略读者”,而不是“精读者”。
第一步:训练略读者(微调)
如果你只是在实际烹饪(推理)过程中随意丢弃 Token,AI 会感到困惑,因为它在训练时是被要求阅读每一条笔记的。这就像要求一个研读了整本教科书的学生去参加一场 80% 页面都被撕掉的考试——他们可能会不及格。- 解决方法: 作者通过在训练过程中故意撕掉随机页面(丢弃 Token)来重新训练 AI 模型。他们教会了模型具备鲁棒性,这意味着模型学会了即使在参考信息缺失的情况下,也能理解图像的“精髓”。
第二步:智能选择(大厨的直觉)
一旦模型学会了处理缺失的部分,团队并没有只是随机丢弃碎片,而是教会了 AI 根据任务进行智能选择:- 对于图像编辑: 如果你想改变汽车的颜色但保持其形状,AI 会专注于边缘(汽车的轮廓)。它会忽略天空或背景中平滑、空旷的部分。这就像是用荧光笔只在绘图的线条上进行描边。
- 对于个性化(将特定的人物/物体放入新场景): 如果你想把一只特定的狗放到一个新公园里,AI 会专注于显著部分(最重要的部分)——即那只狗本身——并忽略原始照片的背景。这就像是从杂志上剪下那只狗,而忽略页面的其余部分。
3. 结果:速度提升且质量不减
通过使用这种方法,AI 不必处理数百万个数据点,它只需处理那些“本质”的数据点。
- 速度提升:
- 对于单张参考图像,AI 的运行速度提升了 2 倍。
- 对于多张参考图像(例如 5 或 6 张照片),运行速度提升了 4 倍。
- 质量: 尽管丢弃了大部分数据,最终生成的图像看起来与 AI 阅读了每一条笔记时的效果一样好。细节、风格以及物体的身份特征都得到了保留。
4. 它具有良好的兼容性
论文还指出,这种方法就像是一个“通用适配器”。它可以与其它现有的加速技巧(如“KV 缓存”或“Token 合并”)结合使用,让 AI 变得更快,就像为汽车叠加两种不同的燃料以获得更快的行驶速度。
总结
简而言之,这篇论文的核心观点是:“不要为了理解情节而去读完一整本书。”
基于参考的 AI 模型目前正在浪费时间和精力去阅读参考图像中的每一个细节。这种新方法教会了 AI 忽略那些乏味、重复的部分,转而专注于完成任务所需的关键细节。其结果是,AI 运行得更快、成本更低,同时完全不会丧于创造精美、准确图像的能力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。