InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion
InsertFuse 是一个用于多类别参考引导图像插入的统一框架,它通过将类别特定专家训练与通过插入策略内蒸馏(Insertion On-On-Policy Distillation)进行的整合进行解耦,同时通过 Token 对齐几何调节(Token-Aligned Geometry Conditioning)、区域平衡流匹配(Region-Balanced Flow Matching)和参考分类器自由引导(Reference CFG)来增强空间控制和参考保真度,从而实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位大师级厨师,无论是精致的舒芙蕾还是浓郁的炖菜,你都能信手拈来。现在,想象有人要求你制作一道既是完美的舒芙蕾、又是完美的炖菜的单一菜肴,而且要使用同一个锅具和同一套烹饪指令。你可能会尝试,但结果很可能是一滩烂泥:炖菜所需的火力会毁掉舒芙蕾细腻的蓬松感,而且两者的风味也会产生冲突。这正是计算机科学家在教人工智能(AI)如何编辑照片时所面临的问题。
在AI的世界里,“扩散模型”(diffusion models)就像这些大师级厨师。它们是非常聪明的系统,可以通过将随机的噪点(就像电视机的雪花点)一步步转化为清晰的图像来创造或改变图像。最近,这些模型已经变得非常出色,我们可以要求它们“把一只猫放在这张椅子上”或者“把天空改为日落”。但问题在于:不同类型的编辑需要完全不同的技能。把一枚小小的戒指戴在手指上需要极高的精细度;而把一个完整的人放入场景中,则需要理解人体是如何弯曲以及衣服是如何呈现形态的。试图教一个单一的AI模型同时成为所有这些不同任务的专家,就像是要求那位厨师同时烹饪舒芙蕾和炖菜;AI会感到困惑,导致生成的结果看起来很奇怪或模糊不清。
这就是名为 InsertFuse 的新论文所解决的问题。来自上海交通大学及其他研究团队的研究人员意识到,旧有的训练这些AI厨师的方式本身就是问题所在。他们没有强迫一个模型同时学习一切,而是构建了一个巧妙的两步走系统。首先,他们训练了五位不同的“专家”厨师,每位专家只专注于一种特定的“食材”:一位负责配饰(如珠宝),一位负责动物,一位负责衣服,一位负责通用物体,以及一位负责人类。每一位专家都成为了其特定领域的专家,学会了如何精准处理该类别的独特特征,而不被其他类别干扰。
但如果只想用一个App完成所有工作,拥有五位不同的厨师就显得太麻烦了。因此,团队发明了一种特殊的训练技术,称为插入式在策略蒸馏(Insertion On-Policy Distillation, IOPD)。你可以把这想象成一位观察着五位专家工作的“学生”厨师。这位学生不仅仅是在背诵食谱,它还在亲自练习做菜,每当遇到困难时,它都会向正确的专家请教下一步该怎么做。如果学生试图把一顶帽子戴在头上,它就会询问“配饰专家”;如果它试图把一个人放入房间,它就会询问“人类专家”。通过在正确的时刻向正确的专家学习,这位学生变成了一位统一的大师级厨师,能够完美处理任何插入任务,而不会像同时学习所有事物那样感到困惑。
为了确保学生厨师不会乱猜放置位置,团队还加入了两个特殊工具。第一个是标记对齐几何约束(Token-Aligned Geometry Conditioning),它就像是给AI提供了一张精确的GPS地图,明确告知新物体应该放在哪里,确保它能完美契合空缺的形状,而不会渗入背景中。第二个是区域平衡流匹配(Region-Balanced Flow Matching),它扮演着公正裁判的角色。在常规训练中,AI可能会忽略一个小物体(比如手镯),因为巨大的背景(比如墙壁)占据了大部分屏幕。这个新工具会告诉AI:“嘿,虽然手镯很小,但它非常重要,所以要格外关注它”,从而确保微小的细节不会丢失。
最后,为了确保插入的物体看起来与参考照片完全一致(保留其独特的纹理和身份),他们使用了一种名为 Reference CFG 的技术。这就像是给学生厨师定下了一条严格的规则:“无论你如何拉伸这件衬衫,都必须保持原有的图案。”
结果令人印象深刻。当研究人员测试这个新的“学生”模型与其他顶尖AI编辑器时,它在几乎所有类别中都胜出了。它能更好地保留原始物体的外观,放置位置更准确,并让背景看起来更加自然。在一项由人类投票选出最喜爱图像的用户研究中,InsertFuse获得了超过50%的参与者投票,远超竞争对手。该论文表明,通过将学习特定技能的过程与组合这些技能的过程分离,我们可以构建出既是专家又是通才的AI,从而彻底解决图像编辑中的“烂泥炖菜”问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。