← 最新论文
💻 computer science

ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation

ASemConsist 是一个无需训练的框架,它通过选择性地修改文本嵌入并采用自适应特征共享,解决了身份保持与单图提示词对齐之间的权衡问题,从而在多种场景下实现了高保真度的身份一致性图像生成。

原作者: Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下尝试用图片来讲述一个故事,其中主角即使在背景从雨中的街道变为阳光明媚的公园时,每一帧画面看起来也必须完全一样。这就是人工智能领域一个日益增长的挑战的核心:教计算机生成一致的角色。多年来,最先进的图像制作工具已经能够根据简单的文本描述创建出令人惊叹的视觉效果。然而,当被要求生成一系列包含同一人物或动物的图像时,这些工具往往会遇到困难。角色可能会改变发色、丢失明显的伤疤,或者在下一张图片中改变面部结构。这种不一致性破坏了连续故事的幻觉,使得使用这些工具进行动画、漫画或交互式叙事变得困难。

核心难点在于人工智能模型理解语言的方式。当用户请求一个特定的角色,例如“一只有着短毛的小狗”时,计算机将这句话转化为复杂的数学表示。问题在于,当计算机试图将这个角色描述与新的场景描述(如“跳过水洼”)结合起来时。在许多现有系统中,关于角色的指令和关于场景的指令会纠缠在一起。计算机无法轻易地将定义狗的身份的部分与定义跳跃水洼的部分区分开来。因此,当计算机试图绘制下一张图像时,它往往会在试图遵循新场景指令的同时,不小心改变了狗的特征;或者为了保持狗的外貌不变而忽略了新的场景。

延世大学的一个研究小组开发了一种名为 AsemConsist 的新方法来解决这个特定问题,而无需重新训练底层的人工智能模型。他们的做法不是强迫计算机学习一种新的绘画方式,而是像一位熟练的编辑一样,在计算机开始绘画之前仔细调整指令。他们发现,代表文本的数学代码并不是实心的信息块,而是由许多不同的层或组件组成的。其中一些层有助于定义角色的身份,而另一些层则描述场景,甚至可能与角色的外观相矛盾。以往的方法试图一次性调整整个指令块,这往往会导致计算机丢失角色的身份或无法遵循场景描述。

研究人员的解决方案包含一个每次生成图像时都会自动进行的三个步骤。首先,他们将指令分解为各自的组件。他们识别出哪些代码部分对于保持角色一致性至关重要,哪些部分对于描述特定场景是必要的。然后,他们放大支持角色身份的部分,同时增强描述场景的部分,确保两者都强大且清晰。第二,他们发现了计算机内存中一个通常被忽略的隐藏空间,称为“填充”(padding)。他们意识到这个空间可以作为一个容器,用来存放关于场景的额外细节,而不会干扰角色的身份。通过将场景细节写入这个容器,他们防止了场景描述意外覆盖角色特征的情况。

最后,系统会决定何时提供额外的帮助。如果用户提供了一个非常详细的角色描述,例如“一个有着波浪状金发和蓝色眼睛的16岁女孩”,计算机通常可以自行保持她的样貌不变。然而,如果描述很模糊,比如“一个男人”,计算机就需要一个更强的锚点来防止角色发生漂移。新方法会自动检测描述有多模糊,并仅在必要时应用额外的约束。这防止了系统在不需要时过于僵化,从而在保持角色可辨识性的同时,允许更自然的姿势和背景变化。

为了测试他们的工作,研究人员创建了一种衡量成功的新方法,该方法不仅看角色的连贯性,还看场景描述的准确性,而不是分别评判它们。他们发现,在目前最强大的两个图像生成模型上,该方法的效果显著优于现有的尖端工具。在测试中,这种新方法在多样化的场景中保持了角色的身份,同时准确地遵循了每张图像的具体指令,而以往的方法在实现这种平衡方面一直很吃力。结果表明,通过理解计算机处理语言的内部结构,我们可以引导它们讲述更连贯的视觉故事,而无需从头开始构建全新的系统。这一进步让我们离实现人工智能可靠生成电影、游戏和数字叙事所需的视觉叙事这一未来又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →