← 最新论文
💻 computer science

LCG: Long-Context Consistent Image Generation with Sparse Relational Attention

本文提出了长文本生成(Long-Context Generation, LCG),这是一个利用稀疏关系注意力(Sparse Relational Attention)和路由一致性约束(Routing Consistency Constraint)来实现长视觉叙事中一致且可扩展的多图合成的框架,并通过一个新的大规模数据集以及在角色和语义一致性方面优于基准模型的表现验证了其有效性。

原作者: Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihao Wang, Yijia Xu, Haoze Zheng, Xuran Ma, Haokun Gui, Harry Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位试图画一本漫画的艺术家。你有一个包含 20 个不同场景的剧本。挑战不仅仅是画出一张精美的图片,而是要连续画出 20 张图片,其中主角在每一帧中看起来都完全一样,即使他们在穿着不同的衣服、站在不同的地方、做着不同的事情。

目前的 AI 绘画工具就像是有才华的艺术家,能够画出一张令人惊叹的肖像。但如果你要求它们画出一个完整的故事,它们往往会出现“漂移”现象。在第 1 帧中,英雄有着蓝色的眼睛和一道伤疤;到了第 10 帧,英雄可能突然变成了绿色的眼睛且没有伤疤,或者反派看起来变得和英雄一模一样。这篇名为 LCG 的论文介绍了一种解决这一问题的新方法。

以下是该论文解决方案的拆解,通过简单的概念进行说明:

1. 问题所在:“记忆过载”

为了在 20 张图像中保持角色一致,AI 需要同时观察所有 20 张图像,以记住角色的样子。

  • 旧方法: 想象你正试图同时与 20 个人交谈,每个人都在对着其他人大喊大叫。随着人数增加,噪音变得无法控制,你的大脑(计算机内存)就会崩溃。当 AI 尝试“密集地”(将每一张图像的每个像素都与其他图像的每个像素相连)查看所有图像时,就会发生这种情况。
  • 结果: AI 会感到混乱,导致角色外观发生变化,或者计算机因内存耗尽而崩溃。

2. 解决方案:“稀疏关系注意力” (SRA)

作者创建了一种称为稀疏关系注意力 (Sparse Relational Attention, SRA) 的新机制。你可以把它想象成给了 AI 一个智能荧光笔,而不是一束泛光灯。

  • 工作原理: 与其让 AI 尝试将图像 A 的每个部分都与图像 B 的每个部分相连,不如让它问自己:“为了保持图像 A 的一致性,我需要观察图像 B 中最重要的东西是什么?”
  • 类比: 想象你正在写一部书的续集。你不需要重新阅读整个 1,0 其实库里的 1,000 本书来记住英雄的名字。你只需要看一眼特定的角色索引卡。SRA 就充当了那张索引卡的角色。它只提取其他图像中的“核心特征”(如英雄的面部或特定的服装),并忽略其余部分。这使得计算机运行快速,并防止其因信息过载而崩溃,即使是在处理长篇故事时也是如此。

3. 安全网:“路由一致性约束” (RCC)

即使有了智能荧光笔,AI 仍可能产生混乱。例如,如果两个角色都穿着红色的外套,AI 可能会不小心交换他们的脸部特征。

为了阻止这种情况,作者添加了一个规则,称为路由一致性约束 (Routing Consistency Constraint, RCC)

  • 类比: 想象一位严格的编辑,他为故事中的每个人都准备了一份“角色表”(掩码/Mask)。编辑告诉 AI:“当你画第 5 帧中的英雄时,你必须观察第 1 帧中英雄的面部,而不是反派的面部,即使他们穿着相同颜色的衣服。”
  • 工作原理: 该系统使用这些“掩码”来强制 AI 正确地路由信息。如果 AI 试图复制错误的人的特征,系统会说:“不对,那是错误的路径,”并进行纠正。这确保了英雄始终是英雄,反派始终是反派,即使是在拥挤的场景中也是如此。

4. 训练场:LCCD 数据集

为了教会 AI 如何做到这一点,研究人员不能直接使用互联网上的随机照片(因为隐私和版权问题)。相反,他们构建了一个庞大的、定制的训练集,称为 LCCD(长上下文一致性数据集)。

  • 规模: 他们创建了 600,000 个虚构的故事序列。每个序列包含 6 到 20 张图像。
  • 多样性: 有些故事有一个角色,有些则有多个角色。他们使用 AI 生成这些图像,然后使用另一个 AI 来检查:“这个角色在每张图片中看起来是否一致?” 如果角色变化太大,那么这个故事就会被剔除。这为他们留下了一个用于训练模型的“完美”数据集。

5. 结果

当他们用他们的系统 (LCG) 与其他方法进行对比测试时:

  • 更好的连贯性: 角色在长序列(长达 20 张图像)中看起来更加一致。
  • 更好的叙事性: AI 能够遵循每个场景的具体指令(例如,“坐在长凳上”与“站在图书馆里”),而不会丢失角色的身份。
  • 高效性: 由于使用了“智能荧光笔” (SRA),该系统可以处理长篇故事而不会导致计算机内存崩溃,而旧方法在故事变长时就会失效。

总结: 该论文提出了一种新的框架,通过使用“智能荧光笔”来专注于重要的细节,并使用“严格的编辑”来确保角色不会混淆,从而使 AI 能够生成长篇且具有一致性的视觉故事(如漫画或分镜脚本),同时保持计算机的高效运行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →