CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding
本文提出了 CANVAS 框架,通过多智能体视觉分镜规划显式解决长篇幅视觉叙事中的角色、背景及道具一致性问题,并在多个基准测试中显著优于现有基线模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文介绍了一个名为 CANVAS 的新系统,它的核心目标是解决 AI 画故事时最大的痛点:“记性不好”和“逻辑混乱”。
想象一下,如果你让一个 AI 画一个多格漫画或分镜故事,现有的 AI 就像是一个**“只有 5 秒钟记忆的画家”**。
- 画第一格:它画了一个穿红衣服、戴蓝帽子的侦探,背景是博物馆。
- 画第二格:它可能把侦探的帽子画成了绿色的,或者把博物馆的地板画成了草地。
- 画第五格:当侦探再次出现时,他可能变成了另一个人,或者博物馆里凭空多出了一堵墙。
CANVAS 就是为了解决这个问题而生的“超级导演 + 场记 + 记忆库”组合。
下面我用几个生活中的比喻来解释它是如何工作的:
1. 核心问题:为什么以前的 AI 画不好长故事?
以前的 AI 画故事,就像是一个**“只盯着上一张画的人”**。
- 它画第二张图时,只看第一张图长什么样,然后照着画。
- 但它不知道整个故事的剧本。它不知道“那个金杯子在第 3 格被偷走了”,所以到了第 5 格,它可能又莫名其妙地把金杯子画在展柜里。
- 它也不知道“侦探换衣服了”,所以侦探的衣服颜色会忽红忽绿。
2. CANVAS 的解决方案:三步走策略
CANVAS 不再是一个简单的“画图机器”,它是一个多智能体协作团队,分三步走:
第一步:全局导演(Global Story Planning)—— “先写剧本,再动笔”
在开始画画之前,CANVAS 会先让一个 AI 当“总导演”,把整个故事的大纲理清楚。
- 角色管理:它会给每个角色建立“身份证”。比如,“侦探 Ethan 在第 1-2 格穿风衣,第 3-4 格换成了保安服,第 5 格又换回风衣”。
- 场景管理:它会给每个地点建“档案”。比如,“博物馆”这个场景,墙壁是白色的,地板是大理石。如果第 5 格又回到博物馆,它必须调用这个档案,确保墙壁还是白色的,而不是突然变成森林。
- 道具管理:它像**“场记”**一样记录道具的状态。比如,“金杯子”在第 3 格被偷走了,状态就是“不在展柜里”。如果第 5 格展柜是空的,那就对了;如果展柜里还有杯子,那就错了。
比喻:这就像拍电影前,导演会先画好详细的分镜脚本,并给每个演员发角色小传,给每个场景发场景说明书。演员和摄影师必须严格遵守,不能随便改。
第二步:记忆库与检索(Memory & Retrieval)—— “带着参考图去画画”
当需要画某一格时,CANVAS 不会凭空想象,而是先去它的**“记忆库”**里找参考图。
- 如果要画侦探,它会从库里调出侦探刚才穿的衣服照片,确保长相和衣服不变。
- 如果要画博物馆,它会调出之前画好的博物馆背景图,确保房间布局一模一样。
- 如果故事里发生了大事(比如杯子被偷了),它会更新记忆库,告诉下一张图:“注意!展柜现在是空的!”
比喻:这就像是一个**“拥有无限回忆的画师”**。每次动笔前,他都会翻出之前的画作和笔记,确保新画的一页和旧的一页能完美衔接,不会出现“昨天穿红鞋,今天穿蓝鞋”的穿帮镜头。
第三步:自我审查(QA-based Selection)—— “挑出最完美的一张”
AI 可能会一次画出好几张候选图(比如画了 5 张侦探图)。CANVAS 会像一个**“挑剔的质检员”**,拿着刚才制定的“剧本”和“规则”来检查这 5 张图:
- “这张图里侦探的帽子颜色对吗?”
- “这张图里的展柜是空的吗(因为杯子被偷了)?”
- “这张图里的背景墙壁和上一张一样吗?”
最后,它只选出最符合逻辑、最连贯的那一张作为最终成品。
3. 成果如何?
研究人员做了一个很难的测试(叫 HardContinuityBench),专门找那些容易让 AI 晕头转向的长故事(比如:场景反复切换、角色换装、道具消失又出现)。
- 以前的 AI:经常画着画着,角色脸变了,背景换了,或者道具凭空消失/出现。
- CANVAS:就像是一个经验丰富的老练导演,它画的每一格都严丝合缝。
- 背景连贯性提升了 21.6%(房间不会突然变样)。
- 角色一致性提升了 9.6%(侦探还是那个侦探)。
- 道具一致性提升了 7.6%(被偷的杯子真的不见了)。
总结
CANVAS 就像是给 AI 装上了一个“长期记忆大脑”和“逻辑检查员”。
它不再只是机械地根据上一张图猜下一张图,而是真正理解了故事的世界观:谁是谁,在哪里,什么东西还在,什么东西没了。这让 AI 生成的长故事不再是一堆支离破碎的碎片,而是一部真正连贯、逻辑通顺的“视觉电影”。
对于普通用户来说,这意味着未来我们可以用 AI 轻松生成长篇漫画、动态绘本甚至短视频,而不用担心角色“变脸”或场景“穿帮”了。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。