Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair
该论文提出了代理增强与语义修复(AESR),这是一个结合了代理提示增强模块和由视觉语言模型(VLM)驱动的视觉语义修复模块的轻量级框架,旨在克服闭源文本生成视频模型中的身份漂移和指令遵循失败问题,并在 ACM MM 2026 身份保持视频生成挑战赛中荣获第一名。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一个特定的挑战已经出现:教机器创作出不仅能遵循文字故事,而且能在整个片段中保持特定人物形象完全一致的动态图像。想象一下,要求计算机生成一段你的朋友在繁华市场中穿行,然后停下来买一朵花的视频,同时要确保视频中的脸部始终能让人一眼认出就是你的朋友。虽然现代工具已经能够生成令人惊叹的逼真动作和光影效果,但它们往往在一致性方面表现不佳。角色可能开始是你的朋友,但随后会慢慢演变成另一个人;或者当指令变得复杂时,计算机可能会干脆忘记加入你要求的花朵。这是一个重大的障碍,因为当今最强大的视频生成器都是“黑盒”——即内部运作机制被隐藏的封闭系统,这使得研究人员无法通过简单地修改代码来修复这些错误。
北京大学的一个研究团队开发了一种全新的方法来解决这个问题,而无需打开这个“黑盒”。他们并没有试图改变视频生成器本身,而是构建了一个围绕它工作的智能助手。这个被称为 AESR 的系统,就像一位高水平的导演和剪辑师,在拍摄前准备好指令,并在第一遍拍摄后修正错误。研究人员发现,通过仔细优化给计算机的文本提示词(prompts),并利用视觉参考来纠正生成视频中的特定错误,他们可以显著提升结果。在一场针对该技术的国际大赛中,他们的系统排名第一,证明了这种引导和修复输出的方法是创造人物身份保持真实的视频的一种切实且强大的手段。
他们解决方案的核心在于发生在视频创建之前和之后的两个不同阶段。首先,团队意识到人类编写提示词的方式至关重要,但不同的视频生成器偏好不同的写作风格。为了处理这个问题,他们创建了一个能够从经验中学习的数字“剧本”。这个剧本始于视频生成器开发者提供的官方说明,这些说明告诉系统如何接收指令。然而,研究人员更进一步,加入了从现实案例中学习的层级。他们建立了一个自动化循环:系统生成一段视频,检查其中的错误,然后根据学到的知识更新其剧本。如果系统注意到视频生成器经常漏掉某种特定的动作,或未能清晰描述某个物体,剧本就会记录下这一失败及其修正方案,以备下次使用。随着时间的推移,这种知识积累不断增长,使系统能够为复杂的场景(例如一个人与多个物体互动或执行一系列动作)编写更好的指令。
即便有了更好的指令,第一版视频往往仍包含一些仅靠文字无法修复的小错误。计算机可能理解“一名女性看着镜头”这句话,但生成的视频可能会显示她在看向别处,或者漏掉了她应该戴着的某顶特定帽子等关键细节。为了解决这个问题,研究人员引入了第二个阶段,称为“视觉语义修复”。在这个阶段,一个独立的 AI 系统充当评论家,观察草稿视频并将其与原始请求进行对比。当它发现问题时——例如缺失物体或面部发生轻微偏移——它不仅仅是写下一段新的描述,而是选择视频中的特定帧并对其进行编辑,以展示原本应该呈现的内容。这张编辑后的图像便成为了一个具体的视觉目标。随后,系统将这张修正后的图像、原始视频以及一组新的指令一起输入到视频编辑工具中。该工具以编辑后的图像作为引导,来修复视频的特定片段,从而确保最终结果符合提示词的视觉意图。
为了确保获得最佳结果,研究人员并没有只进行一次尝试。他们利用不同组合的改进指令和修复技术,为每个视频生成了多个版本。随后,他们使用了一种筛选策略来比较这些候选方案,权衡了视频与文本的匹配程度、面部一致性以及动作流畅度等因素。通过从这一组中选出表现最好的一个版本,他们实现了质量的最大化。在针对 200 个涉及面部身份保持的挑战性案例进行测试时,他们的系统优于现有方法。结果显示,他们的方法成功减少了人物面部发生变化或关键视觉元素消失的错误。该团队的成功在 ACM MM 2026 身份保持视频生成挑战赛中得到了证实,其名为 MIPL_Video 的系统在面部身份保持赛道中夺得了冠军。
这项工作表明,即使在最强大的工具被封闭无法直接修改的情况下,仍然存在有效的方法来引导它们取得更好的结果。通过将一个能够改进指令的学习系统与一个能够修复特定错误的视觉编辑器相结合,研究人员创建了一个既轻量又高效的工作流。他们的研究结果表明,高质量、保持身份的视频生成的未来,可能并不取决于构建更大、更复杂的模型,而在于开发更聪明的方法来与我们现有的模型进行交互。在保持人物神态的同时遵循复杂动态故事的能力,为叙事和内容创作开辟了新的可能性,证明了精心的准备和针对性的修正可以实现单纯依靠原始生成无法达到的效果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。