AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models
AniCrafter 是一种新型的基于扩散的模型,它通过引入一种“化身-背景”调节机制,克服了现有依赖结构的方法的局限性,从而能够在开放域动态背景下生成逼真的、具备遮挡感知能力的以人为中心的动画。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图制作一部电影:一个角色从一张照片中走出来,开始在一条繁忙、移动着的城市街道上跳舞。在计算机科学的世界里,这是一个棘手的谜题,被称为“视频生成”。长期以来,计算机擅长让静态图像动起来,或者至少让物体在简单的空房间里移动。但当你试图把一个人放入一个复杂的、真实的视频场景中——那里有行驶的汽车、摇曳的树木和变化的灯光时——事情就会变得一团糟。计算机经常会感到困惑,使那个人看起来像是一个漂浮的幽灵,或者一个与环境格格不入的、带有故障感的贴纸。
为了解决这个问题,科学家们使用了被称为“视频扩散模型”(Video Diffusion Models)的技术。你可以把这些模型想象成极其出色的艺术家,他们已经看过了数百万个视频。他们不仅仅是复制粘贴;他们学习了光影和运动的“规则”。他们可以根据一个提示——比如一个骨架图或一个姿态——来构思出一个全新的视频。然而,以往尝试使用这些艺术家将特定人物放入新背景的方法往往以失败告终。那个人看起来会很僵硬,衣服的动作不自然,或者看起来像是被画在了场景之上,而不是真正站在那里。核心问题在于:我们如何让计算机理解一个人是“身处”一个场景之中并与其发生交互,而不仅仅是“漂浮”在场景上方?
于是,AniCrafter 登场了。这是一个由东京大学及其他机构的研究人员开发的全新工具。你可以把 AniCrafter 想象成一个“数字木偶师”,它不仅是在移动一个角色,更是在重建角色与周围世界的关系。研究人员发现,秘诀不仅在于告诉计算机人物如何移动,还在于给它一个关于场景应该呈现何种样貌的“草稿”。
以下是他们的实现方式。他们并没有要求 AI 从零开始猜测整个视频,而是首先利用一种称为“3D 高斯泼溅”(3D Gaussian Splatting)的技术,为那个人构建了一个“3D 骨架”。想象一下,拍摄一个人的照片,然后瞬间将他们变成由数百万个微小的、发光的 3D 点组成的云团,这些点承载着他们的形状。接着,他们让这个 3D 云团随着预期的节奏起舞。这创造了一个“粗略视频”,其中的人物动作正确,但看起来有些模糊,缺乏头发或织物等精细细节。
随后,他们将这个粗略视频粘贴到他们想要使用的背景视频上。这创造了一个奇怪的、混合型的视频:背景是完美的,但人看起来像是自己一个略显模糊的 3D 渲染版本。这就是“化身-背景”(avatar-background)技巧。他们将这个混合视频输入到 AI 模型中,并对它说:“你知道背景长什么样,也知道人物的大致轮廓。现在,请修复这个人。让他们的头发自然飘动,让衣服随风起伏,并确保皮肤上的光影与背景中的街灯相匹配。”
论文指出,以往的方法试图通过仅仅给计算机一个骨架姿态(比如一个火柴人)并寄希望于好运,或者试图先构建一个完美的 3D 模型,但这往往会让效果显得虚假且僵硬。AniCrafter 拒绝了这些方法。相反,它将这个问题视为一项“修复”工作。它从一个尚可但并不完美的场景开始,并利用 AI 强大的大脑来润色细节。
结果令人印象深刻。在测试中,AniCrafter 能够提取一个人的照片,并让他们在完全不同的视频中(例如热闹的市场或多风的公园)翩翩起舞,同时保持其面部特征与原照完全一致。它能处理棘手的情况,比如当那个人走到树木或汽车后面时,确保树木能像现实生活中那样遮挡住人的身体。当研究人员将他们的这种方法与现有的最佳工具进行对比时,AniCrafter 始终能产生看起来更真实、动作更自然、且故障更少的视频。
它最酷的特性之一是处理光影的方式。如果你拍下一张人在阳光明媚的公园里的照片,并试图把他们放入一个黑暗、多雨的小巷,旧的方法会让那个人看起来仍然站在阳光下。然而,AniCrafter 学会了对人物进行“重光照”(re-light)。它意识到,为了匹配新的环境,那个人需要看起来更暗、更湿润,从而使最终的视频感觉像是用相机捕捉到的一个真实的瞬间。
研究人员在数千个视频上测试了该工具。他们发现,通过结合“粗略的 3D 草稿”与“完美的背景”,AI 可以比以前更好地学习如何填充缺失的细节——比如围巾如何飘动或头发如何在风中摆动。他们甚至展示了它如何处理不同体型的人,而不仅仅是普通身材的人。
虽然这个工具功能强大,但作者也诚实地指出了它的局限性。目前,它还无法创建一个可以让你从任何角度环绕角色的完整 3D 世界;它仍然专注于制作一段看起来真实的平面视频。但对于让静态照片在动态、移动的世界中“活起来”这一特定目标,AniCrafter 提供了一种新的前进方向:不要仅仅要求计算机去想象一切,而是给它一个良好的起点,然后让它去完善细节。这有点像给一位雕塑家一块粗糙的粘土,并要求他们雕刻出最终的杰作,而不是要求他们从无到有地制造粘土。论文表明,这种“修复式”方法比试图从头开始构建一切的效果更好,它所产生的视频让人感觉真正有了生命力。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。