← 最新论文
💻 computer science

Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer

本文提出了 Durian,这是一种首创的肖像动画生成方法,通过利用普通视频构建自重建训练框架并引入双参考网络与掩码扩展策略,成功实现了无需成对数据即可从单张或多张参考图像向目标肖像进行跨身份属性迁移、多属性组合及平滑插值的高质量生成。

原作者: Hyunsoo Cha, Byungjun Kim, Hanbyul Joo

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Hyunsoo Cha, Byungjun Kim, Hanbyul Joo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Durian(榴莲) 的新 AI 模型。别被它的名字吓到,它可不是用来吃的水果,而是一个能让照片里的人“动起来”还能“换造型”的超级魔术师。

简单来说,Durian 能帮你做这样一件事:

给你一张静态的人像照片(比如你朋友),再给你一张参考图(比如一副很酷的眼镜,或者一头漂亮的卷发),然后给它一段动作指令(比如转头、微笑的轨迹)。Durian 就能生成一段视频,让你朋友在视频里动起来,同时完美地戴上那副眼镜或换上那头卷发,而且看起来非常自然,就像他/她原本就长那样一样。

为了让你更容易理解,我们用几个生活中的比喻来拆解它的核心黑科技:

1. 最大的难题:没有“标准答案”怎么办?

传统困境:
以前想训练 AI 做这种“换头”或“换衣服”的动画,需要大量的成对数据。比如,你需要找一个人,拍他戴眼镜的样子,再拍他不戴眼镜的样子,而且必须是同一个人、同一个角度。这在现实中几乎不可能收集到足够多的数据(你总不能把全世界的人都抓来拍几百遍吧?)。

Durian 的妙招:自我模仿秀(Self-Reconstruction)
Durian 不需要这种完美的“成对数据”。它玩了一个聪明的游戏:“自己演自己”

  • 比喻: 想象你在看一段朋友在公园散步的视频。Durian 会随机从视频里截取两帧:
    • 帧 A:朋友戴着墨镜(把它当作属性参考)。
    • 帧 B:朋友没戴墨镜,正在转头(把它当作身份参考)。
  • Durian 的任务是:看着帧 B(身份),参考帧 A(墨镜),尝试把帧 B 里没戴墨镜的部分“补”成戴墨镜的样子,并且要符合帧 B 转头的动作。
  • 因为帧 A 和帧 B 本来就是同一个人,所以 Durian 不需要有人告诉它“这是墨镜”,它自己就能学会:“哦,原来墨镜是长在脸上的,但脸的其他部分(身份)要保持不变。”
    通过这种“自己考自己”的方式,Durian 学会了如何把任何人的特征(如发型、眼镜)移植到另一个人身上,而不需要任何现成的配对数据。

2. 核心大脑:双参考网络(Dual ReferenceNet)

传统困境:
以前的 AI 就像个糊涂的厨师,把“身份”和“发型”混在一起搅和,结果换发型时,连脸都变了,或者发型长到了耳朵上。

Durian 的妙招:两个专门的助手
Durian 设计了两个专门的“助手”(参考网络):

  • 助手 A(身份管家): 只负责盯着“脸是谁”,确保不管怎么换造型,还是原来那个人。
  • 助手 B(造型师): 只负责盯着“眼镜/头发/胡子”,确保新造型的细节清晰。
  • 比喻: 这就像拍电影。助手 A 是导演,负责把控演员(身份)的情绪和神态;助手 B 是化妆师,负责给演员换假发和眼镜。
  • Durian 有一个神奇的**“空间注意力”机制**,就像导演和化妆师在片场实时沟通。导演说:“保持这个表情!”化妆师说:“好的,我把这顶帽子戴在头上,但绝不挡住眼睛。”两者完美配合,既保留了身份,又换好了造型。

3. 解决“水土不服”:面具扩张策略

挑战:
在训练时,Durian 是看“自己”换装(帧 A 和帧 B 是同一个人),但在实际使用时,是要给“陌生人”换装(比如把 A 的头发换到 B 头上)。这时候,发型的大小、位置可能完全对不上,AI 容易懵。

Durian 的妙招:扩大视野

  • 比喻: 想象你在教一个学生认“帽子”。如果你只给他看一顶刚好戴在头上的帽子,他可能认不出戴歪了的帽子。
  • Durian 在训练时,故意把“帽子”的边界扩大,甚至随机生成一些不同形状、不同大小的帽子区域。它强迫自己学会:“不管帽子是歪的、大的还是小的,我都能把它安在正确的位置,并盖住原来的头发。”
  • 这让 Durian 在面对现实中各种歪七扭八的参考图时,依然能稳稳地完成任务。

4. 超能力:一键混搭与平滑过渡

Durian 最酷的地方在于它的灵活性,不需要重新训练就能玩出新花样:

  • 多重属性混搭(Multi-attribute):
    • 比喻: 就像玩乐高。你可以同时给照片里的人加上“眼镜”、“胡子”和“帽子”。以前的 AI 可能只能一次加一个,或者加了胡子眼镜就掉了。Durian 能一次性把这三个“乐高积木”拼在一起,而且互不干扰,甚至能处理它们重叠的地方(比如帽子压住了头发)。
  • 属性平滑插值(Interpolation):
    • 比喻: 就像调音台。你可以让 AI 生成一段视频,展示发型从“短发”慢慢变成“长卷发”,或者眼镜从“黑框”慢慢变成“金框”。这种变化是丝滑的,就像魔法渐变一样,而不是生硬的切换。

总结

Durian 就像一个零成本的虚拟造型师
你只需要给他一张照片和一个你想要的造型参考(哪怕只是网上随便找的一张图),它就能让你照片里的人动起来,穿上你想要的衣服、戴上你想要的配饰,而且动作自然、表情生动。

它最大的突破在于:不需要收集昂贵的“换装”数据,而是通过“自己演自己”的方式自学成才,并且能灵活地处理各种复杂的换装需求。这为未来的虚拟试衣、个性化视频创作打开了新世界的大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →