← 最新论文
💻 computer science

Loki: Representation over Architecture for Diffusion-Based Portrait Animation

Loki 引入了一种新颖的基于扩散的人像动画框架,该框架以身份正交的参数化人脸模型和轻量级键值注入取代了基于 RGB 的条件控制,在显著减少参数和训练数据的同时实现了更优的姿态与表情控制,并支持零样本跨身份重演。

原作者: Pouyan Navard, Sernam Lim

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Pouyan Navard, Sernam Lim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《Loki:基于扩散模型的肖像动画的表示优于架构》的解释,已转化为通俗易懂的语言并辅以生动的类比。

核心理念:改变动画的“语言”

想象一下,你想拿一张朋友的照片(参考图),让他们像视频中的另一个人(驱动源)那样说话和移动。这被称为“肖像动画”。

目前大多数 AI 系统试图通过将视频和照片视为像素(微小的彩色点)来完成这一任务。问题在于像素很混乱。在像素化图像中,人脸的形状、笑容以及头部的转动方式都混杂在同一堆点中。为了将它们分离,AI 必须学习复杂且昂贵的技巧,将身份从动作中“解混”。这就像试图仅通过观察液体,就将混合好的冰沙重新分离成完整的水果、牛奶和冰块一样。

Loki 采取了一种完全不同的方法。它不看像素,而是观察面部的蓝图

核心创新:“面部蓝图”(FLAME)

作者使用了一种名为 FLAME 的工具,这是一种人类面部的 3D 数学模型。请将 FLAME 想象成不是图片,而是一个带有特定旋钮和刻度的数字黏土雕塑

  • 旋钮 A:控制面部形状(身份)。
  • 旋钮 B:控制微笑、皱眉或张嘴(表情)。
  • 旋钮 C:控制头部向左或向右转动(姿态)。

在大多数其他系统中,这些旋钮是纠缠在一起的。而在 Loki 中,它们是完全分离的。你可以转动“微笑”旋钮,而不会意外改变“面部形状”旋钮。

Loki 的工作原理:双轨系统

Loki 使用“扩散”模型(一种从噪声生成图像的 AI)。通常,这些模型需要大量复杂的机制来理解要绘制什么。Loki 通过将指令分为两个独立的轨道来简化这一过程:

1. 驱动源轨道(“运动地图”)
Loki 不是将驱动源的视频直接喂给 AI,而是提取驱动源视频中的 FLAME 旋钮(他们笑了多少、转动了多少),并将这些数字转化为一张特殊地图

  • 类比:想象一张山脉的地形图。地图上的线条并没有告诉你站在山上;它们只是告诉你哪里有山峰和山谷,以及坡度有多陡。
  • Loki 创建了一张地图,上面写着“这里有一个微笑”和“这里有一个转头动作”,但它不包含任何关于这个人是谁的信息。它纯粹是关于运动的。

2. 身份轨道(“面部模具”)
AI 随后将你希望动画化的人的照片(参考图)输入系统,以学习这张脸长什么样。

  • 类比:这就像拿一个空白的黏土模具,将参考图的脸压进去以获取形状。

魔法时刻:
因为“运动地图”(驱动源)中没有任何身份信息,而“面部模具”(参考图)中没有任何运动信息,Loki 可以简单地交换地图

  • 它从驱动源的地图中获取运动
  • 将其应用到参考图面部的形状上。
  • 结果:参考图中的人像驱动源一样移动,但保留了自己的脸。

为什么这很重要

1. 更便宜、更快速
因为 AI 不需要学习如何将身份与运动解缠(因为蓝图已经为它做好了分离),它需要43% 更少的参数(更少的脑力)和1,496 倍更少的视频数据来进行训练。

  • 类比:其他系统就像一个试图通过背诵字典里的每一句话来学习语言的学生。Loki 则像是给该学生一本已经完美解释规则的语法书。他们学习得快得多。

2. 适用于陌生人(跨身份)
通常,为了让系统在驱动源和参考图是不同人时也能良好工作,你需要在成千上万个不同人共同表演的例子上进行训练。

  • Loki 的秘密:因为蓝图的数学结构如此清晰,Loki 只需在一个人表演的数据上学习,就能立即适用于任何其他人。这就像在辅助轮上学会骑自行车,然后立即就能骑山地车,而从未在山地车上练习过。无需额外训练。

3. 更高的准确性
该论文引入了两种新的成功衡量方式。它们不再仅仅询问“图片看起来清晰吗?”(这是旧方法检查的内容),而是问:“头部转动的幅度是否完全相同?”以及“嘴巴张开的宽度是否完全相同?”

  • Loki 在这些特定任务中胜出。它捕捉大动作(如大张嘴巴或急剧转头)的能力远优于以前的系统,以前的系统往往会让动作看起来“平淡”或“通用”。

总结

Loki 是一种动画化面部的新方法,它不再试图从模糊的视频中“猜测”运动。相反,它使用一种数学蓝图,自然地分离了“这个人是谁”和“他们在做什么”。

  • 旧方法:试图通过分离冰沙来找到水果。(困难、昂贵、混乱)。
  • Loki 方法:使用一张分别列出水果和牛奶的食谱卡。(简单、便宜、精确)。

这使得系统更小巧,能在更少的数据上训练,并能执行“跨身份”技巧(让陌生人像另一个人那样表演),而无需为此进行特殊训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →