← 最新论文
🤖 AI

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

本文介绍了 Archon,这是一个完全预训练的统一多模态模型,它整合了七种模态,并采用了内存高效的视频重参数化和“模态思维”等新颖技术,以在多样化任务中实现高保真、可控制且全面的数字人类生成。

原作者: Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想要创造一个数字人类——一个能够按照你的意愿说话、移动和呈现外观的虚拟演员。通常,构建这样一个系统就像试图通过为每一个部件聘请一位单独的专家来组装一台复杂的机器人:一个人负责声音,另一个人负责面部,第三个人负责身体动作,第四个人负责背景。这些专家往往说着不同的“语言”,导致最终的机器人僵硬、故障频发或难以控制。

本文介绍了Archon,一种全新的“一体化”数字大脑,旨在解决这一问题。请将 Archon 视为一位通用翻译官兼指挥家,而非一群专家,它能够同时理解人类表演的方方面面。

以下是 Archon 的工作原理,分解为简单的概念:

1. “通用翻译官”(统一多模态模型)

大多数 AI 模型就像只说一种语言的专家。如果你想将文本转换为视频,需要一个模型;如果你想将音频转换为面部,则需要另一个模型。Archon 则不同。它同时基于**七种不同的“语言”(模态)**进行训练:

  • 文本(描述和剧本)
  • 音频(语音)
  • 动画(3D 面部运动)
  • 图像和视频
  • 语义图(视频的简化“骨架”,显示眼睛、鼻子和嘴巴的位置)

因为它同时学习所有这些语言,Archon 能够实现任意到任意的生成。你可以给它一个剧本,它就能生成语音、动画化面部并生成视频。或者,你可以给它一个视频,它就能写出关于此人外貌和说话内容的描述。这就像拥有一位艺术家,能够瞬间在绘画、歌唱和表演之间切换,而无需更换工具。

2. “智能草图”(语义视频)

制作高质量视频 AI 的最大问题之一是视频文件体积庞大。想象一下,试图通过列出每个像素的颜色向朋友描述一段 5 秒的视频;这将耗时极长并让你的大脑不堪重负。

Archon 使用了一种巧妙的技巧,称为语义视频。它不是试图处理视频的每一个像素,而是先将视频转换为一张**“智能草图”**。

  • 可以将这张草图想象成一张简化的地图:眼睛只是蓝点,嘴巴是红色形状,头发是棕色色块。
  • 这种“草图”捕捉了所有重要的动作(眨眼、说话、微笑),但丢弃了不必要的细节(如皮肤的确切纹理)。
  • 这将 AI 需要处理的数据量减少了4 倍,使其运行速度更快、成本更低。
  • 一旦 AI 生成这张“草图”,一个独立的、高质量的“画家”(视频扩散模型)就会填充逼真的细节,从而创建出最终的逼真视频。

3. “分步思考者”(模态思维)

有时,要求 AI 直接从“音频”跳转到“视频”太难了,就像要求某人在不知道中间语法的情况下将一首诗从中文翻译成法语。结果往往模糊或怪异。

Archon 采用了一种称为**“模态思维”**的策略。它不直接跳到答案,而是将任务分解为更小、更合乎逻辑的步骤。

  • 示例:如果你给它一段录音并要求生成视频,Archon 不会直接猜测视频。它会首先根据声音“思考”人物的形状和表情,然后生成人物的描述,接着才生成视频。
  • 这种分步的方法就像一座桥梁,确保最终的视频看起来自然,并与声音完美匹配,而不是成为一团混乱。

4. “魔法编辑器”(任意模态编辑)

Archon 极其灵活。想象一下,你有一段数字人类说话的视频。使用 Archon,你可以编辑该视频的任何部分,而不会破坏其余部分:

  • 更改剧本:你可以输入一个新句子,AI 将重新合成语音和口型以匹配,同时保持人物的面部和风格完全不变。
  • 更改外观:你可以告诉 AI,“让这个人看起来更老”,或者“改变他们的性别”,它将更新视频以反映这些变化,同时保持原始声音和剧本完整。
  • 更改动作:你可以使用不同的视频作为参考,让数字人类以新的方式移动头部或身体。

总结

简而言之,Archon是一个单一的、强大的 AI 系统,它统一了数字人类的创作。它用一个连贯的大脑取代了一堆杂乱无章的独立工具,这个大脑能够同时理解文本、声音和视频。通过利用“智能草图”来节省内存,并利用“分步思维”来确保质量,它能够从几乎任何起点(无论是句子、录音还是视频片段)生成和编辑逼真的数字人物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →