← 最新论文
💻 computer science

TDMM-LM: Bridging Facial Understanding and Animation via Language Models

该论文提出 TDMM-LM 框架,通过利用基础生成模型构建大规模文本 - 面部参数配对数据集,首次将面部参数建模转化为语言问题,实现了语言模型在文本驱动面部动画生成与运动语义理解上的双向能力。

原作者: Luchuan Song, Pinxin Liu, Haiyang Liu, Zhenchao Jin, Yolo Yunlong Tang, Zichong Xu, Susan Liang, Jing Bi, Jason J Corso, Chenliang Xu

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Luchuan Song, Pinxin Liu, Haiyang Liu, Zhenchao Jin, Yolo Yunlong Tang, Zichong Xu, Susan Liang, Jing Bi, Jason J Corso, Chenliang Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 TDMM-LM 的新项目,它的核心目标非常有趣:让计算机不仅能“看懂”人脸的微表情,还能像导演一样,用文字指挥人脸做出各种表情和动作。

为了让你更容易理解,我们可以把这项技术想象成给电脑装上了一套“面部翻译官”和“魔法指挥棒”

1. 遇到的难题:电脑“脸盲”且“记性差”

以前的电脑在处理人脸视频时,就像是一个拿着放大镜看照片的近视眼

  • 问题一(太笨重): 电脑通常把视频里的每一帧画面都当成成千上万个像素点(图片令牌)来处理。这就像为了描述一个人的微笑,电脑要数清楚他脸上每一根毛孔的位置,效率极低,而且容易忽略那些转瞬即逝的微妙表情(比如嘴角的一丝抽动)。
  • 问题二(数据少): 现有的训练数据大多来自 YouTube 或 TikTok,里面的人大多在平淡地说话,缺乏大笑、愤怒、惊讶等丰富表情。这导致电脑学出来的“脸谱”很单调,只会做“面无表情”或“假笑”。

2. 解决方案:造了一个“虚拟表情工厂” (Open3DFaceVid)

为了解决数据不够的问题,作者们没有去网上到处找视频,而是自己建了一个“虚拟表情工厂”

  • 怎么做? 他们利用最先进的“文生视频”AI(比如 Sora 类的模型),编写了大约 200 种不同的情绪指令(如“极度愤怒”、“羞涩的微笑”、“惊讶地挑眉”)。
  • 结果: 这些 AI 生成了约 80 小时 的高质量人脸视频。
  • 关键一步: 他们把这些视频里的每一帧都“翻译”成了 3D 面部参数(就像给脸戴了一个隐形的 3D 面具,只记录面具的变形数据,而不是像素图片)。
    • 比喻: 以前是记录“这张照片长什么样”,现在是记录“这个面具是怎么动的”。这样数据量小了很多,但保留了所有微表情的细节。

3. 核心魔法:把表情变成“语言” (TDMM-LM)

有了这个巨大的“表情 - 文字”数据库,作者训练了一个大语言模型(LLM),让它学会了两种超能力:

能力一:看图说话 (Motion2Language)

  • 场景: 你给电脑一段 3D 人脸动作数据。
  • 电脑反应: 它不再是一堆乱码,而是能像人一样描述:“这个人说话时带着一点担忧,眉毛皱了起来,头几乎没动。”
  • 比喻: 就像给电脑装了一个高情商的“面部翻译官”,它能读懂那些只有几帧就能完成的微妙表情,并用人话讲出来。

能力二:听令行事 (Language2Motion)

  • 场景: 你输入一段文字,比如“一个年轻女孩带着羞涩的微笑,轻轻点头”。
  • 电脑反应: 它能直接生成一段对应的 3D 人脸动画,完美还原你描述的表情和动作。
  • 比喻: 这就像给电脑发了一根**“魔法指挥棒”**。你不需要懂复杂的 3D 建模,只要像写小说一样描述,电脑就能指挥虚拟人脸“演”出来。

4. 为什么这很重要?

  • 更精准: 以前的模型看视频像看“模糊的电视”,这个模型看的是“高清的骨架数据”,所以能捕捉到眨眼、抿嘴这种小动作。
  • 更丰富: 因为数据是人工精心设计的,所以电脑学会了以前很少见的表情(比如“轻蔑的冷笑”或“强忍泪水”),不再只会傻笑或发呆。
  • 更高效: 用“参数语言”代替“像素图片”,让电脑处理速度快了,也能记住更长的时间序列。

总结

这就好比以前我们教机器人跳舞,只能给它看视频,它学得慢且动作僵硬;现在,我们直接教机器人**“跳舞的乐谱”(3D 参数),并且给它一本“表情字典”**(大语言模型)。

现在,你可以直接对电脑说:“请做一个‘既惊讶又有点尴尬’的表情”,电脑就能精准地演给你看;或者给它看一段表演,它能精准地告诉你演员当时心里在想什么。这就是 TDMM-LM 带来的改变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →