← 最新论文
💻 computer science

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

本文介绍了“生成式动作特征指标”(Generative Action Tell-Tales),这是一种将与外观无关的骨骼几何结构与基于外观的特征相结合的新型评估指标,用于评估合成视频中人体运动在时间与解剖学上的合理性,证明其较现有方法显著提升了68%,并与人类感知具有更强的相关性。

原作者: Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看一段有人在做开合跳的视频。在你的肉眼看来,动作非常完美。但紧接着,你注意到了一些奇怪的地方:每当他们跳跃时,他们的手臂就像橡皮筋一样拉长,而且在空中会有一瞬间动作冻结,然后又猛地弹回。你的大脑会立刻尖叫:“这是假的!”这不仅仅是画面看起来好看的问题,而是动作的“物理特性”和“流畅度”感觉不对劲。

长期以来,试图制作这些视频的计算机在制作精美图像方面表现出色,但在制作具有真实感动作方面却表现糟糕。它们生成的视频中,人看起来像个人类,但动作却像个充满故障的机器人。大问题在于:我们没有一种好的方法来衡量为什么这些视频看起来“不对劲”。

“人体运动 GPS”

研究人员决定构建一种新型的尺子,或者说是一个专门针对人体运动的“GPS”。他们称之为生成式动作特征指标(Generative Action Tell-Tales)

以下是他们是如何构建它的:
他们并没有仅仅观察像素(颜色和形状),而是教会了计算机去观察底层的“骨架”。他们使用了一种特殊的 3D 模型(称为 SMPL),该模型描绘了人体真实的构造方式——关节在哪里、肢体有多长以及身体如何旋转。他们还观察了 2D 视频,以捕捉任何奇怪的畸变,比如肢体突然变得过长。

但其中的秘诀在于:他们不仅仅观察单帧画面。他们观察了身体在每一秒之间是如何变化的。他们计算了关节的“速度”和动作的“流向”。他们意识到,真实的真人运动是平滑的,并且遵循物理定律。如果一段视频突然发生剧烈抖动,或者某个身体部位发生了不可能的变形,它就破坏了这种“运动流(motion flow)”。

“流形”(真实动作的俱乐部)

团队在计算机的大脑中创建了一个巨大的、隐形的“俱乐部”。这个俱乐部里充满了成千上万个真实人类做真实动作的例子——跳跃、深蹲、投球。在这个俱乐部里,所有的“真实”动作都聚集在一起,形成一个紧密且有组织的群体。

当一个新的、由计算机生成的视频出现时,系统会尝试邀请它进入这个俱乐部。

  • 如果视频很好: 计算机会说:“嘿,这个动作完全符合真实跳跃者的特征!”(高相似度)。
  • 如果视频是假的: 计算机会说:“喔!你的手臂在像太妃糖一样拉长!你不属于这里!”(低相似度)。

他们将这种与“真实运动俱乐部”之间的距离称为动作一致性(Action Consistency)得分。你离得越远,动作看起来就越“假”。他们还测量了时间相干性(Temporal Coherence),这基本上是在检查视频是否抖动,或者动作是像水一样流畅,还是像破碎的胶片一样断断续续。

“动作特征生成基准测试”(TAG-Bench)

为了测试他们的新尺子是否真的有效,研究人员构建了一个全新的测试,名为 TAG-Bench-v0。他们选取了 10 种不同的动作(如俯卧撑、挥动网球拍或掷铁饼),并要求 5 种不同的 AI 视频生成器制作这些视频。

随后,他们雇佣了 246 名真实人类来观看这些视频,并按 1 到 10 分进行评分。人类被问及两个问题:

  1. 动作一致性: “他们真的完成了应该做的动作吗?”
  2. 时间相干性: “动作看起来是否平滑且符合物理规律?”

大揭秘

当研究人员将他们的新“运动 GPS”得分与人类评分进行对比时,结果非常惊人。

  • 旧方法举步维艰: 现有的最佳工具(例如使用大型 AI 聊天机器人或简单的像素对比工具)与人类意见的关联性很弱。它们的得分与人类判断的相关性仅在 0.28 到 0.45 之间。虽然它们并非完全随机,但它们错过了人类能轻易察觉到的微妙动作错误。
  • 新方法胜出: 他们的指标与人类意见匹配得更加紧密,在动作正确性方面达到了 0.61 的相关性,在平滑度方面达到了 0.64。这是一个巨大的飞跃——比次优方法高出约 68%

他们甚至在计算机从未见过的视频(例如一名女性切割物体,这不在他们的训练列表中)上进行了测试,结果依然有效,这证明该系统学习的是运动的“规则”,而不仅仅是死记硬背特定的舞蹈。

这篇论文排除了什么

作者非常明确地指出哪些方法是行不通的:

  • 仅仅观察像素是不够的: 那些仅仅比较两张图片看起来有多相似(逐像素对比)的工具完全失败了,因为它们忽略了运动。
  • 大型 AI 聊天机器人(MLLM)并非万能: 即便是最聪明的 AI 聊天机器人(如 GPT-5 或 Gemini),也难以发现这些细微的动作错误。它们可能会说一个视频看起来“很好”,因为色彩漂亮,但却没发现人的肘部正向后弯曲。
  • 仅靠 3D 模型是不够的: 如果你只观察 3D 骨架,你可能会错过奇怪的 2D 畸变。你需要同时具备 3D 结构和 2D 视觉线索才能抓住伪造者。

结论有多可靠?

团队并非凭空猜测;他们运行了数据。他们证明了其得分具有统计学意义,这意味着这些结果不太可能是由偶然因素造成的。他们在 300 个生成的视频上测试了系统,发现他们的“运动 GPS”始终与人类评委保持一致。

他们还展示了如果移除系统中的“运动”部分(即检查物体移动速度的部分),得分会大幅下降。这证明了检查“流动感(flow)”是识别虚假视频最重要的部分。

核心总结

论文指出,要真正判断一段视频是否真实,我们需要停止仅仅观察视频的“脸庞”,转而检查它的“骨骼”和“心跳”。他们的新工具 TAG-Bench 为我们提供了一种衡量计算机生成的动作在多大程度上具有“人性”的方法,而目前,这就是我们用来识别动作特征迹象的最佳手段。

虽然他们是在 10 种特定动作(后来扩展到 23 种)上进行的测试,但他们也承认仍有很多需要学习的地方。某些动作,比如投掷沉重的铅球,对任何 AI 来说仍然非常困难,而他们的工具准确地展示了 AI 模型在哪些地方遇到了瓶颈。但这是第一次,我们拥有了一把能够测量“舞蹈”本身,而不仅仅是测量“服装”的尺子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →