← 最新论文
🤖 AI

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

本文介绍了 FitAQA,这是一个包含 30 项运动、2,219 个视频和 5,512 个问答实例的综合基准测试,采用了统一的形式错误分类法,旨在评估多模态大语言模型在健身动作质量评估方面的能力,并揭示了当前模型主要在视觉感知方面存在困难。

原作者: Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在看着一位朋友尝试从一段视频中学习一个新的舞蹈动作。你可以轻易地判断出他们做得对还是错,但要解释清楚为什么他们的膝盖弯曲的角度不对,或者为什么节奏乱了,则需要敏锐的观察力和专业的知识。这正是**动作质量评估(Action Quality Assessment, AQA)**的核心。虽然计算机在识别“正在发生什么动作”(比如大喊“开合跳!”)方面已经做得非常出色,但在判断“动作做得如何”方面,它们在历史上一直表现挣扎。最近,一种新型的超智能计算机大脑——**多模态大语言模型(Multimodal Large Language Model, MLLM)**出现了。这些模型既能看视频也能读文本,有望成为一名私人教练,不仅能说“做得好”,还能对你的动作进行具体的点评。但这里有一个巨大的疑问:这些 AI 教练真的准备好帮助我们了吗,还是仅仅在瞎猜?

这正是 FitAQA 这篇论文试图探究的问题。研究人员与运动科学专家合作,为 AI 构建了一个庞大的“体育课”,以测试其教练技能。他们不仅仅是要求 AI 给出一个分数;他们还创建了一个包含 3ing 种不同自重训练动作(如俯卧撑和深蹲)的详细清单,并将“良好姿态”细分为六个特定类别:对齐(alignment)、对称性(symmetry)、稳定性(stability)、协调性(coordination)、节奏(tempo)和完整性(completeness)。随后,他们向 AI 输入了 2,219 段视频和超过 5,500 个问题。结果令人清醒:虽然这些 AI 模型令人印象深刻,但它们目前在发现那些让练习变得安全且有效的微小、关键细节方面表现得非常糟糕。它们经常会完全漏掉错误,或者无法判断错误发生在视频中的何时。这项研究表明,主要问题不在于 AI 不知道健身规则,而在于它难以清晰地看到足以应用这些规则的视觉证据。

伟大的 AI 健身房测试

把当前 AI 视频理解的状态想象成一个读过所有物理教科书但从未亲眼见过球弹跳的学生。他们了解理论,但无法预测球会落在哪里。本文作者意识到,要测试 AI 是否能真正成为健身教练,他们需要的不仅仅是一个关于猜测最终得分的测试。他们需要一个询问:“你看到错误了吗?”“你知道这是个错误吗?”以及“它具体发生在什么时候?”的测试。

为了实现这一点,他们创建了 FitAQA,这是一个像巨大的数字健身房一样的基准测试(标准测试)。该测试并非只关注一种类型的练习,而是涵盖了 30 种不同的动作,从像开合跳这样的全身有氧运动到像反向卷腹这样的核心力量动作。但真正的魔力在于他们如何组织这些错误。他们没有为每种运动单独列出一份错误清单(那会非常混乱),而是与人类专家合作创建了一个统一的“错误分类法”(Error Taxonomy)

想象一本适用于几乎所有动作的“错误字典”。无论你在做深蹲还是俯卧撑,错误都会落入六个桶中:

  • 对齐(Alignment): 你的关节排列是否正确?
  • 对称性(Symmetry): 你的左侧和右侧动作是否一致?
  • 稳定性(Stability): 你是否在不受控制地摇晃或颤抖?
  • 协调性(Coordination): 你的手脚是否和谐地协同运动?
  • 节奏(Tempo): 节奏是太快了还是太慢了?
  • 完整性(Completeness): 你是否完成了完整的运动范围,还是缩短了动作?

他们发现了 38 种跨类别的特定重复错误类型。例如,“头部前倾”或“动作幅度不足”。这使得他们能够测试 AI 在不同练习中识别这些特定模式的能力,而不是仅仅记住“膝盖不直的深蹲是不好的”。

测试的三个层级

研究人员并没有仅仅要求 AI 给出一个最终成绩。他们将任务分解为三个层级,就像带有难度递增的电子游戏一样:

  1. 感知(Perception,即“眼睛”): AI 被展示一段视频并被问到:“你看到臀部发生了什么变化?”它必须在描述性的选项中做出选择,例如“臀部保持在水平线以下”或“臀部升到了水平线以上”。这测试了 AI 是否真的能看到身体部位的移动是否正确。
  2. 判断(Judgement,即“大脑”): 一旦 AI “看到”了动作,它会被问到:“这个臀部动作是否正确?”这需要将它所看到的现象与它的健身知识结合起来。
  3. 时序定位(Temporal Grounding,即“秒表”): 这是最难的一层。AI 被要求:“在这段 30 秒的视频中,这个人究竟在什么时候未能将臀部抬高?”它必须指出错误发生的具体秒数。

结果:AI 目前是个糟糕的教练

当他们使用现有的最先进 AI 模型(包括像 GPT-5.5 这样的大型模型、Gemini 以及各种开源模型)进行测试时,结果令人惊讶。AI 模型的表现通常仅比随机猜测者稍好一点。

  • “眼睛”很弱: 模型在感知任务上表现得很吃力。即使是最好的模型,也只能正确识别约 54% 的视觉细节。这意味着 AI 经常无法分辨膝盖是否弯曲过度,或者背部是否挺直。
  • “大脑”很困惑: 因为 AI 看不清细节,它的判断也很差。它往往过于乐观,即使动作不规范,也会说动作是“正确”的。
  • “秒表”坏了: 对于时序定位任务,模型在精准定位错误发生时刻方面表现极差。它们经常会猜测整个视频都是错误,或者完全漏掉错误。

最有趣的发现来自一个“对照实验”。研究人员问道:如果我们直接告诉 AI 它看到了什么,然后再让它进行判断呢?

当他们给出正确的视觉描述(即“感知”部分的答案)然后询问 AI 进行“判断”时,AI 的表现大幅飙升。例如,一个模型的错误识别能力从低分跃升到了 94% 以上的准确率。这表明 AI 实际上知道健身规则并且具备良好的推理能力,但它失败的原因在于它无法清晰地看到视觉证据来应用这些规则。这就像一位才华横溢的教练戴着一副太黑的墨镜,看不清运动员的姿态。

总结

论文得出结论:虽然多模态大语言模型是理解通用视频内容的强大工具,但它们尚未准备好成为可靠的健身教练。它们难以检测与人体运动相关的微妙质量细节,也无法精确定位错误发生的时间。作者建议,在我们信任 AI 来纠正我们的健身动作之前,我们需要先解决视觉感知问题——即教导 AI 像人类专家一样清晰地观察姿态和动作的微小细节。在此之前,最好还是找一位真人教练在场。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →