← 最新论文
💬 NLP

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

该论文通过实证评估发现,尽管引入了多种增强策略,当前最先进的视觉语言模型在动作质量评估任务中表现仅略高于随机猜测,且存在系统性偏差和细粒度运动质量判断的根本性局限,表明其尚未达到可靠部署的水平。

原作者: Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一份**“视力与常识大考”的体检报告**,专门用来测试目前最聪明的 AI 模型(视觉语言模型,简称 VLM)到底能不能当**“动作裁判”**。

想象一下,你请了一位博古通今的“超级学霸”来当体育老师或康复教练。这位学霸读过所有关于体操、跳水、健身的书,甚至能看懂复杂的动作图解。但是,当你真的让他看一段视频,判断一个人做的深蹲标不标准、跳水动作漂不漂亮时,他表现如何呢?

这篇论文的作者们(来自 Sword Health 和里斯本大学等机构)就是来给这些“超级学霸”做摸底考试的。

1. 考试背景:为什么我们要考 AI?

动作质量评估(AQA)在现实生活中很有用:

  • 康复理疗:病人回家做复健,AI 能像教练一样实时纠正动作,防止二次受伤。
  • 体育训练:运动员练动作,AI 能指出哪里发力不对。
  • 比赛打分:像跳水、花样滑冰,AI 可以充当更客观的裁判。

以前,我们主要靠专门的计算机程序来打分。现在,有了像 Gemini、Qwen 这样既能“看”又能“聊”的超级 AI,大家觉得它们应该能胜任这个工作,因为它们知识渊博,还能像人一样解释原因。

2. 考试过程:我们怎么考的?

作者们找来了目前最顶尖的三款 AI 模型(Gemini 3.1 Pro, Qwen3-VL, InternVL3.5),让它们去处理五个不同的“考场”:

  • 健身房:深蹲、推举、划船等(看动作标不标准)。
  • 奥运赛场:花样滑冰(给动作打分,从 -5 到 5)和跳水(给动作打分,从 0 到 10)。

他们尝试了各种“作弊”或“辅助”手段,看看能不能帮 AI 考高分:

  • 给骨架图:就像在运动员身上画个火柴人,让 AI 只看骨头位置,忽略衣服和背景。
  • 换种问法:比如“请详细描述你看到了什么”或者“先思考再回答”(类似让人类先打草稿)。
  • 给提示词:告诉 AI“深蹲时背要直”或者“深蹲时背不能弯”。
  • 给样题:在考试前给 AI 看几个标准答案的例子(少样本学习)。

3. 考试成绩:令人失望的“不及格”

结果非常残酷:这些“超级学霸”在动作评估上,表现只比“瞎蒙”好一点点,甚至有时候就是瞎蒙。

  • 基本操作:让 AI 判断动作对不对,或者给个分数,它们的准确率非常低,甚至不如随机猜。
  • 辅助手段失效
    • 给 AI 看“火柴人”(骨架图),它反而更糊涂了,因为看不懂复杂的肌肉发力。
    • 让 AI“先思考再回答”,并没有让它变聪明。
    • 给 AI 看标准动作的例子,只有在极少数情况下(比如看静态图片)有一点点用,看视频时基本没用。

4. 深度诊断:AI 到底哪里“病”了?

作者们发现,AI 不是“笨”,而是有两个严重的“性格缺陷”

缺陷一:盲目乐观(“默认正确”偏见)

AI 好像有个“老好人”心态。不管视频里的人动作做得多烂,AI 总觉得:“嗯,这应该是个标准动作吧?”

  • 比喻:就像一位过于慈祥的教练,不管学生做得多歪,他总觉得“只要努力了就是对的”,从而忽略了明显的错误。这是因为 AI 脑子里存了大量“标准动作应该长什么样”的知识,它太依赖这些书本知识,而不是眼前看到的真实情况

缺陷二:耳根子软(“语言诱导”偏见)

AI 太容易被提问的方式带偏了。

  • 比喻:如果你问 AI:“这个人做得吗?”,它倾向于说“好”;如果你问:“这个人做得不好吗?”,它又倾向于说“不好”。哪怕你问的是同一个动作,只是换了一种说法,AI 的判断就会跟着变。它太在意怎么问,而不是看到了什么

5. 终极测试:换个考法行不行?

为了测试 AI 是不是真的不懂,作者们把考试改成了**“二选一”**(对比题):

  • “视频 A 和视频 B,哪个动作更好?”
  • 这种考法消除了“默认正确”和“语言诱导”的干扰,因为 AI 没法瞎猜,必须真的看出区别。

结果依然不好:虽然当两个动作差距特别大时(比如一个像专业选手,一个像刚学走路),AI 能猜对;但只要动作差别稍微小一点(比如都是专业选手,只是细微差别),AI 就彻底懵了,表现依然接近随机猜测。

6. 结论:现在的 AI 还当不了教练

这篇论文给整个领域泼了一盆冷水,但也很有价值:

  1. 现状:目前的通用 AI 模型(VLM)完全不具备可靠评估动作质量的能力。它们太依赖书本知识,太容易被语言带偏,而且看不懂细微的动作差别。
  2. 原因:这不是因为 AI 不够聪明,而是因为它们缺乏对物理世界细微运动的真实感知。它们像是在“背答案”,而不是在“看视频”。
  3. 未来:在 AI 能真正当上康复教练或体育裁判之前,我们需要从根本上提升它们的能力,或者专门针对动作评估去训练它们,而不是指望通用的“大模型”直接拿来就用。

一句话总结
现在的 AI 就像是一个背熟了所有体育理论书,但从来没下过场、没看过真人做动作的“理论派”学生。让他写论文他可能满分,但让他当裁判,他只会瞎猜,而且特别容易受你说话语气的影响。在它们真正学会“看”懂动作之前,我们还得靠真人教练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →