← 最新の論文
🤖 AI

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

本論文は、統一されたフォームエラーの分類体系を持つ30種類のエクササイズにわたる2,219本の動画と5,512件のQAインスタンスで構成される包括的なベンチマークであるFitAQAを紹介し、現在のモデルが主に視覚的知覚において苦戦していることを明らかにすることで、マルチモーダル大規模言語モデルのフィットネス動作品質評価における能力を評価するように設計されている。

原著者: Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人が動画を見ながら新しいダンスの動きを習おうとしている場面を想像してみてください。あなたは、彼が正しくできているか間違っているかを簡単に判断できますが、なぜ膝が間違った方向に曲がっているのか、あるいはなぜリズムがずれているのかを正確に説明するには、鋭い観察眼と専門的な知識の両方が必要です。これが**アクション品質評価(Action Quality Assessment: AQA)**の核心です。コンピュータは、「ジャンピングジャック!」と叫ぶように「何が行われているか」を単に認識することには非常に長けてきましたが、歴史的に、それが「どのように」行われているかを判断することには苦労してきました。最近では、**マルチモーダル大規模言語モデル(MLLM)**と呼ばれる新しいタイプの超スマートなコンピュータ・ブレインが登場しました。これらのモデルは動画を見ることができ、テキストを読むこともできるため、単に「よくできました」と言うだけでなく、フォームを実際に批評できるパーソナルコーチになることを約束しています。しかし、ここで大きな疑問があります。これらのAIコーチは、本当に私たちを助ける準備ができているのでしょうか、それとも単に推測しているだけなのでしょうか?

これこそが、論文FitAQAが明らかにしようとしていることです。研究者たちは、スポーツ科学の専門家と共に、AIのコーチングスキルをテストするための巨大な「体育の授業」を構築しました。彼らは単にAIにスコアを出すよう求めたのではなく、30種類の異なる自重エクササイズ(プッシュアップやスクワットなど)の詳細なチェックリストを作成し、「正しいフォーム」を「アライメント(整列)」「対称性」「安定性」「コーディネーション(協調性)」「テンポ」「完全性」という6つの特定のカテゴリーに分解しました。そして、2,219本の動画と5,500以上の質問をAIに与えました。その結果は、少し現実を突きつけるものでした。これらのAIモデルは印象的ではありますが、エクササイズを安全かつ効果的にするための微細で重要な詳細を見抜くことに関しては、現状では極めて拙いのです。AIはエラーを完全に見逃したり、ビデオの「いつ」に間違いが起きたのかを判別できなかったりします。この研究は、主な問題はAIがフィットネスのルールを知らないことではなく、そのルールを適用できるほど視覚的な証拠を明確に「見ること」に苦戦していることであると示唆しています。

偉大なるAIジム・テスト

現在のAIのビデオ理解の状態を、物理学の教科書はすべて読んだことがあるが、ボールが跳ねる様子を一度も見たことがない学生だと考えてみてください。彼らは理論は知っていますが、ボールがどこに落ちるかを予測することはできません。著者たちは、AIが本当にフィットネスコーチになれるかどうかをテストするためには、単に最終的なスコアを推測するだけのテストでは不十分であることに気づきました。彼らは、「エラーを見つけたか?」「それがエラーであると分かっているか?」「そして、それは正確にいつ起きたのか?」と問う必要があると考えたのです。

これを実現するために、彼らは巨大なデジタル・ジムのフロアのようなベンチマーク(標準テスト)であるFitAQAを作成しました。単一の種類のエクササイズを見るのではなく、ジャンピングジャックのような全身の有酸素運動から、リバースクランチのような体幹強化の動きまで、30種類の異なる動きを網羅しました。しかし、本当の魔法は、間違いの整理の仕方にあります。すべてのエクササイズに対して個別のエラーリストを作成する(それは混沌としたものになるでしょう)代わりに、彼らは人間の専門家と協力して、統一された**「エラー・タクソノミー(分類体系)」**を作成しました。

ほとんどすべての動きに適用できる「間違いの辞書」を想像してください。スクワットであれプッシュアップであれ、エラーは以下の6つのバケット(分類)に分類されます:

  • アライメント(整列): 関節は正しく並んでいますか?
  • 対称性: 左側は右側と同じことをしていますか?
  • 安定性: 体が制御不能に揺れたり、震えたりしていませんか?
  • コーディネーション(協調性): 手足は調和して動いていますか?
  • テンポ: リズムが速すぎたり遅すぎたりしませんか?
  • 完全性: 全身の可動域を使い切っていますか、それとも途中で止まっていますか?

彼らは、これらのカテゴリーを通じて、38種類の特定の繰り返されるエラーを見つけ出しました。例えば、「前頭部姿勢(ヘッドフォワード)」や「可動域不足」などです。これにより、単に「膝が悪いスクワットはダメだ」と暗記するのではなく、異なるエクササイズ間でこれらの特定のパターンを特定するAIの能力をテストすることが可能になりました。

テストの3つのレベル

研究者たちは、単にAIに最終的な成績を付けさせたのではありません。彼らは、難易度が上がっていくビデオゲームのように、タスクを3つのレベルに分解しました。

  1. 知覚(目): AIはビデオを見せられ、「腰はどうなっていますか?」と問われます。AIは「腰はラインより下に留まっている」や「腰はラインより上に上がっている」といった中立的な記述の中から選択しなければなりません。これは、AIが身体の部位が正しく動いていることを実際に「見ている」かをテストします。
  2. 判断(脳): AIが動きを「見た」後、「この腰の動きは正しいですか?」と問われます。これには、見たものとフィットネスの知識を組み合わせる必要があります。
  3. 時間的接地(ストップウォッチ): これが最も難しいレベルです。AIは、「この30秒間のビデオの、正確にどの時点で、人は腰を高く上げることに失敗しましたか?」と問われます。AIは、エラーが発生した特定の秒数を指し示さなければなりません。

結果:AIは(今のところ)下手なコーチである

彼らが最新の高度なAIモデル(GPT-5.5やGemini、および様々なオープンソースモデルを含む)を用いてテストを実行したところ、結果は驚くべきものでした。AIモデルのパフォーマンスは、概してランダムな推測を行う者よりもわずかに高い程度でした。

  • 目は弱い: モデルは**知覚(Perception)**タスクにおいて著しく苦戦しました。最高性能のモデルでさえ、視覚的な詳細を正しく捉えられたのは約54%でした。これは、AIが膝が曲がりすぎているのか、あるいは背中が真っ直ぐなのかを判別できなかったことを意味します。
  • 脳が混乱している: AIは詳細をうまく見ることができなかったため、その**判断(Judgement)**も劣悪でした。AIは楽観的すぎる傾向があり、実際には正しくない場合でも、エクササイズを「正しい」と判定してしまうことがよくありました。
  • ストップウォッチは壊れている: **時間的接地(Temporal Grounding)**タスクにおいて、モデルはエラーが起きた瞬間を特定することに関して非常に無力でした。彼らは、ビデオ全体がエラーであると推測したり、エラー自体を完全に見逃したりすることがよくありました。

最も興味深い発見は、「コントロール実験」から得られました。研究者はこう問いかけました:「もし、AIに見た内容を正確に伝えて、その上で判断を求めたらどうなるだろうか?」

彼らがAIに正しい視覚的記述(「知覚」の回答)を与え、その上で「判断」を求めたところ、AIのパフォーマンスは急上昇しました。例えば、あるモデルのミスを特定する能力は、低いスコアから94%以上の精度へと跳ね上がりました。このことは、AIは実際にフィットネスのルールを知っており、論理的に考えることもできるが、そのルールを適用するための視覚的な証拠を十分に「見る」ことができていないことを示唆しています。それはまるで、目の前の選手のフォームを見るには、サングラスが暗すぎて見えない優秀なコーチのようなものです。

結論

本論文は、マルチモーダル大規模言語モデルは一般的なビデオ内容を理解するための強力なツールではあるものの、信頼できるフィットネスコーチとして機能する準備はまだ整っていないと結論付けています。AIは、人間の動きに関連する微妙で質の高い詳細を検出することに苦しみ、エラーがいつ発生したかを正確に特定することもできません。著者らは、AIが私たちのトレーニングフォームを修正することを信頼できるようになる前に、私たちは視覚的知覚の問題を解決する必要があると示唆しています。つまり、人間の専門家と同じくらい明確に、姿勢や動きの微細な詳細を見ることができるようにAIを教える必要があるということです。それまでは、おそらく本物の人間のトレーナーを介在させておくのが最善でしょう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →