← 最新の論文
🤖 AI

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

本論文は、ロボット操作システムがビデオを通じた人間の行動の観察から推論を行う能力を評価する、3,000個のロングホライゾン・インスタンスからなる包括的なベンチマークであるWatchActを紹介し、現在の最先端モデルが、イベントのグラウンディング、手続き的推論、意図の推論、およびエピソード的なトラッキングを必要とするタスクにおいて著しく苦戦していることを明らかにしている。

原著者: Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

キッチンに入ると、散らかった状態を目にしました。ある人が引き出しを開け、料理のために3つのスパイスの瓶を取り出し、それらをカウンターの上にバラバラに置いたまま去っていきました。あなたはロボットに「すべて元あった場所に戻して」と言います。

人間にとって、これは簡単なことです。人間は「何が起きたか(瓶は引き出しから出されたこと)」、「どのような順序で(一つずつ取り出されたこと)」、「なぜか(料理をするため)」を覚えています。人間は、自分の頭の中にあるその動作のビデオ映像を使って、解決策を導き出します。

今日のロボットにとって、これは悪夢です。ほとんどのロボットのベンチマークは、ロボットに散らかったカウンターの静止画一枚だけを見せ、片付けを要求するだけです。彼らには、その散らかり具合がどのように作られたかという「映画(プロセス)」が与えられていません。文脈がない状態で、ロボットは推測しているに過ぎないのです。

WatchAct は、ロボットが実際に人間の動画を注視し、何が行われたかを理解し、その記憶に基づいて片付けを行ったり、タスクを継続したりできるかどうかを検証するために設計された新しいテスト(ベンチマーク)です。

以下に、簡単な比喩を用いてその仕組みを解説します。

1. テスト:「探偵と俳優」

ロボットを探偵、ビデオを犯罪現場のテープと考えてください。

  • 入力: ロボットは、人間が何かをしている(例:ボウルを動かしている)動画と、テキストによる指示(例:「ボウルを戻して」)を受け取ります。
  • ゴール: ロボットは隠されたストーリーを解明しなければなりません。人間は空腹だったからボウルを動かしたのか? ボウルを左に動かしたのか、右に動かしたのか? 元々はどこにあったのか?
  • 規模: このテストには、14種類の異なる課題をカバーする3,000もの異なるシナリオ(膨大な短編映画のライブラリのようなもの)が含まれています。

2. 4つの「脳のスキル」

研究者たちは、タスクを4つのカテゴリーに分類しました。これらは、探偵としてのレベル分けのようなものです。

  • イベント・グラウンディング(手がかりを見つける): ロボットはビデオを見て、「あ、3秒目に人間が赤いカップを手に取った」と言えるでしょうか? これは、映画の中で重要な特定の瞬間を見つけ出すようなものです。
  • プロシージャル・リーズニング(レシピを理解する): ロボットは出来事の「順序」を理解できるでしょうか? もし人間が本を棚に置き、次にカップをテーブルに置いたとしたら、ロボットはそのシーケンスを理解して、逆転させるか、あるいは継続させる必要があります。
  • 暗黙的な意図の推論(心を読み取る): 人間は必ずしも言葉で伝えません。ただジェスチャーをするだけの場合もあります。もし人間が瓶を漠然と指差した場合、ロボットは「ああ、あれを開けてほしいのだな」と推測できるでしょうか?
  • エピソード的推論(記憶力テスト): ロボットはシーンが「どのように変化したか」を覚えているでしょうか? もし人間が椅子を隅から中央へ移動させた場合、ロボットは椅子を「元の家」に戻すために、その元の場所を知っている必要があります。

3. ロボットのテスト方法

研究者たちは単にロボットに「やってみて」と頼んだのではありません。ロボットの脳を2つの部分に分解し、どこで失敗するかを確認しました。

  1. プランナー(脳): ロボットはビデオを見て、ステップ・バイ・ステップの計画を書けるでしょうか?(例:「1. 瓶を手に取る。2. 棚へ運ぶ。」)
  2. ドゥアー(手): もし完璧な計画を与えられた場合、ロボットは実際に腕を動かして実行できるでしょうか?

これらはコンピュータ・シミュレーションと、実機のロボットアーム(Franka Research 3)の両方でテストされました。

4. 結果:「ロボットはまだ学習中である」

結果は、非常に謙虚なものでした。現在利用可能な最も賢いAIモデルでさえ、非常に苦戦しました。

  • 「脳」の失敗: ビデオを見て計画を立てるよう求められた際、最高のAI(Gemini-3.1-Pro)の正答率はわずか**36.8%でした。人間は97.1%**でした。AIは半分以上のタスクにおいて、実質的に推測している状態です。
  • 「手」の失敗: 研究者が「完璧な計画」を与えた場合でも(つまり「脳」の部分が問題ではない場合)、ロボットの「手」(ポリシー)の成功率はわずか**21.5%**でした。これは、完璧なレシピがあるのに、オーブンの使い方がわからずにケーキを焦がしてしまうようなものです。
  • 現実世界はより困難: 実機のロボットアームで試行したところ、成功率はさらに低下し、**14.0%**となりました。

5. なぜ失敗するのか?

論文では、ロボットが失敗する主な理由として3つを挙げています。

  • 長いストーリー: ビデオが長く、多くのステップ(例:6ステップの調理工程)を含む場合、ロボットは混乱し、最後まで到達する頃には最初の方を忘れてしまいます。
  • 視点の問題: ビデオが変な角度(例:人間の後ろからの視点)から撮影されていたり、指示が「人間の左側に」となっていたりする場合、ロボットは迷子になります。「人間の左」を「ロボットの左」に翻訳することができないのです。
  • 未知の物体: ロボットがこれまで見たことのない物体(例:新しいタイプの箱)を見た場合、動きが止まってしまいます。知識を汎用化することができないのです。

結論

WatchAct は、現実を突きつけるものです。ロボットは静止した部屋の中で物を動かすことは得意になりつつありますが、人間を観察し、散らかりの背後にあるストーリーを理解し、次に何をすべきかを判断することについては、極めて不得手であることを示しています。

論文は、ロボットが私たちの家庭で真に共に働くことはまだ遠い、と結論づけています。なぜなら、彼らは人間のように「見て学ぶ」ことがまだできないからです。キッチンで私たちを助けられるようになるには、動画の中の点と点を結びつける能力を、もっと向上させる必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →