← 最新の論文
💻 computer science

HumanCLAW: Can Vision-Language Models Act Through a Body?

本論文は、身体的知能を評価するために視覚言語モデルの意思決定と運動実行を分離するフレームワークであるHumanCLAWを導入し、現在のモデルが長期的な物理タスクに失敗する主な原因は、認識能力の欠如ではなく、身体的自己意識の欠如であることを明らかにしている。

原著者: Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li
公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いロボットにビデオゲームを教えていると想像してください。しかし、これは単なるゲームではありません。ロボットは、つまずいたり、転んだり、壁にぶつかったり、花瓶を倒したりする可能性がある、現実の物理的な体を制御しなければならないゲームです。人工知能の世界には、ロボットのための主に2種類の「脳」があります。1つのタイプは、何百万もの特定の飛行経路を暗記したパイロットのようなものです。以前に見たことを正確に実行することには長けていますが、もし風向きが変われば、墜落してしまうかもしれません。もう1つのタイプは「視覚言語モデル(VLM)」です。これは、膨大な本のライブラリとカメラの目を持ったロボットだと考えてください。物語を読み、写真を見て、「赤いソファを見つけてそこに座る」といった複雑な概念を理解することができます。これらは推論や会話には驚異的ですが、実際に体を使って「動いた」ことは一度もありません。

大きな疑問は、科学者たちが今まさに問いかけていることです。「この本に詳しいロボットは、実際に現実世界で何かをすることができるのだろうか?」ということです。例えば、「キッチンへ行く」という高度なアイデアを、転ばずに歩くために必要な、一瞬一瞬の細かな筋肉の動きへと変換できるのでしょうか?通常、ロボットが失敗したとき、それが「脳」の判断ミス(壁に向かって歩いてしまったなど)なのか、それとも「体」が仕事をこなせなかったのか(バランスを崩したなど)を判別するのは困難です。この謎を解くために、研究者たちは、思考と動作を切り離し、ロボットの脳のどこで行き詰まっているのかを正確に特定する方法を必要としました。

ここで、HumanCLAWと呼ばれる新しい研究が登場します。研究者たちは、スマートなAIの脳が、物理的な世界の中で人間のような体を制御できるかどうかを確かめるための、特別なテスト環境を構築しました。彼らはAIに動き方を訓練したわけではなく、単にカメラと目標、そして「前へ歩く」「回転する」「座る」といった基本的な動作のリストを与えただけでした。そして、AIが41種類の異なる仮想の家の中をナビゲートして、物体を見つけ出し、そこに座るようにさせたのです。

結果は衝撃的なものでした。現在存在する最もスマートで高度なAIモデルでさえ、ほとんどの場合で失敗したのです。最高のモデルでさえ、試行回数のわずか**16.8%**にしか成功しませんでした。つまり、**83%**以上の確率で失敗したことを意味します。

ここからが奇妙な点です。AIは「目が見えなかった」ために失敗したのではありません。ターゲットとなる物体(ソファなど)が実際に画面に現れたとき、AIはほぼ常にそれを認識していました。AIは何を見ているのかを理解していたのです。問題は「見ること」ではなく、「それがどこにあるのかを知ること」でした。

研究者たちは、これらのAIモデルが深刻な「身体失認症(ボディ・アムネジア)」に陥っていることを発見しました。彼らは、家具を完璧に見ているものの、自分の足がどこにあるのか全く分かっていない幽霊のような存在なのです。AIが歩こうとするとき、すでにソファに到着しているのに歩き続けたり、あるいはまだ遠くにいるのに到着したと思い込んで早すぎる段階で止まってしまったりすることがよくありました。座ろうとするときは、ソファが真下にないことに気づかず、何もない空間に向かって体を下げ、空中に座ってしまうこともありました。また、壁にそのまま突っ込んだり、障害物に躓いたりしても、それに気づくことすらありませんでした。

この研究は、これらのAIモデルが世界を記述することには非常に優れている一方で、自分自身の置かれた状況を理解することには極めて劣っていることを示しています。彼らは椅子がどのような見た目であるかは説明できますが、転ぶことなくそこに座るための方法を見出すことはできません。研究者たちは、現実世界で真に活動できるロボットを作るためには、単に「見る」ことだけでなく、自分の体がどこにあり、周囲の世界とどのように相互作用しているかを「感じる」ことを教える必要があると結論付けています。この「身体化された自己意識(embodied self-awareness)」の問題を解決しない限り、たとえ最もスマートなAIの脳であっても、物理的な機械の中に閉じ込められた不器用な幽霊のままなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →