The semantic geometry of action: convergence across foundation models, human behaviour and the brain
本研究は、基盤モデルが自然な動作を、人間の行動的判断および皮質表現と収束する意味論的幾何学の中に整理しており、人間の類似性評価と脳活動の両方を予測する上で従来のビデオエンコーダーを凌駕していることを示している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
人間は、動きの中にある世界を読み解く達人です。他人の姿を見る時、私たちは単に空間を移動する身体を見ているのではありません。その人が何をしようとしているのか、なぜそれを行っているのか、そして次にどのような動きをするのかを、瞬時に理解しているのです。この動的な動作を解釈する能力は、人間の知性の根幹であり、複雑な社会的状況を切り抜け、他者と協力することを可能にしています。数十年にわたり、科学者たちはこれと同じことができる人工知能を構築しようと試みてきました。現代のコンピュータプログラムは、人が走っているのか歩いているのかの違いを判別するなど、高い精度で動作を識別できますが、研究者たちは、これらの機械が人間と同じように、動きの背後にある「意味」を本当に理解しているのかどうか、長年疑問を抱いてきました。機械は、人間が用いるのと同じ論理に基づいてこれらの動作を内部的な「精神」の中で整理しているのでしょうか。それとも、単にピクセルのパターンを照合しているだけで、根本的な概念を把握していないのでしょうか。
中国の自動化研究所の研究チームは、この問いに答えるための重要な一歩を踏み出しました。彼らは、人間と高度な人工知能が「人間の動作」という概念をどのように整理しているのか、その隠れた構造をマッピングすることに着手しました。大規模言語モデル、視覚と読解の両方が可能なマルチモーダルモデル、そして人間の脳における動作の内部的な「地理」を比較することで、彼らは驚くべき収束を発見しました。この研究は、これらの人工システムが膨大なデータで訓練されると、人間の知覚に密接に一致し、さらには人間の脳がこれらの動きを処理する方法をも反映した、人間動作に関する思考様式を自然に発達させることを示唆しています。
これを探求するために、研究者たちは人工知能モデルを心理学実験の参加者のように扱いました。彼らはモデルに対し、料理やガーデニングから、格闘やダンスに至るまで、人々が様々なことを行っている数千もの短いビデオクリップとテキストによる記述を提示しました。モデルには、単純ながらも示唆に富むタスクが課されました。それは、3つの異なる動作が与えられた際に、どれが「仲間外れ」であるかを特定するというものです。例えば、誰かがスキーをしている、誰かが絵を描いている、誰かがロッククライミングをしているというビデオを見せられた場合、モデルはどの動作が他の2つと最も異なっているかを判断しなければなりません。研究者たちは、これら数百万もの選択を分析することで、モデルが動作を分類するために使用している目に見えないメンタルマップ(精神的地図)を再構成することができました。彼らは同様の手法を大規模な人間の被験者グループにも適用し、人々が自然にどのように行動をグループ化し、区別しているかという基準値を作成しました。
結果として、テキストのみのモデル(動作の記述のみを読むもの)も、マルチモーダルモデル(実際のビデオを視聴するもの)も、人間のマップと驚くほど似た内部マップを発達させていることが明らかになりました。これらのマップはランダムなものではなく、類似した行動は近くに、異なる行動は遠くに配置される低次元の空間へと動作を整理していました。決定的なことに、これらの人工的なマップは、単純な視覚的特徴に依存する従来のビデオ解析ツールよりも、人間の選択を正確に予測しました。この研究は、モデルが単にビデオを暗記しているのではなく、人間が動きを理解するために用いる抽象的な目標や社会的文脈を捉えていることを示しました。例えば、モデルは「社交的な」動作をまとめ、「孤独な」タスクとは切り離して学習しました。これは人間が行うのと同様です。
これらの内部マップが真に意味のあるものであり、単なる統計的なトリックではないことを証明するために、研究者たちは2つの厳格な方法でテストを行いました。第一に、彼らはモデルの内部マップを使用して、ビデオ生成システムを制御しました。モデルの内部表現における単一の数値を調整することで、ビデオの内容を滑らかに変更することができました。例えば、「自然に関連する」次元の値を上げると、屋内シーンが屋外へと変化し、「スポーツ」の次元を高めると、活動が競技へとシフトしました。これは、モデルが、新しい一貫した視覚的シーンを作り出すために操作可能な、明確で制御可能な動作の概念を学習していたことを実証しています。
第二に、そしておそらく最も重要なことに、研究者たちはこれらの人工的なマップが人間の脳活動を予測できるかどうかをテストしました。彼らは学習された固定のマップを取り、人々が数千種類の動作ビデオを見ている際の脳スキャンから得られた大規模なデータセットに適用しました。その結果、モデルの内部的な組織化が、特定の動作を見ている際に人間の脳のどの部分が活性化するかを正確に予測できることが分かりました。ビデオを一度も見ることなく、言語記述のみから動作の概念を学習したテキストベースのモデルは、複雑な社会的・目標指向的な行動を理解する高次脳領域の活動を予測することにおいて、特に優れた性能を示しました。これは、言語を通じてのみ学習された動作の抽象的概念が、人間の脳が運動を表現する方法の核となる構造を捉えるのに十分であることを示唆しています。討論しています。
この研究はまた、モデルの種類による興味深い違いも浮き彫りにしました。ビデオを視聴するモデルは微細な視覚的詳細を捉えた一方で、テキストのみのモデルは、動作を広範で意味のあるカテゴリーに整理することにおいて驚くほど効果的でした。一部の脳領域では、テキストベースのモデルが、人間の神経反応を予測する上でビデオモデルを上回ることさえありました。これは、動作の概念的な理解、つまり「人が何を達成しようとしているのか」を知ることが、具体的な動きがどのように見えるかという視覚的な詳細よりも、人間の知覚にとって重要である可能性を示唆しています。
最終的に、この研究は、人工知能と生物学的知性の関係を理解するための強力な新しい手法を提供しています。それは、機械が膨大なデータにさらされると、人間と共有できる「意味論的な幾何学」を発達させ、人間自身のものと機能的に類似した方法で世界の動作を整理できることを示しています。これらの知見は、真に知的な機械への道は、人間にルールを明示的にプログラミングすることではなく、むしろ、人間の経験の豊かさへの露出を通じて、それらの構造を自ら発見させることにあるかもしれないということを示唆しています。この研究は、機械に意識や感情があると言及しているのではなく、機械が人間の行動に対する構造的な理解を構築できることを実証しており、人間と機械の間の将来的な相互作用のための有望な基礎を提供しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。