Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models
本論文は、現在の視覚言語モデルが、一貫した非言語信号の生成および他者の行動の解釈におけるボトルネックにより、心の理論に基づく推論を協調的な社会的行動へと変換できていないことを明らかにするマルチモーダル・ベンチマークであるMOSAICを導入するものであるが、一方で、明示的な信念と行動の結合を備えたモデルは成功を収めている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人間同士のつながりは、言葉をはるかに超えた、静かで素早い交換に依存しています。私たちが話すとき、同時に視線を動かし、姿勢を調整し、表情を変えています。それと同時に、相手が何を考え、何を感じているのかを推測しようともしています。他者の心を理解し、その理解を用いて自分自身の行動を導くこの能力は、「心の理論」として知られています。数十年にわたり、科学者たちは物語に関する質問に答えさせたり、単純な社会的パズルへの反応を観察したりすることで、この能力を研究してきました。その目的は、人工知能が同様のことができるかどうかを確かめることにありました。しかし、決定的な溝が残っていました。それは、誰かが何を考えているかを知ることと、その知識に基づいてリアルタイムで行動することの違いです。あるシステムが、人が秘密を隠していると正しく推測できたとしても、その人が秘密を明かすように促すために、視線を逸らしたり、微笑んだり、体を動かしたりといった判断ができるでしょうか。これまで、AIが「心の推測」を「協調のとれた物理的な社会的信号」へと翻訳できるかどうかを測定できるテストは存在しませんでした。
パリ・サクレー大学とソルボンヌ大学の研究者たちは、MOSAICと呼ばれる新しい実験によって、この溝を埋めようと試みました。彼らは、2つのデジタルエージェントが宝探しゲームの中で相互作用する仮想世界を構築しました。このシナリオでは、一方のエージェント(被験者)は隠された報酬の場所を知っていますが、もう一方のエージェント(参加者)は知りません。被験者の任務は、参加者が宝を見つけるのを助けるか、あるいはラウンドのルールに応じて、参加者に間違った箱を選ばせるように欺くかのどちらかです。このゲームは、社会的知性を厳格にテストするように設計されました。10ラウンドの相互作用を通じて、エージェントたちは言葉、体の動き、視線の方向、そして表情を組み合わせてコミュニケーションをとる必要がありました。研究者たちは、ルールを変更することで難易度を変えました。時には被験者は正直であるべきであり、またある時には欺くべきであるという設定です。決定的な違いとして、被ージェンツへの内部指示も変更しました。ある場合は、他者のことを考えずに自分の欲求に従って行動するよう求め、またある場合は、参加者の信念を明示的にモデル化し、それに影響を与えるよう求めました。
研究者たちは、視覚と言語を扱う11種類のビジョン・ランゲージ・モデルと、1種類のテキストのみのモデルを含む、計13種類の異なる人工知能モデルをこの環境でテストしました。明確なパターンを収集するために、各モデルに対して200回の試行を行いました。結果は明白でした。ほとんどの高度なAIシステムは、成功に必要な協調的行動を生み出すことができませんでした。欺くよう求められた際、モデルたちは誤解を招く言葉と矛盾するボディランゲージを組み合わせることができませんでした。助けるよう求められた際、彼らはしばしば、相手を導くような動きや視線を示すことに失敗しました。研究は、プロセスにおける2つの具体的な崩壊点を特定しました。第一に、大多数のモデルは、方向性のある意味を成す非言語信号を生み出すことができず、その動きや視線はしばしばランダムであったり、間違った方向を向いていたりしました。第二に、たとえモデルが明確な信号を発していたとしても、シミュレーション内のもう一方のエージェントがそれに気づかなかったり、それに基づいて行動できなかったりしたのです。AIエージェントたちは、話したり動いたりしてはいましたが、真の意味でコミュニケーションをとっていたわけではありませんでした。
一つのモデルが完全な例外として際立っていました。特定の、信念と意図を扱うために設計された構造化モジュールを備えた「PCM-LLM」というハイブリッドシステムは、あらゆる条件下で成功しました。このモデルは、助けるよう求められたときは参加者を宝へと導くことができ、欺くよう求められたときは参加を誤誘導することに成功しました。この成功は、他のモデルの失敗がタスク自体の難しさによるものではなく、むしろ彼らのアーキテクチャにおける欠落したピースによるものであることを示唆しています。言語と画像を共に処理する標準的なモデルは、他者の信念を直接的な物理的行動へと結びつける内部メカニズムを欠いているようでした。研究者たちは、ほとんどのモデルにおいて、受け取った視覚入力がヒントとしてではなく、むしろ妨げ(ディストラクション)として機能していることを発見しました。いくつかのケースでは、視覚的な画像を完全に排除した方が、モデルが明確な方向信号を送る能力が向上したことから、視覚データが推論をサポートするのではなく、推論を妨害していることが示唆されました。
研究はまた、これらのモデルが練習によって改善できるかどうかについても探究しました。研究者たちは、失敗したモデルの一つを取り上げ、高パフォーマンスを示すハイブリッドシステムが生成した成功した行動の例を用いて学習を行いました。このトレーニングによってモデルの挙動はわずかに変化しましたが、根本的な問題は解決しませんでした。モデルは依然として、言葉、目、体を一つの整合性のある社会的信号へと統合することができませんでした。これは、単にAIにどのように動くべきかを見せるだけでは不十分であり、自らの行動が他者の心に影響を与えるためのものであるという理解を得るには、より深いアーキテクチャの変更が必要であることを示唆しています。研究結果は、現在のAIシステムが、テキスト上で複雑な社会的シナリオを議論できる能力を持っているにもかかわらず、まだそれらの概念を具現化(エンボディ)することを学んでいないことを示しています。彼らは「心の理論」について語ることはできますが、まだそれを「生きる」ことはできないのです。誰かが何を考えているかを推論することと、その推論に基づいて協調的かつ物理的な方法で行動することとの間の溝は、現在のテクノロジーにおける明確かつ測定可能な限界として依然として存在しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。