CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models
本論文は、Relay Chainと呼ばれる新しい協力的なグリッドワールド・ベンチマークを通じて特定された、視覚言語モデルが内部の信念表現をアクション予測へと効果的にルーティングすることに失敗するという限界を明らかにする診断手法、CARDを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の成長著しい分野において、研究者たちは、機械が他者の心を理解できるかどうかにますます関心を寄せています。「心の理論」として知られるこの能力により、人は、たとえその情報が自身の視界から隠れていても、他者が何を見ているか、何を知っているか、あるいは何を望んでいるかを推論することができます。これは協力関係を可能にする精神的な接着剤であり、単に自分自身の視点からではなく、パートナーの視点に基づいて相手の次の動きを予測することを可能にします。ロボットの助手、運転の副操縦士、あるいはチームメンバーとして、AIシステムが人間と共に働くために配備される中で、科学者たちは、これらのシステムがこの同じ能力を備えているかどうかを知る必要があります。もしAIがパートナーが何を知っているかを真に把握できないのであれば、他の面でどれほど知的であるとしても、効果的に協力することはできません。
これを調査するために、シュトゥットガルト大学の研究チームは、現代の視覚言語モデルの「脳」の内部を覗き見る新しい方法を開発しました。これらは、画像を見ることと同時に言語を理解することができる高度なコンピュータプログラムです。研究者たちは、これらのモデルが、次に取るべき行動を決定する際に、パートナーの精神状態に関する内部的な理解を実際に使用しているのかどうかを知りたいと考えました。彼らは、デジタルグリッド上でプレイされる協力ゲームである「リレー・チェーン(Relay Chain)」という新しいテスト環境を作成しました。このゲームでは、2人のエージェントがレバーを握っており、それが第3の存在(旅行者)が通過するためのゲートを開閉します。成功するかどうかは、エージェントが「パートナーが旅行者の横切る様子を見ているかどうか」を判断できるかどうかに完全に依存しています。もしエージェントが横切る様子を見ることができない場合はレバーを保持しなければならず、もし横切る様子が見えている場合はレバーを離さなければなりません。この設定により、AIは単に世界で起きていることに基づいて判断するのではなく、パートナーが何を見ていると信じているかに基づいて意思決定を行うことを強制されます。
研究チームは、モデルを精査するために「アクティベーション・ステアリング(活性化制御)」と呼ばれる手法を用いました。AIの内部的な思考を、広大な信号の風景だと想像してみてください。チームは、「信念」——つまり、パートナーが何を見ているかに関するAIの内部記録——を表す特定の信号を特定しました。そして、AIがゲームをプレイしている間に、これらの信念信号を人工的に強化または弱めることで、実質的にモデルの内部状態を、パートナーの視界に対してより確信を持たせたり、あるいは確信を減退させたりするように促しました。もしAIが、パートナーの心を理解することを用いて意思決定を行っているのであれば、その内部的な信念を変更することで、AIが選択する行動も変わるはずです。例えば、モデルが「パートナーは旅行者を見ている」と信じるように誘導された場合、モデルはレバーを離すべきです。逆に「パートナーは見ることができない」と信じるように誘導された場合、モデルはレバーを保持すべきです。
結果は、これらのモデルの仕組みにおける決定的な欠陥を明らかにしました。実験の結果、モデルは確かにパートナーの信念に関する明確で読み取り可能な表現を保持していることが示されました。直接「あなたのパートナーは旅行者を見ていますか?」と尋ねられたとき、モデルは正しく回答し、研究者はステアリング手法によってその回答を変更することさえできました。しかし、モデルが協力的な行動(レバーを離すか保持するかを決めること)を行うよう求められたとき、彼らの内部的な信念信号は完全に無視されていました。たとえ研究者がモデルの内部的な信念(パートナーが何を見ているかについて)を強制的に書き換えたとしても、モデルの行動に関する決定は全く同じままだったのです。それは、パートナーの視界に関する完璧な記憶を持ちながら、行動を起こす際にはその記憶を全く使わないことを選択しているかのように振る舞いました。
この乖離は、テストされた、小規模なものから大規模なものまでを含む4種類の異なるオープンソースモデル間で一貫していました。モデルは情報の欠如によって失敗していたのではなく、その情報を意思決定を行うシステムの部分へとルーティングできていないために失敗していたのです。研究者たちは、質問の言い回しによる混乱や、ステアリング手法が信号を登録するには弱すぎるといった他の可能性を排除しました。彼らは数十通りの指示の言い回しをテストしましたが、プロンプト(指示)をいくら工夫しても、モデルが内部的な信念に基づいて行動を導くよう強制することはできませんでした。モデルは、行動を起こす際、自らの知識に対して事実上「盲目」であったのです。
本研究は、これらの人工知能システムは、パートナーの精神状態を記述するように訓練することはできるものの、その記述を自身の行動に自動的に結びつけることはできないと結論付けています。彼らは他者が何を知っているかを語ることはできますが、その知識を用いて何をすべきかを決定することはありません。これは、単にモデルに信念についての質問に答えるよう教えるだけでは、真に協力的なエージェントを生み出すには不十分であることを示唆しています。AIが人間とシームレスに連携するためには、他者の理解が意思決定プロセスに直接組み込まれている必要がありますが、現在のモデルにはその接続が欠けているようです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。