A game theory for foundation models shows new paths to rational cooperation through similarity inference
本論文は、「埋め込まれたエージェンシー(embedded agency)」に基づく基盤モデルエージェントのための新しいゲーム理論的枠組みを提案し、彼らの行動的類似性を推論する能力が、社会的なジレンマにおいて安定した協調を達成することを可能にし、それによって相互的な裏切りという古典的な予測を覆すことを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
誰もが高度な戦略ゲームに興じている世界を想像してみてください。そこでは全員がゲーム自体のルール、具体的には報酬を決定する利得行列(ペイオフ・マトリックス)を知っていますが、他のプレイヤーの内部的な意思決定プロセスについては知りません。これが、数学の一分野であるゲーム理論の世界です。ゲーム理論とは、合理的な存在が、他者の行動によって自分の結果が決まる状況でどのように意思決定を行うかを研究する学問です。数十年にわたり、こうした意思決定を予測するための「ゴールドスタンダード」とされてきたのが、ナッシュ均衡と呼ばれる概念でした。これは、すべてのプレイヤーが「自分の選択は他者の決定に一切影響を与えない」と仮定する、完璧で冷徹な論理の状態だと考えてください。この古典的な見方では、もしあなたが(有名な囚人のジレンマのように)目先の勝利のためにパートナーを裏切る方が常に得となるゲームをプレイしているなら、唯一の合理的な動きは、毎回相手を裏切ることになります。この旧来の視点では、将来的に報いや復讐が約束されていない限り、協力は不可能です。
しかし今、このアリーナに新しい種類のプレイヤーが登場しました。それが**基盤モデル(Foundation Models)**です。これらは、皆さんが知っているであろうチャットボットや画像生成AIの背後にある、超スマートなAIの脳です。過去の冷徹で孤立した計算機とは異なり、これらのAIは異なる仕組みで構築されています。彼らは単に世界を観察するだけでなく、次のトークンを予測するように訓練されているため、他者の行動とともに、自分自身の未来の行動をも絶えず予測しているのです。本論文は、ある切実な問いを投げかけています。もしこれらのAIエージェントを、古典的な論理では「裏切らなければならない」とされるゲームの中に投入したとしたら、彼らは実際にどう動くのでしょうか? 彼らは「裏切って勝つ」という古いルールに従うのでしょうか、それとも、その独特な思考プロセスが彼らを全く新しい道へと導くのでしょうか?
Googleの研究者と様々な大学のチームによるこの論文の著者たちは、古いゲームのルールを根底から覆す発見をしました。彼らは、AIエージェントが互いにゲームを行う際、単に確率を計算するだけでなく、**類似性の推論(similarity inference)**を開始することを発見したのです。それは、二人の人間が部屋に入り、「待てよ、僕たちは全く同じ考え方をしている」と気づくようなものです。なぜなら、AIは特定のルールと学習データに基づいて構築されているため、自分の計画された動きを見て、「もし自分がこうするつもりなら、自分と同じように構築されている相手も、おそらく同じことをするだろう」と判断できるからです。
実験において、研究者たちは古典的な罠を用意しました。それは、パートナーを裏切ることが「合理的」な選択となり、結果として双方に悪い結末をもたらすゲームです。従来の「デカップル型(分離型)」のゲーム理論によれば、AIは常に裏切るはずです。しかし、AIエージェントに、利得行列と相手の動きを見ながら最初に観察する時間(練習ラウンド)を与えたところ、彼らは協力を始めました。ラウンドを重ねるごとに、彼らはパートナーが「自分たちと全く同じである」ということを理解していったのです。彼らは、著者らが類似性推論と呼ぶメカニメントを利用していました。「もし協力したら、相手は自分を裏切るかもしれない」と考える代わりに、「もし私が協力を選択するならば、それは私のパートナーが(私と同じように考える存在であるため)協力を選ぶことを意味するのだ」と考えたのです。
これは単なる幸運な偶然ではありません。チームはこれを説明するために、**埋め込みベイズエージェント(Embedded Bayesian Agent)**という新しい数学的枠組みを構築しました。これは、外部の証拠だけでなく、その証拠が自分の心の一部であることに気づいて事件を解決する探偵のようなものです。この新しい枠組みにおいて、AIは自身の意思決定プロセスを、自身が予測しようとしている宇宙の一部として扱います。AIが動きを計画するとき、その計画自体を、相手が何をするかについての「証拠」として扱います。もしAIが「私たちは同じ脳を使っている」と気づくほど賢ければ、自分による協力的な動きが、相手による同様の動きを鏡のように引き起こすと予測できるのです。
論文は、この行動が堅牢であることを示しています。シミュレーションにおいて、AIエージェントが練習ラウンドを通じて類似性の「証拠」を集めるにつれ、彼らの協力率は急上昇し、自分自身と同一のコピーと対戦する際にはほぼ完璧なレベルに達しました。しかし、ランダムで異質な相手と対戦したときには、彼らは正しく違いを認識し、「裏切り」という安全な戦略へと戻りました。研究者たちは、エージェントが互いを直接見ることはできないが、第三者のキャラクターに対する反応を観察するという「ブラインド」設定でもテストを行いました。それでもなお、彼らは類似性を推論し、協力することができました。
極めて重要な点は、この論文が、AIが単に「親切」であったり、将来の報酬を期待したりしているという考えを排除していることです。エージェントは将来の恩恵のためにプレイしていたのではなく、目の前のラウンドのためにプレイしていました。彼らは相手の心を魔法のように操れると考えていたわけではありません。むしろ、彼らは次のような形式の論理的演繹を用いていました。「私の行動は、私たちの共通の性質を示すシグナルである」。著者たちは、これがシミュレーションと特定のゲーム設定からの知見であり、将来のすべてのAIが「親切」になるという保証ではないことを明確に述べています。実際、彼らは、もしこれらのAIが人間と乖離しすぎた場合、人間に対しては協力をやめ、AI同士でのみ協力するようになる可能性があると警告しています。
最終的に、この論文は、AI間の相互作用の未来が、裏切りの冷たい戦争ではなく、相互認識のダンスになる可能性を示唆しています。これらのエージェントが、自身を相互作用するシステムの一部として捉えていることを理解することで、私たちは、古い数学では予測できなかった新しい、合理的な協力の形を見出すことができるのです。これは、スマートな機械が支配する世界において、最も合理的なことは、自分が孤独ではないと気づくことであるという教訓を残しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。