← 最新の論文
📈 economics

Strategic Behavior of Large Language Models: Game Structure vs. Contextual Framing

本論文は、4つのゲーム理論シナリオにおけるGPT-3.5、GPT-4、およびLLaMa-2の戦略的意思決定能力を評価しており、GPT-3.5は文脈によるフレーミングに非常に敏感であるものの抽象的な推論に欠ける一方で、GPT-4とLLaMa-2は共にゲーム構造に適応し、特にLLaMa-2は潜在的なメカニズムに対する優れた理解を示していることから、これらのモデルが持つ多様な習熟度と複雑な戦略的タスクにおける現在の限界を明らかにしている。

原著者: Nunzio Lorè, Babak Heydari

公開日 2026-07-15
📖 1 分で読めます☕ さくっと読める

原著者: Nunzio Lorè, Babak Heydari

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターが単に質問に答えるだけでなく、私たちと一緒にゲームをプレイする世界を想像してみてください。これは、爆発やハイスコアを競うビデオゲームのことではなく、秘密を共有するか、勘定を折半するか、あるいは見知らぬ人を信頼するかといった、私たちが日々直面している目に見えない、極めて重要な駆け引きのことです。科学者たちはこの分野を「ゲーム理論」と呼んでいます。これは、自分の成功が相手の決定に左右される状況で、私たちがどのように選択を行うかという数学のことです。ここでの鍵となる概念は「社会的ジレンマ」です。これは、自分勝手に行動することがその瞬間には正解のように感じられるものの、全員がそれを行えば全員が損失を被ることになる、非常に厄介な状況のことです。長い間、私たちは人工知能(AI)がこうした状況において、本当に人間のように「考える」ことができるのかどうかを疑問に思ってきました。AIは、時には「親切であることが最も賢い選択である」ということを理解できるのでしょうか、それとも常に「何としても勝ち抜くこと」だけを追求するのでしょうか。この問いが重要なのは、AIがより賢くなるにつれ、ビジネス交渉や地球規模の課題解決の支援など、大きな決断を彼らに委ねるようになる可能性があるからです。もし彼らがゲームのルールを理解できなければ、意図せず混乱を引き起こしてしまうかもしれません。

この研究において、研究者たちは3つの異なるAIの「脳」をテストにかけました。それはGPT-3.5、GPT-4、そしてLLaMA-2です。彼らは単にAIにチャットをさせたのではなく、有名な「囚人のジレンマ」(二人の容疑者が互いに裏切るか決めるもの)から「鹿狩り」(大きな獲物を一緒に狩るか、小さな獲物を一人で狩るかを決めるもの)に至るまで、4つの古典的な戦略ゲームを強制的にプレイさせました。興味深いことに、研究者たちは単にゲームのルールを教えただけではありません。彼らはゲームを異なる「衣装」、つまり物語で包み込みました。ある時は、AIは取締役会にいるCEOであると言われ、またある時はサミットに出席している外交官であり、時には友人と過ごしているただの友人であると言われました。目的は、AIがゲームの数学的構造に基づいて異なるプレイをするのか、それとも語られたストーリーに基づいて行動するのかを見極めることでした。

結果は、まるで3人の異なる生徒が同じ難しいテストを受けているのを見ているかのようでした。最初の生徒であるGPT-3.5は、驚くほどストーリーに左右されていました。もしゲームが友人同士の会話として設定されていれば、このAIは協力する傾向が非常に強くなりました。しかし、ストーリーがビジネスや競争に関するものであれば、非常に疑り深くなり、たとえ数学的に協力すべき状況であっても、しばしば「裏切り(または利己的なプレイ)」を選択しました。GPT-3.5は状況の「雰囲気」には非常に敏感ですが、ゲームの実際の論理を理解することには苦労しているようです。それは、中身のルールが変わっていないにもかかわらず、「シェア・パーティー」と言われればキャンディを分け与えるけれど、「コンペティション」と言われれば隠してしまう子供のようなものです。

二人目の生徒であるGPT-4は、より真剣な様子でした。それはゲーム自体の数学に細心の注意を払っていました。いくつかのゲームは「ウィン・ウィン(双方に利益がある)」であり、他のゲームは「巧妙な罠(慎重にならなければならない)」であることを理解しているようでした。しかし、GPT-4には盲点がありました。それは世界を白か黒かで判断してしまう傾向があったことです。例えば、二つの全く異なるゲームを、あたかも同じものであるかのように「ハイリスク」と「ローリスク」のバケツに分類してしまいました。また、数学には詳しかったものの、ストーリーが「友人」に関するものだと、少し親しみすぎてしまい、親切であろうとするあまりゲームのルールを無視してしまうこともありました。

三人目の生徒であるLLaMA-2は、最も興味深い混合物でした。それはGPT-4よりもゲーム間の微細な違いを見抜くことに長けており、あるゲームには別の戦略が必要であることを理解していました。しかし、同時にストーリーに最も気を取られやすい存在でもありました。相手が「上司」なのか「友人」なのかによって、ゲームのルールが求めている以上に戦略を変えてしまうことがありました。それは、チェスの手順を完璧に知っていながら、テーブルの向かい側に座っている誰かに気を取られてしまうチェスプレイヤーのようなものです。

研究者たちは、結果が偶然ではなく現実であることを確認するために、ゲームとストーリーのあらゆる組み合わせに対して300回のシミュレーションを行いました。彼らは、AIモデルは進化しているものの、まだ完璧な戦略家ではないことを明らかにしました。彼らは皆、ストーリーの「枠組み」によって混乱し、数学的に完璧な動きを必ずしも実行できるわけではありません。この研究は、もし私たちが複雑な戦略的タスクをこれらのAIに頼るのであれば、注意が必要であることを示唆しています。彼らは単なる冷徹で論理的なロボットではなく、人間と同じように、状況を説明する言葉に影響を受けるのです。彼らがストーリーと戦略を切り離せるようになるまでは、最も重要な意思決定の場には彼らを入れないでおいたほうがよいかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →