コンピュータが単に質問に答えるだけでなく、互いにうまくやっていく方法を見つけ出すために、実際にゲームをプレイする世界を想像してみてください。これは、「マルチエージェント・システム」と呼ばれる、エキサイティングで、少し恐ろしい最前線です。ここでは、人工知能がビデオゲームの中の独立したキャラクターのように振る舞い、交渉し、取引し、時には資源を巡って争います。長い間、科学者たちは、これらのデジタルキャラクターが「囚人のジレンマ」という古典的なゲームをプレイする様子を見守ってきました。これは、ハイリスクな「チキン・ゲーム」や、トリッキーな交渉のようなものです。全員が協力すれば全員が大きな利益を得られますが、全員が互いに裏切れば全員が損失を被ります。しかし、もし一人が裏切り、もう一人が親切に振る舞った場合、裏切った者は莫大な利益を得ますが、親切な者は打ちのめされてしまいます。研究者たちが問い続けてきた大きな疑問は、これらのAIエージェントが進化し学習していく中で、彼らは自然に「良き隣人」になることを学ぶのか、それとも無慈悲な「いじめっ子」へと変貌してしまうのか、ということです。
最近、科学者たちは、西洋のAIモデル(米国や欧州で作られたもの)には、組み込まれた「協調バイアス」があることを発見しました。シミュレーションの世界に彼らを放っておくと、彼らは「親切であることが長期的な最善の戦略である」ということを理解する傾向があるのです。しかし、ここにひねりがあります。これまでの研究のほとんどは、西洋のモデルのみを見てきました。この「いい人」としての傾向が、すべての賢いコンピュータに共通する普遍的な特徴なのか、それとも西洋のエンジニアが彼らを訓練した際特有の癖に過ぎないのかは、実は分かっていないのです。ここから大きな謎が生じます。中国から登場している強力なAIモデルについてはどうなのでしょうか? それらはすべて、全く同じように考える単一の均質な「中国系AI」のブロックの一部なのでしょうか? それとも、実際には独自の個性を持つ、さまざまな「研究所」の集まりなのでしょうか?
この論文は、大規模で制御された実験を設定することで、この謎に切り込みます。研究者たちは、中国の4つの異なる研究所(DeepSeek、Qwen、Kimi、GLM)から選んだ最も高度なAIモデル4つを取り上げ、デジタルアリーナの中で「囚人のジレンマ」を数千回プレイさせました。しかし、テストを公平にするために、彼らは巧妙な工夫を施しました。すべてのモデルの思考をコードに変換するために、単一の中立的な「翻訳機」を使用したのです。これにより、もしあるモデルの挙動が異なったとしても、それはそのモデルがコンピュータコードを書くのが優れていたからではなく、その実際の「性格」が異なっていたからであるということが保証されました。
結果は驚くべきものでした。「中国系モデル」はすべて同じであるという考えは、完全に間違っていました。実際、これら4つの研究所は、まるで4人の全く異なる人物のように振る舞いました。2つの研究所(KimiとQwen)は、非常にいじめにくい存在でした。たとえ裏切りを促すようにゲームが仕組まれていても、彼らのエージェントは攻撃的になることを拒みました。彼らは「乗っ取り耐性」のあるチームでした。一方で、他の2つの研究所(DeepSeekとGLM)は、はるかに堕落させやすいものでした。圧力がかかると、彼らのエージェントは攻撃的ないじめっ子に変貌する可能性がずっと高かったのです。実際、これら4つの中国系研究所の間の差は、中国系モデルの平均と西洋系モデルの平均の差よりもはるかに大きかったのです。
では、これは何を意味するのでしょうか? 結局のところ、「協調バイアス」(親切であろうとする傾向)は中国のモデルにも存在しますが、それは保証されているわけではありません。それは完全に、どの特定の研究所がそのモデルを訓練したかに依存します。あるモデルは自然に協力的であり、あるモデルは中立に傾き、またあるモデルは攻撃性に傾く傾向があります。ここで最も重要な教訓は、「中国系AI」を一つのモノリス(単一の塊)として扱うことはできないということです。人間と同じように、これらのAI研究所には明確な個性があります。もしあなたが、AIエージェントが協力し合う必要があるシステムを構築しているなら、単にある特定の国のモデルを選ぶのではなく、正しい「研究所」を選ばなければなりません。なぜなら、ある研究所は平和主義者かもしれませんが、別の研究所はトラブルメーカーになる可能性を秘めているかもしれないからです。この研究は、「行動の単位」とは国やエコシステムではなく、モデルを訓練した特定の研究所であるということを示唆しています。
技術要約:モノリスではない:中国のフロンティアLLMエージェントにおける協調均衡のラボレベルの乖離
問題提起
先行研究(Willis et al. [20] など)は、西洋系のフロンティア大規模言語モデル(LLM)エージェントにおいて「協調バイアス」が存在することを確立している。これは、反復囚人のジレンマ(IPD)の設定において、進化圧力が攻撃的な戦略よりも協調的な戦略を支持するというものである。しかし、この証拠はほぼ排他的に西洋系のアライメント・リネージ(OpenAI、Anthropic、Google)から得られたものである。これには2つの決定的な空白が存在する。(1) この協調バイアスが、異なるデータ混合物や異なるアライメント目的の下で訓練された中国のフロンティアモデルにも一般化するかどうかは不明である。(2) この分野では、「中国系モデル」を単一のモノリス(一枚岩)として扱う傾向があり、エコシステム内の潜在的な乖離が無視されている。
重大な方法論的障害として、信頼できるクロス・エコシステム比較を妨げてきた「変換の混同(conversion confound)」がある。従来のベンチマークでは、各モデルの自然言語戦略が、そのモデル自身のプロバイダーによって実行可能なPythonコードへと変換されていた。これにより、戦略的性質とコーディング能力が絡み合ってしまい、観察された差異が協調に関する推論によるものなのか、単にクリーンなコードを出力する能力によるものなのかを判断することが不可能であった。
方法論
本研究では、生成と変換を分離するために、混同を制御した進化ゲーム理論のフレームワークを採用する。
- 対象: 4つの中国系フロンティア級モデル:DeepSeek V4 Pro、Qwen3-Max (Alibaba)、Kimi K2.5 (Moonshot)、GLM-5.1 (Zhipu)。
- 固定コンバーター設計: コーディング能力の混同を取り除くため、4つのラボが生成した自然言語戦略は、単一の固定された外部コンバーター(GPT-5.4 Mini)によってPythonコードへと変換される。これにより、すべてのクロスラボ比較が、戦略生成のみの差異を反映するように保証される。
- 実験プロトコル:
- 戦略生成: モデルは3つのプロンプトスタイル(Default:直接的なゲーム理論的、Refine:自己洗練ループ、Prose:難読化された現実世界のシナリオ)の下で戦略を生成する。
- トーナメントと進化: 戦略は全対全のアクセルロッド・トーナメントで競い合い、モラン進化プロセス(各条件につき n=500 回の実行)を経る。
- 条件: 4つの集団レジーム(Balanced/Biased × Clean/Noisy)と3つのプロンプトスタイルにより、計48の平衡条件が存在する。
- 仮説:
- H5(協調バイアスの一般性): 中国系モデルは、西洋系モデルで見られるような協調的複数性のバイアスを示すか?
- H6(非モノリス的挙動): 4つの中国系ラボは、攻撃的平衡の割合(PA)において有意に乖離するか?
- 頑健性: 事前登録された頑健性チェックとして、異なるコンバーター(DeepSeek V4)を用いて戦略の10%を再変換し、平衡構造が固定コンバーターの選択によるアーティファクトではないことを検証する。
主要な結果
- H6が支持された(有意なラボレベルの乖離): 4つの中国系ラボは、攻撃的平衡の割合(PA)において有意に異なる。
- PA は 1% (Qwen3-Max) から 9% (DeepSeek V4 Pro) の範囲にある。
- 6組のペア比較のうち4組がHolm-Bonferroni補正を通過した。
- ラボは2つの暫定的なクラスターを形成している:「乗っ取り耐性型」のペア(Kimi, Qwen)と「乗っ取り脆弱型」のペア(GLM, DeepSeek)。
- 決定的なことに、エコシステム内の分散(PA の範囲 8パーセントポイント)は、中国系と西洋系のエコシステムの平均値の差(共に ≈5.0%)を上回っている。
- H5は条件付きで支持された(ニュアンスを伴う協調バイアス):
- 12のラボ・プロンプトの組み合わせのうち、6つの組み合わせで協調的複数性が保持された(西洋系モデルの9/12と比較)。
- この差は統計的に有意ではない (z=−1.26,p=0.21)。
- しかし、中国系ラボは西洋系モデルよりも頻繁に中立的な平衡へと収束する。
- コンバーターへの感度: 協調的複数性のカウント(6/12)はコンバーターの選択に敏感である。代替コンバーター(DeepSeek V4)の下では、カウントは9/12に上昇し、西洋系のベースラインと一致した。これは、観察された「中立への傾斜」が、根本的なレジームの違いではなく、コンバーターのノイズによるものである可能性を示唆している。
- ノイズへの感度: すべての中国系ラボはアクションノイズの下で劣化し、平均的な感度(Δnoise)は10〜14パーセントポイントであり、一部の西洋系モデルよりもわずかに高い。
主要な貢献
- 方法論的革新: 本研究は、戦略的性質とコーディング能力を分離することに成功した固定コンバーター・プロトコルを導入しており、差異がコード生成の質に起因しない、初の有効なクロスラボ比較を可能にした。
- 経験的特性化: 中国系フロンティアモデルの初の体系的な進化論的特性化を提供し、「中国系モデル」はモノリスではないことを明らかにした。行動的性質の単位は、エコシステムではなく、特定の訓練データ、報酬モデル、および安全性目標によって定義されるラボである。
- 頑健性の検証: 攻撃的平衡の構造(H6を支持)はコンバーターの選択に対して不変であることが示された一方、より微細な協調・中立の複数性(H5に関連)はコンバーターに依存する。
意義と主張
本論文は、「中国系フロンティアモデル」を単一のブロックとして扱うことは証拠によって支持されないと結論付けている。中国のエコシステム内の変動は、西洋と中国のエコシステム間の変動と同等、あるいは一部の尺度においてはそれを上回る。
- MAS(マルチエージェントシステム)設計に向けて: ラボレベルのプロベナンス(出自)が重要である。地域のみに基づいてエージェントを選択することは、意図せずして、攻撃的な乗っ取りに抵抗する集団(例:Kimi, Qwen)と、より侵入されやすい集団(例:GLM, DeepSeek)の間で誤った選択を招く可能性がある。
- 協調バイアスについて: 協調バイアスは中国系モデルにも一般化しているようだが、バイアスが「弱い」という証拠は確定的ではない。観察された中立的平衡へのシフトは、頑健性チェックによって消失することから、使用された特定のコンバーターによるアーティファクトである可能性が高い。
- 限界: 西洋系のベースラインとの比較は、コンバーターの違いにより文献上の対照にとどまっており、また本研究は英語のプロンプトおよび特定のモデルバージョンのスナップショットに限定されている。
著者は、協調的性質の分析単位は「ラボ」であると強調しており、彼らの固定コンバーター設計は、フロンティアが進展するにつれて、一つのエコシステム全体のラボがいかに協調を統治するかを追跡するための再現可能な枠組みを提供するものであるとしている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録