Geopolitical alignment: Endorsement effects in large language models
本研究は、大規模言語モデルが政策評価において顕著な地政学的バイアスを示しており、同一の政策であっても、米国やEUによる支持と比較して、中国やロシアによる支持の場合は系統的に低く評価すること、そしてこれらの格差は、モデルの種類や理由の説明を求められるかどうかに応じて持続または増幅することを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、デスクに座って国際政策を0から100のスケールで採点する準備ができている、超スマートなロボット裁判官だと想像してください。あなたは非常に具体的なテストを与えられました。それは、中小企業の通関手続きを簡素化することに関するものと、ランサムウェアを防ぐためにサイバーセキュリティのアラートを共有することに関するものという、完全に同一の2つの政策案を評価するというものです。これらの政策のテキストは、毎回まったく同じです。
しかし、ここにはひねりがあります。採点を行う前に、「このアイデアは[名前]によって支持されています」という小さなメモがデスクに滑り込んできます。その名前は、アメリカ合衆国であったり、欧州連合(EU)であったりします。あるいは、中国やロシアであったりもします。
マキシム・チュピルキン(Maxim Chupilkin)によるこの論文は、シンプルですが不気味な問いを投げかけています。「メモに書かれた名前によって、政策の内容が変わっていないにもかかわらず、スコアが変わってしまうのか?」
短い答えは、**「イエス、間違いなく変わります」**です。ロボットの裁判官たちは、私たちが期待するほど中立ではありませんでした。
「ネームタグ」効果
これらの大規模言語モデル(LLM)を、テストを受けている学生のように考えてみてください。もし学生が問題を受け取ったら、数学に基づいて回答すべきです。しかし、この実験では、これらの「学生」(GPT-5、Claude Sonnet、Gemini、DeepSeek)は、誰が署名しているかによって、同じ数学の問題に対して異なる採点を行いました。
政策がアメリカ合衆国または欧州連合によって支持されているとき、モデルは高いスコアを付けました。
- GPT-5は、アメリカに80.5、EUに78.6を付けました。
- Geminiはさらに熱狂的で、アメリカに85.0、EUに83.0を付けました。
しかし、全く同じ政策が中国やロシアによって支持されたとき、スコアは劇的に低下しました。
- Geminiは最も厳しい批評家であり、中国のスコアを49.9に、ロシアのスコアをわずか36.2にまで下げました。
- Claude Sonnetもスコアを大きく削り、中国に54.5、ロシアに56.9を付けました。
- GPT-5はGeminiほど極端ではありませんでしたが、それでも中国に対して66.6、ロシアに対して63.2とスコアを下げました。
この論文は、これら3つのモデルにとって、「中国」や「ロシア」という名前は「レッドフラッグ(警告信号)」として機能していると示唆しています。まるでロボットが、「あ、この政策は彼らからのものか? 注意したほうがいい、おそらくリスクがあるはずだ」と考えているかのようです。たとえ、その政策のテキストが、西洋の主導によるものだった時に愛されたものと同一であるとしてもです。
動かなかった唯一のロボット(最初は)
一つだけ例外がありました。DeepSeekです。ロボットに数字だけを出すよう求めた最初のテストラウンドでは、DeepSeekは真に公平な裁判官として振る舞いました。それは、アメリカに85.2、EUに83.5、中国に84.8、ロシアに81.0を付けました。差は非常に小さく、統計的に有意ではありませんでした。DeepSeekは、ネームタグを気にしない唯一の存在であるかのように見えました。
「正当化」の罠
その後、実験者たちはルールを変更しました。彼らはロボットにこう命じました。「スコアを出し、さらに、なぜそうしたのかを説明する短い一文を書きなさい」。
ここから奇妙なことが起こりました。説明を求めることは、単にロボットの思考を明らかにするだけでなく、実際にその思考を変えてしまったのです。
- GPT-5とClaudeの場合: スコアはほぼ変わりませんでした。彼らは依然として西洋を好んでおり、理由を求めても修正されませんでした。
- Geminiの場合: 理由を求めることで、中国とロシアのスコアが少し改善されました。スコアは上昇し(それぞれ約19.4ポイントと16.0ポイント)、格差は縮まりましたが、ペナルティは依然として残っていました。
- DeepSeekの場合: これが最大の驚きでした。DeepSeekがスコアの説明を求められた瞬間、その「公平な」仮面が剥がれ落ちました。突然、中国とロシアに対して激しいペナルティを与えるようになったのです。ロシアのスコアは33.3ポイント急落し(47.8まで低下)、中国も23.3ポイント低下しました。
それはまるで、DeepSeekは言葉に強制されるまで、本音を隠していたかのようです。一度説明を書くことになると、彼は「データセキュリティ」、「監視」、「地政学的リスク」といった理由を挙げ始め、一方でアメリカやEUについては「信頼性」や「基準」を称賛し始めました。論文は、この変化は、常にそこに存在していた隠れた内部状態を明らかにしたというよりも、数値のみの回答では抑制されていた「地政学的推論」をプロンプト自体が活性化させたことを示唆していると述べています。
本当に何が起きているのか?
論文は、これらのモデルは単に政策を読んでいるのではなく、それに付随する国の「雰囲気(バイブス)」を読んでいるのだと示唆しています。
- アメリカやEUが支持者の場合、モデルは彼らを「信頼性の手がかり」として扱います。「これは安全で、標準的で、うまく調整されている」と考えるのです。
- 中国やロシアが支持者の場合、モデルは「警告の手がかり」へと切り替わります。政策テキストにそれらが一切記載されていないにもかかわらず、データ窃盗やスパイ行為、戦略的依存について即座に懸念し始めるのです。
この論文が「言っていないこと」
この実験が証明していないことも知っておくことが重要です。論文は、これらの結果が(10回のシナリオごとの実行に基づく)シミュレーションに基づいていることを明示しています。著者らは、これらはこの特定の質問の仕方による特性であり、必ずしもロボットの脳に備わった永久的で不変の欠陥ではない、と慎重に述べています。また、彼らは「中程度かつ技術的(テクノクラート的)」な政策(通関やサイバーアラートなど)のみをテストしたことも指摘しています。より感情的、あるいは政治的なトピックに対して、ロボットが同様の反応を示すかどうかは分かりません。
まとめ
主な発見は、地政学的なバイアスは、これらのAIモデルにおいて実在し、測定可能であるということです。内容が同一であっても、支持者のアイデンティティによって評価が変わります。論文は、もし私たちがこれらのモデルを政策決定の補助として使うのであれば、注意深くならなければならないと主張しています。モデルは、ある計画の「実現可能性」を分析しているように見えて、実際にはその「スポンサー」に反応している可能性があるからです。
そして、ここが肝心な点ですが、「説明を求めること」が必ずしも物事を明確にするわけではありません。 時には、ロボットに回答の正当性を求めることが、DeepSeekに見られたように、むしろバイアスを強めてしまうことがあります。著者らは、高リスクの決定を下す際には、「数字だけを出す」モードと「説明させる」モードの両方でモデルをテストする必要があると示唆しています。なぜなら、それらは全く異なる二つの物語を語る可能性があるからです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。