← 最新の論文
📈 economics

Model Selection as Policy Choice: Open-Weight LLMs Converge on Institutions but Diverge on Economic Policy

本研究は、オープンウェイトの大型言語モデルは政策分析において互換性のあるツールではなく、サンプリング温度よりもモデルの選択が、制度や環境に関する合意を維持しつつ経済政策の選好における安定的かつ構造的な相違をもたらす要因となるため、モデルの選択が極めて重要なガバナンス上の決定事項であることを示している。

原著者: Tamas Olah, Marianna Abuczki, Nayna Babar, Tibor Tokes

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Tamas Olah, Marianna Abuczki, Nayna Babar, Tibor Tokes

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグアイデア:すべてのAIシェフが同じ料理を作るわけではない

あなたが政府の役人として、新しい経済政策を決定しようとしている場面を想像してください。あなたはAIに助言を求めます。多くの人は、もし5つの異なるAIモデルに同じ質問をすれば、5つの異なるバージョンではあっても、内容は「同じ」答え(例えば、5人に同じ詩を朗読してもらうようなもの)が返ってくるだろうと想定しています。

この論文は、その想定は間違っていると主張しています。

AIモデルは単なる交換可能なツールではなく、**それぞれ異なる個性や政治的哲学を持った「異なるシェフ」**のようなものであると、著者らは指摘しています。もし経済について同じ質問をしたとしても、彼らは単に言葉を変えるだけでなく、自分たちの内に秘めた「好み」に基づいて、全く異なるレシピを選択することがあるのです。

実験:AIによる味覚テスト

研究者たちは、大規模な味覚テストを実施しました。

  • パントリー(食材置き場): 彼らは40種類の異なる「オープンウェイト」AIモデルを集めました(これらは、ビッグテック企業が所有する秘密のモデルとは異なり、誰でも自分のコンピュータにダウンロードして実行できるモデルです)。
  • メニュー: すべてのモデルに対して、全く同じアンケートを実施しました。質問内容は、インフレ、失業、住宅、国際関係といった困難なトピックを網羅しています。
  • ルール: 各質問に対し、モデルは4つの異なる選択肢(A、B、C、またはD)を0から100のスケールで評価しなければなりません。
  • 反復: 結果が単なるランダムなエラーではないことを確認するため、各モデルに対して同じ質問をそれぞれ100回ずつ行いました。

明らかになったこと

1. 「個性」はランダムではなく実在する

コイン投げの結果はランダムです。AIに質問したときも、ある程度のランダム性があるだろうと予想されるかもしれません。しかし、研究者たちは、ランダム性(ノイズ)は実際には非常に小さかったことを発見しました。

  • 比喩: 合唱団を想像してください。もし歌手たちがただランダムな音を出しているだけなら、音はめちゃくちゃになるでしょう。しかし、ここでの研究では、各歌手(各AIモデル)の声は非常に独特で安定していることが分かりました。
  • 結果: 回答の差異の約57%は、「どのモデルが答えたか」に起因していました。「温度(AIをよりランダムにするか、あるいは保守的にするかを決める設定)」を変更しても、回答への影響はほとんどありませんでした(2%未満)。これは、設定を微調整したところで消えることのない、モデルに組み込まれた安定したバイアスが存在することを意味しています。

2. 「誰が主導権を握るか」には同意するが、「お金をどう使うか」で争う

研究者たちは、モデルがどこに位置しているかを見るために、統計的なマップ(アイデアのGPSのようなもの)を使用しました。彼らは、モデルが意見を分ける2つの主要な「断層線」を発見しました。

  • 「制度への信頼」ライン(ほぼ合意している点): ほとんどのモデルは、国際機関、規則、および公式な制度が重要であるという点で一致していました。彼らは総じて、ルールに従い、専門家を信頼するという考えを好みました。
  • 「経済哲学」ライン(対立している点): ここでモデルは分裂します。
    • グループA(市場愛好家): これらのモデルは、自由市場に決定を任せ、規制を削減し、成長を優先することを好みます。
    • グループ B(介入主義者): これらのモデルは、たとえ成長が鈍化したとしても、格差を是正し、価格を制御し、環境を保護するために政府が介入することを好みます。

「スタグフレーション」テスト:
研究者たちは、古典的な難問を投げかけました。「国で高いインフレと高い失業率が同時に起きている。どうすべきか?」

  • あるモデルは、「たとえ人々が職を失うとしても、インフレを叩き潰すべきだ」と言いました。
  • 他のモデルは、「価格が上がったとしても、雇用を守るべきだ」と言いました。
  • また別のモデルは、「両方に対して厳格なルールを作るべきだ」と言いました。
  • さらに別のモデルは、「奇妙で実験的なコントロールを組み合わせるべきだ」と言いました。
    衝撃的な事実: これら4つの回答のすべてが、少なくともいくつかのモデルにとっては「トップの選択肢」でした。単一の「AIとしての正解」は存在しなかったのです。

3. 「自信」の罠

最も興味深い発見の一つは、**自信(コンフィデンス)**に関するものでした。

  • いくつかのモデルは非常に内気で、「よくわかりません」と言います(低い自信スコア)。
  • 他のモデルは非常に声が大きく、「答えを知っています!」と言います(高い自信スコア)。
  • 逆転の事実: モデルの自信は、質問の難易度には依存しませんでした。それは完全に、どのモデルであるかに依存していました。
  • 比喩: それは、常にC判定を取るけれど「私は100%正しい」と言う学生と、A判定を取るけれど「私は50%しか自信がない」と言う学生のようなものです。もしあなたが政策立案者であれば、たとえそのモデルが静かなモデルと同じくらい偏っていたとしても、声の大きい自信満々なモデルを信じてしまうという罠に陥る可能性があります。

4. サイズは「優れた政治観」を意味しない

より大きな、より賢いAI(より多くの「脳の力」を持つもの)は、よりバランスの取れた、あるいは「正しい」政治的見解を持つだろうと思うかもしれません。

  • 発見: 大きなモデルはわずかに一貫性がありました(ノイズが少なかった)が、小さなモデルとは異なる政治的意見を持っているわけではありませんでした。
  • 比喩: 巨大で超スマートなロボットも、小さくて単純なロボットも、どちらも「市場愛好家」であったり、あるいはどちらも「介入主義者」であったりします。モデルのサイズやブランド名から、そのモデルの政治的バイアスを推測することはできません。

結論:モデルを選ぶことは政治的な選択である

この論文は、どのAIを使うかを選択することは、技術的な詳細ではなく、政策的な決定であると結論付けています。

  • メタファー: もしあなたが経済に関するレポートを書くためにコンサルタントを雇うなら、あなたは特定の価値観を持つ人物を雇っていることになります。もしあなたがAIモデルXを雇うなら、あなたは「市場保守派」を雇っているのです。もしあなたがAIモデルYを雇うなら、あなたは「政府介入派」を雇っているのです。
  • 危険性: これを知らないと、AIが中立的で客観的な事実を与えてくれていると誤解してしまうかもしれません。しかし実際には、AIは自らの隠れた価値観を、あなたの政策決定の中に密かに注入しているのです。

テイクアウェイ(教訓):
政府の意思決定を支援するためにAIを使用する前に、私たちはそれを人間の専門家と同じように扱う必要があります。彼らの背景を確認し、彼らのバイアスを知り、単独の意見を鵜呑みにしないこと。 私たちは、一つの「デフォルト」のモデルに私たちの未来を決めさせるのではなく、複数の異なるAIに問いかけ、それらの回答を比較することで、全体像を把握する必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →