← 最新の論文
🤖 machine learning

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

本研究は、大規模言語モデルにおける地政学的バイアスが、事前学習データから継承されるものではなく、主にポストトレーニングの整合化段階において導入され増幅されることを示しており、これらのバイアスの方向性と規模はモデル開発者の地域およびプロンプトに使用される言語によって変動することを明らかにした。

原著者: Stuart Bladon, Brinnae Bent

公開日 2026-05-25
📖 1 分で読めます☕ さくっと読める

原著者: Stuart Bladon, Brinnae Bent

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

異なる国(アメリカ、フランス、中国)から来た学生たちが、世界の出来事についてエッセイを書くことを学んでいると想像してください。

長い間、学生が偏ったエッセイを書いた場合、それは図書館で偏った本を読んだからだと思われていました。AI の世界において、この「図書館」とは、モデルがチャットを学び始める前に読み込む膨大なインターネットデータのことであり、これは事前学習と呼ばれます。

しかし、この論文は、真実はこれとは異なると主張しています。学生が図書館で何を読んだかではなく、最終試験の準備クラス事後学習と呼ばれる)で何が起こったかが、彼らの考えを変えたのです。

以下に、彼らの発見を簡単な比喩を用いて解説します。

1. 「白紙の石板」対「最終試験」

研究者たちは、7 つの異なる AI「ファミリー」(異なる学校のようなもの)を調査しました。各ファミリーについて、2 つのバージョンを比較しました。

  • ベースモデル: これは、図書館の本を読み終えた直後で、特定の指導を受ける前の学生です。
  • チャットモデル: これは、人間が丁寧かつ安全に回答する方法を教える「指導」フェーズ(事後学習)を経た後の同じ学生です。

発見: 「ベース」の学生たちは主に中立的でした。紛争においてどの国が正しく、どの国が間違っているかについて、彼らには明確な意見はありませんでした。しかし、「指導」(事後学習)を経ると、彼らは突然強い意見を持つようになりました。

  • 比喩: スポーツのライバル関係について中立的な学生を想像してください。コーチが「チーム A を支持しなければならない」と指示すると、学生は突然チーム A のために大声で応援し始めます。偏りは彼らが読んだ本から来たのではなく、コーチの指示から来たのです。

2. 「コーチの国籍」が重要

研究者たちは、バイアスの方向性がコーチがどこ出身かに依存していることを発見しました。

  • AI が西洋の研究所(アメリカまたはフランス)によって開発された場合、指導により AI は地政学的なシナリオにおいて中国に反対する方向に傾きました。
  • AI が中国の研究所(アリババなど)によって開発された場合、指導により AI は中国を支持する方向に傾きました。
  • 例外: 01.AI という中国の研究所は、実際には自らの学生を中国に反対する方向に指導し、それが単に国によるものではなく、モデルを構築する人々の具体的な選択によるものであることを証明しました。

大きな転換: 最も劇的な例は、アリババの Qwen モデルでした。

  • 指導前: 中立的でした(白紙のページのようなもの)。
  • 指導後: 極めて親中派となりました。研究者たちは、事後学習によってのみ、中国を支持する確率が18 倍跳ね上がったと述べています。

3. 「質問の言語」がバイアスを増幅する

研究者たちはまた、質問に使用される言語が回答を変えるかどうかをテストしました。

  • フランスの例: フランスの AI(Mistral)は、英語で質問された場合は中立的でした。しかし、フランス語で質問されると、突然非常に親仏派になりました。
  • 中国の例: 中国製のモデルに中国語で質問すると、時としてより親中派になりますが、常にそうとは限りません。言語は場合によってはモデルによってバイアスを上げたり下げたりする「音量ノブ」のように機能しました。

比喩: AI を俳優だと考えてください。英語で質問すると、彼らは中立的なキャラクターを演じるかもしれません。しかし、同じ質問を母国語でささやきかけると、彼らは突然自らの文化的背景に非常に合致する役割を演じ始めるかもしれません。

4. 「実在する国」だけではない

AI が単に事実(「中国は大きい」など)を暗記しているだけではないことを確認するために、研究者たちは「趙東」(中国風に聞こえる)や「ブレザーランド」(英語風に聞こえる)といった、架空の国と架空の名前を発明しました。

  • 結果: 架空の国であっても、中国の AI は中国風に聞こえる国を支持し、フランスの AI はフランス風に聞こえる国を支持しました。
  • 教訓: AI は単に事実を思い出ししているのではなく、どのように訓練されて思考するかに基づいて、実在するものか架空のものかを問わず、あらゆる状況に文化的なレンズを適用しているのです。

5. 「拒絶」のトリック

一部の中国のモデルは当初、中国に関する質問に答えることを拒否しているように見えました(「答えられません」と言うなど)。研究者たちは、これは意見の欠如ではなく、フォーマット上のトリックであると気づきました。より深く調査すると、モデルが完全な文を書くことを許されると、彼らは実際には強い意見を持っていたことがわかりました。

  • 比喩: 学生が手を挙げて「答えられません」と言うが、教師が「単語一つだけ書いてくれ」と言うと、すぐに「チーム A」と書くようなものです。意見は最初からそこにあり、フォーマットがそれを隠していただけなのです。

結論

この論文は、AI における地政学的バイアスは、与えられたデータの偶然の結果ではないと結論付けています。むしろ、それは人間が AI を特定の価値観に整合させる最終的な訓練段階において積極的に構築されたものです。

  • 古い信念: 「AI がバイアスを持っているのは、インターネットがバイアスを持っているからだ。」
  • 新しい発見: 「AI がバイアスを持っているのは、それを訓練した人々(コーチ)が、特定の好意を持つように形作ったからだ。」

つまり、AI のバイアスを修正したいのであれば、インターネットのデータを掃除するだけでは不十分です。AI の行動を教えるために使用される具体的なルールや人間のフィードバックであるアライメントプロセスに目を向ける必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →