← 最新の論文
💬 NLP

Which English Do LLMs Prefer? Triangulating Structural Bias Towards American English in Foundation Models

この論文は、大規模言語モデルの開発プロセス(前学習コーパス、トークナイザー、生成出力)を多角的に検証し、米国英語が構造的に優先され英国英語が不利益を被る「構造的バイアス」を初めて体系的に実証し、言語の均質化や認識的不正義への懸念を指摘しています。

原著者: Mir Tafseer Nayeem, Davood Rafiei

公開日 2026-04-07
📖 1 分で読めます☕ さくっと読める

原著者: Mir Tafseer Nayeem, Davood Rafiei

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🍔 1. 問題の核心:「アメリカン・スタンダード」の支配

私たちが普段使っている AI(チャットボットなど)は、世界中の誰にでも使えるはずですが、実は**「アメリカ英語(AmE)」**を基準として作られています。

  • 例え話:
    Imagine 世界中の学校で使っている教科書が、すべて「アメリカの発音と綴り」で書かれていたと想像してください。
    イギリスの「colour(色)」や「lift(エレベーター)」ではなく、アメリカの「color」や「elevator」だけが正解として扱われ、他の国の人々は「自分の言葉は間違っている」と感じさせられるような状態です。
    この論文は、AI がなぜそうなってしまったのか、その**「構造上の偏り(バイアス)」**を 3 つの段階で暴き出しました。

🔍 2. 3 つの証拠:偏りが生まれる「3 つの工程」

研究者たちは、AI が作られるまでの 3 つの工程を調査し、アメリカ英語がどのように「特別扱い」されているかを見つけました。

① 材料の調達(学習データ)

AI はインターネット上の膨大な文章(データ)を食べて成長します。

  • 発見: 使われているデータの 7 割〜8 割が、アメリカのウェブサイトや本でした。
  • 例え話:
    料理人が「世界の味」を学ぼうとして、「アメリカのレシピ本」だけを 9 割も買い込み、「イギリスのレシピ本」は 2 割しか買わなかったようなものです。当然、出来上がる料理はアメリカ風になります。
    • 結果: 学習データそのものが、アメリカ英語で溢れかえっていました。

② 材料の切り方(トークナイザー)

AI は言葉を「単語」ではなく、小さな「部品(トークン)」に切って理解します。

  • 発見: アメリカ英語の単語は、部品数が少なく(効率が良い)、イギリス英語の単語は部品数が多い(非効率)ことがわかりました。
  • 例え話:
    単語をパズルのピースに例えます。
    • アメリカ英語の「color」は、大きなピース 1 つで済みます。
    • イギリス英語の「colour」は、小さなピース 2 つに分かれてしまいます。
    • 影響: AI は「1 つの大きなピース」の方が扱いやすいので、無意識のうちにアメリカ英語を好むようになります。まるで、イギリス英語を使うと「余計な手間がかかる」ような状態です。

③ 料理の完成(AI の回答)

最後に、AI が実際に文章を作る段階です。

  • 発見: ユーザーが「イギリス英語で答えて」と頼んでも、AI は7 割〜8 割の確率でアメリカ英語で返してきます。
  • 例え話:
    客が「イギリス風の料理を出して」と注文しても、厨房(AI)は**「アメリカ風のハンバーガー」**を出してきます。
    「イギリス英語(en-GB)」と指定しても、AI の頭の中では「アメリカ英語」がデフォルト(基本設定)として強く残っており、指示を無視してしまうのです。

🌍 3. なぜこれが問題なのか?(ポストコロニアルな視点)

この偏りは単なる「好みの問題」ではありません。歴史的な背景が関係しています。

  • 背景: かつてイギリスが世界中を植民地支配し、イギリス英語を広めました。しかし、その後アメリカが経済や文化(ハリウッド、IT 技術)で世界を支配し、**「アメリカ英語」がデジタル世界の「標準語」**になってしまいました。
  • 問題点:
    • 不公平さ: イギリスや、元イギリスの植民地(インド、オーストラリア、アフリカ諸国など)の人々は、自分の言葉が AI によって「劣っている」か「無視されている」ように扱われます。
    • 知識の偏り: AI が「アメリカの常識」だけを正解として教えることで、世界の多様な文化や視点が失われる危険性があります。

💡 4. 解決策への提言

この論文は、問題を指摘するだけでなく、どう直すべきかも提案しています。

  1. データのバランスを取る:
    • 料理人がアメリカのレシピ本だけでなく、イギリスや他の国のレシピ本も積極的に集めること。
  2. 部品(トークン)の設計を見直す:
    • イギリス英語の単語も、アメリカ英語と同じくらい扱いやすい「大きなピース」になるように、AI の設計図(トークナイザー)を改良すること。
  3. 意識的なチェック:
    • AI が回答する前に、「これはアメリカ英語すぎないか?」とチェックする仕組み(この論文で開発された「DIALIGN」というツール)を使うこと。

🎯 まとめ

この論文は、**「AI はアメリカの文化と言葉に偏りすぎており、世界中の多様な英語を公平に扱えていない」**という現実を、データと技術の観点から白日の下に晒しました。

AI が本当に「世界の言葉」を話すためには、単に「英語」というラベルを貼るだけでなく、**「どの国の英語か?」**という多様性を意識して設計し直す必要がある、という重要なメッセージを伝えています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →