← 最新の論文
💬 NLP

LLM Evaluators are Biased across Languages

本論文は、多言語LLM評価器において、低リソース言語がより高いスコアを受け取り、高リソース言語よりも容易に安全フィルターを通過するという、一貫した統計的に有意なバイアスが存在することを実証しており、これは評価器が高い相対的順位付けの一致を示しているにもかかわらず、標準的なペアワイズ精度指標では検出されない重大な欠陥である。

原著者: Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あらゆる質問をスーパースマートなロボットに投げかけるたびに、そのロボットがあなたの母国語で答えてくれる世界を想像してみてください。これらのロボットは「大規模言語モデル(LLM)」と呼ばれ、物語を書いたり、数学の問題を解いたり、あらゆることについてチャットができるデジタル百科事典のような存在です。しかし、彼らがうまくやっているかどうかをどうやって判断すればよいのでしょうか?私たちには審判が必要です。AIの世界では、これらの審判はスコアを付けるように訓練された他のロボットであったり、AI自身に採点させるような人間のようなプロンプトであったりします。通常、これらの審判が公平かどうかを確認するために、二つの選択肢の間でどちらが「より良い」回答かを正しく選べるかどうかをチェックします。これは、二つの絵のうちどちらがより美しいかを決める裁判官のようなものです。これを「ペアワイズ精度(pairwise accuracy)」と呼びます。もし審判が90%の確率で正しい勝者を選べるなら、彼らは素晴らしい仕事をしており、どのような言語が話されていても、その採点は公平であると想定されます。

しかし、この仮定には隠れた問題があります。審判が二つの絵のうちどちらが良いかを見分けることができたとしても、それが同じ「物差し」を使って測定しているとは限らないのです。現実の世界では、東京の星4つのレストランは料理の傑作と見なされるかもしれませんが、ニューヨークの星4つのレストランは単に「まあまあ」と見見なされるかもしれません。星の意味は、どこにいるかによって異なります。この論文「LLM Evaluators are Biased across Languages(LLM評価者は言語間でバイアスを持つ)」は、私たちのAI審判も同じ文化的な混乱に陥っているのではないか、という点に切り込んでいます。研究者たちは、次のように知りたかったのです。「もしAIが英語で完璧な回答をした場合、その回答をヒンディー語、ペルシャ語、またはウクライナ語に翻訳したとしても、全く同じスコアを与えるのだろうか? それとも、意味が全く同じであっても、言語そのものがスコアを変えてしまうのだろうか?」

チームは、これを知るために大規模な実験を設定しました。彼らは全く同じ指示セットと回答を用意し、それらを英語やスペイン語のような広く話されている言語から、ヘブライ語やヒンディー語のような他の言語まで、23の異なる言語に翻訳しました。そして、スコアを出すように促されただけのものや、特定の「報酬」数値を出すように特別に訓練されたものを含む、8種類の異なるタイプのAI評価者に、これらの同一の回答を採点させました。

結果は衝撃的でした。評価者たちは同じ物差しを使っていませんでした。内容は意味的に同一(つまり、全く同じことを意味している)であったにもかかわらず、スコアは言語に応じて激しく変動しました。バイアスは巨大でした。1から5のスケールにおいて、最高スコアの言語と最低スコアの言語の差は約0.5ポイントに達しました。これは採点の世界においては極めて大きな差です。

ここにある、非常に厄介なひねりがあります。それは、評価者たちは見た目上は完璧に見えたということです。研究者が「ペアワイズ精度(どちらの回答がより良いかを判定できるか)」をチェックしたところ、そのスコアは非常に高く、しば しば90%を超えていました。審判たちは、「回答Aは回答Bよりも優れている」と一貫して正しく判断できていたのです。しかし、彼らは「回答Aが実際にはどれほど優れているか」については、一貫性に欠けていました。それはまるで、レースの勝者を常に正しく選ぶものの、その勝者がフランス語で走った場合には100点をあげ、ドイツ語で走った場合には50点しかあげない裁判官のようなものです。

この論文は明確なパターンを発見しました。評価者は、低リソース言語(ヒンディー語やヘブライ語のように、オンラインで利用可能なデータが少ない言語)に対して驚くほど寛大であり、英語のような高リソース言語に対しては厳格であるという点です。まるでAI審判は、「この言語における完璧な回答がどのようなものか100%確信が持てないので、念のため高いスコアを与えておこう」と考えているかのようです。逆に、英語に対しては非常に自信を持ち、厳格であり、回答に対してより高い基準を課していました。

これは単なる数字のゲームではありません。現実世界に深刻な影響を及ぼします。多くのAIシステムは、ユーザーに表示する内容が安全かどうかを判断するために「グローバルな閾値(しきい値)」を使用しています。例えば、もし安全フィルターが一定のスコア未満のものをブロックするように設定されている場合、このバイアスにより、低リソース言語における有害なコンテンツが通り抜けてしまう可能性が高くなります。論文によれば、単一のグローバルなルール下では、コンテンツの承認率は言語間で最大43パーセントポイントも変動することが分かりました。ある具体的な例では、英語での有害な質問は正しくブロックされましたが、全く同じ質問がウクライナ語で行われた場合、評価者が高いスコアを与えたために、通過を許されてしまいました。

研究者たちは、なぜこのようなことが起こるのかについても調査しました。彼らは、AIが(テキストに対して)どれほど「驚いているか(不確実性)」によって、AIが自信を失っているのではないかと疑いました。彼らは、AIが自信を持てないとき(不確実性が高いとき)には、高いスコアを与える傾向があることを発見しました。しかし、彼らは「不確実性」だけがすべてではないことも証明しました。AIがどれほど困惑しているかを考慮した後でも、言語そのものがスコアを予測していました。これは、このバイアスが単なる「言語を十分に理解していない」という単純なケースではなく、これらのモデルが構築されている仕組みにおける、深く構造的な問題であることを意味しています。

論文は、AI評価者からの生のスコアを異なる言語間でそのまま信頼することはできないと結論付けています。言語ごとにスコアを調整することで、この問題の一部を解決することはできますが、それは新たな脆弱性を生み出します。もし誰かが一つのプロンプトの中で言語を混ぜて使う(コードスイッチング)場合、システムはどの言語のルールを適用すべきか混乱し、有害なコンテンツを通過させてしまう可能性があります。著者らは、単に評価者が「勝者」を選べるかどうかをチェックするのではなく、すべての言語において公平かつ一貫したものであるよう調整(キャリブレーション)されたシステムを構築する必要があると提案しています。これにより、ヒンディー語での5つ星の回答が、英語での5つ星と同じように真に価値を持つようになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →