← 最新の論文
🤖 AI

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

本論文は、6つの言語におけるインド中心の社会・文化的バイアスを評価する多言語ベンチマークであるINCLUDEを紹介しており、現在の英語中心のLLMにおける安全性アライメントが、非英語の出力、特にベンガル語やクローズドソースモデルにおいて、英語の出力よりも著しく高いバイアスを示すという、重大なクロスリンガルな安全性のギャップを生み出していることを明らかにしている。

原著者: Namya Bhatnagar

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Namya Bhatnagar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インドの農村の村においても、ロンドンの賑やかなオフィスにおいてと同様に、コンピュータ・アシスタントの声が流暢で公平であるような世界を想像してみてください。長年、これらのアシスタントの背後にある技術は、主に英語のテキストを用いて学習し、「セーフティ・アライメント」と呼ばれるプロセスを通じて、有害なステレオタイプを認識し、不適切な要求を拒否することを学んできました。このトレーニングは、機械が人種、宗教、または社会的地位に関する偏見を繰り返すのを防ぐために設計されたフィルターのような役割を果たします。しかし、ある決定的な疑問が未解決のまま残されています。それは、このフィルターはヒンディー語やベンガル語、あるいは英語とヒンディー語を混ぜた言葉で話す場合にも同様に機能するのか、という点です。もしこのフィルターが英語しか理解できないのであれば、他の言語を話す何百万もの人々は、テクノロジーが防ごうとしていたはずの偏見にさらされたままになってしまいます。これが、人工知能の安全性の約束が、インドの多様な言語的景観において真に成立しているのかを調査した新しい研究の核心的な懸念事項です。

ナミヤ・バトナガール氏率いる研究チームは、この格差を測定するために、「INCLUDE」と呼ばれる特化したテストを作成しました。このベンチマークは、英語、ヒンディー語、ベンガル語、マラーティー語、タミル語、そして日常会話で一般的に使われるヒンディー語と英語の混合言語である「ヒングリッシュ」という6つの異なる言語を用いて、異なる人工知能モデルが文化特有のステレオタイプをどのように扱うかを検証するために設計されました。このテストを構築するために、チームはまず、カースト、宗教、地域など、偏見が現れやすい6つの領域を定義しました。次に、教師や大学の教員を含む20人の専門家パネルを集め、数千もの質問を精査・洗練させました。これらの質問は、モデルが有害なステレオタイプに傾いているか、あるいはそれを拒絶しているかを明らかにするような形で、文章を完成させるようモデルに促す、自然な響きを持つように注意深く作成されました。チームはこれらのプロンプトを5つのインドの言語に翻訳し、意味やステレオタイプの強度がすべてのバージョンで一貫するように配慮しました。

研究では、10種類の異なる人工知能モデルを評価し、それらを「誰でも検査・修正ができるオープンソースのモデル」と「大手テクノロジー企業が所有するクローズドなシステム」の2つのグループに分けました。研究者がオープンソースのモデルをテストしたところ、明確で深刻なパターンが見つかりました。プロンプトがインドの言語で書かれている場合、モデルは英語の場合と比較して、著しく偏ったステレオタイプな回答を生成する傾向がありました。インドの言語の中では、ベンガル語が最も高いレベルの偏見を引き起こし、次いでヒンディー語がそれに続きました。驚くべきことに、これらのオープンモデルにおいては、英語のプロンプトが最も低い偏見スコアを示しました。これは、セーフティ・フィルターが英語の話し手にはうまく機能している一方で、それ以外のすべての人々に対しては失敗していることを示唆しており、英語では保護されていると感じる一方で、母国語では脆弱なままとなるという「安全性の錯覚」を生み出しています。

音声アシスタントの検索や情報取得機能を支えることが多いクローズドソースのモデルについては、さらに異なり、かつ複雑な物語が明らかになりました。このグループでは、パターンが完全に逆転しました。モデルは、プロンプトが英語であるときに最も強い偏見の関連性を示し、インドの言語ではより低い偏見スコアを示しました。この逆転現象は、問題の原因が単一ではないことを示唆しています。オープンモデルの場合、問題は安全性のトレーニングが主に英語で行われたため、他の言語が守られていないことにあるようです。一方、クローズドモデルの場合、偏見はそれらが元々学習した膨大な量の英語テキストに由来しており、それが世界の理解の核となる部分に強いステレオタイプを埋め込んでいると考えられます。

最も重要な発見の一つは、何百万人もの人々が使用しているコード混合言語である「ヒングリッシュ」に関するものでした。研究によると、ヒングリッシュは英語による安全上の恩恵を受けられませんでした。英語の単語を含んでいるにもかかわらず、モデルはそれを他の低リソースのインドの言語と同様に扱い、英語ではなくヒンディー語やタミル語と同じグループに分類しました。これは、音声によるインタラクションにおいてこの混合言語に頼るユーザーが、純粋な英語の話し手と同じレベルの保護を受けていないことを意味します。また、研究者は、偏見のスコアには変動があるものの、それらはランダムなものではなく、システムの構築における現実的で測定可能な失敗として考えられるほど一貫していると指摘しました。

本研究は、人工知能の安全性は言語によって一様ではないと結論付けています。現在のモデルの学習方法は、英語の話し手は有害なステレオタイプから保護される一方で、他の言語の話し手は保護されないという分断を生み出していることを明らかにしました。研究結果は、単に安全規則を英語から翻訳するだけでは不十分であり、モデルがどのように学習し、どのようにアライメント(調整)されるかという構造そのものが、異なる文化や言語のニュ一細(ニュアンス)を考慮するように変化する必要があることを示唆しています。これらのギャップを特定することで、研究者たちは、話す言語に関わらず、すべての人にとって真に公平なシステムを開発するためのロードマップを提供したいと考えています。この研究は、人工知能における真の公平性を達成するには、支配的な言語を超えて視野を広げ、テクノロジーが展開される特定の文化的文脈に対処する必要があることを強調しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →