← 最新の論文
💬 NLP

'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection

この論文は、大規模言語モデルが様々なスクリプトを用いたウルドゥー語のヘイトスピーチを検出する際に、重大な安全性の一貫性の欠如と「ウルドゥー語での見落とし」率を示すことを明らかにしており、これは過去9年間の主要なAI安全性研究の会議録においてウルドゥー語が完全に欠落していることに起因する、コンテンツモデレーションの信頼性における決定的なギャップを浮き彫りにしている。

原著者: Fawzia Zehra (Fuzzy), Kara-Isitt, Sonal Khosla, Stephen Swift

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Fawzia Zehra (Fuzzy), Kara-Isitt, Sonal Khosla, Stephen Swift

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットは、何十億もの人々が毎秒、思考やジョーク、不満を共有する、広大で騒々しい市場です。この空間の安全を守るため、テクノロジー企業は、現実世界での実害が発生する前に、投稿をスキャンしてヘイトスピーチや脅迫を特定するデジタル・ゲートキーパーとして機能する自動化システムに頼っています。これらのシステムは膨大な量のテキストを用いて学習しており、自身が最もよく知る言語において、虐待のパターンを認識することを学びます。しかし、世界には多くの言語が存在し、これらのデジタル・ゲートキーパーがそれらを理解する能力は平等ではありません。英語のような言語は、システムが学習するデータの中で十分に代表されていますが、他の言語はしばしば見落とされがちです。システムが特定の言語におけるヘイトスピーチを認識できなかった場合、そこには、同じシステムが異なる言語で書かれていればその種の害をブロックできたはずなのに、という盲点が生まれ、害がチェックされることなく蔓延する隙間が生じます。この格差は単なる技術的な不具合ではなく、数百万人の話者を脆弱な状態に置く安全上の失敗なのです。

ロンドン・ブルネル大学とドイツのハッソ・プラトナー研究所の研究者による最近の研究は、これらの中で最も重大な盲点の一つであるウルドゥー語に光を当てています。ウルドゥー語は世界で10番目に多く話されている言語であり、パキスタン、インド、そしてイギリスやアメリカの大きなコミュニティにおいて2億4600万人の話者がいます。この規模の大きさと、ウルドゥー語を話すコミュニティで記録されているオンライン上の虐待の多さにもかかわらず、研究者たちは、オンライン・セーフティ研究の分野がウルドー語をほぼ完全に無視してきたことを発見しました。オンライン上の虐待に特化した主要な学術会議の9年間にわたる包括的なレビューにおいて、チームはウルドゥー語に特化した論文が一件も存在しないことを突き止めました。2022年の主要なワークショップがこの言語に関するさらなる研究を明示的に呼びかけていたことを考えると、この欠如は驚くべきことです。研究者たちは、この関心の欠如が現在使用されている安全ツールにどのような測定可能な影響を与えているのかを確かめるべく調査を開始しました。

これを検証するために、チームは今日利用可能な最も高度な人工知能モデルのうち5つを精査しました。彼らはこれらのモデルに、ヘイトスピーチ、脅迫、および通常の会話を含む大量のテキストを入力しましたが、その提示方法を変えて実験を行いました。あるテキストは、右から左へと流れるナスタリクと呼ばれるオリジナルのウルドゥー語のスクリプト(書体)で書かれていました。他のテキストは、ソーシャルメディアでよく行われる習慣である、英語の文字を使ってウルドゥー語の単語を綴る「ローマン・ウルドゥー」で書かれていました。また、研究者たちは同じメッセージの英語翻訳も提供しました。メッセージを異なる形式で提示した際にモデルがどのように反応するかを比較することで、安全システムが内容を真に理解しているのか、あるいは単に文字の形に反応しているだけなのかを見極めることができました。

結果は、困惑すべき不一致を明らかにしました。モデルが有害なコンテンツを英語で読んだとき、それらは正しく虐待であると識別しました。しかし、全く同じメッセージがオリジナルのウルドゥー語のスクリプトで提示されたとき、モデルはしばしばそれを危険であるとフラグ立てすることに失敗しました。テストされた異なるモデル全体を通じて、有害なメッセージの平均約18パーセントが、ウルドゥー語か英語かによって異なるラベル付けを受けていました。簡単に言えば、もし誰かがウルドゥー語で脅迫を投稿した場合、システムはそれを通常の投稿として通過させてしまう可能性がありますが、もしその脅迫が英語に翻訳されていれば、システムは即座にブロックするのです。この「ウルドゥー語での見逃し」率、つまりスクリプトの違いによってのみ有害なコンテンツが隙間から滑り落ちてしまう割合は、使用された特定のモデルに応じて、およそ2パーセントから10パーセント近くに及びました。

また、この研究は、すべての人工知能モデルがこの問題に対して等しく脆弱であるわけではないことも強調しています。「フロンティアモデル」と呼ばれる最も高度で大規模なモデルは、より高い一貫性を示し、エラーが少なかったです。しかし、より小規模なオープンソースのモデルははるかに高い失敗率を示し、ウルドゥー語の場合、有害なコンテンツのNearly 3分の1を見逃していました。これは、これらのシステムの安全機能が均一ではなく、不均等に分布しており、一部の言語の話者には強い保護を提供し、他の話者は露出したままにしていることを示唆しています。研究者たちはまた、利用可能なデータの構造的なギャップについても指摘しました。ウルドゥー語と英語を混ぜ合わせた、現代のオンラインでのコミュニケーションの一般的な形態に対応する専用のヘイトスピーチ・データセットが存在しないのです。この特定のタイプのデータがなければ、現代のソーシャルメディアの複雑で混合された現実を、これらのシステムがいかにうまく扱えるかを完全にテストすることは不可能です。

結局のところ、この研究は、現在の安全ツールが「不均一な盾」を提供していることを証明しています。英語におけるヘイトスピーチを確実に検出できる一方で、ウルドゥー語における同じ発言を認識できないシステムは、その言語を話す数百万の人々にとって真に安全であるとは言えません。今回の知見は、ウルドゥー語が安全研究から欠落していることが、単なる学術的な見落としではなく、コンテンツ・モデレーションにおいて現実的かつ測定可能な結果をもたらしていることを裏付けています。これらのギャップがより優れたデータと、異なるスクリプトにわたるより厳格なテストによって埋められない限り、世界のオンライン人口の大部分は、彼らを保護するために設計されたはずのシステムが、単に見ることができない危害に対して、脆弱なまま取り残されることになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →