Language-Specific Gaps in AI Safety Training Datasets
本論文は、低・中・高リソース言語におけるAI安全性トレーニングデータセットのプロベナンス(由来)、アノテーション、およびハーム・タクソノミー(危害分類)の網羅性における、極めて重要でありながらしばしば見過ごされている欠陥を露呈しており、これらの構造的な不備、特にアフリカ諸語や特定の危害カテゴリにおける不備が、多言語における安全性の主張を損ない、マルチターン・ジェイルブレイク攻撃に対する持続的な脆弱性を助長していることを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、あらゆる言語で書かれた本が詰まった、巨大で賑やかな図書館だと想像してみてください。長い間、司書たち(AIを構築している人々)は主に英語を話していたため、彼らは安全規則や「立ち入り禁止」の看板をすべて英語で書いてきました。最近になって、彼らは他の言語を話す読者を歓迎する必要があることに気づき、それらの看板を翻訳し始めました。しかし、ここに落とし穴があります。図書館が「20の言語に対応しています」と謳っていたとしても、そのルールが実際に存在しているとは限らず、また、その言語において意味を成しているとも限らないのです。この論文は、コンピュータサイエンスにおける「AIセーフティ(AIの安全性)」というコーナーに深く切り込んでいます。これは、コンピュータに礼儀正しく、安全で、役に立つ方法をどのように教えるか、そして具体的には、彼らを教育するために使われるトレーニング教材が、非英語話者にとって本当に十分なものであるかどうかを検証するものです。大きな問いはこうです。「私たちは単に看板に翻訳のステッカーを貼っているだけなのか、それとも、すべての人にとって真に文化的にも適切な新しいルールブックを書き上げたのか?」ということです。
この論文の著者たちは、探偵のような役割を果たすことに決めました。彼らは、AI企業が「自分たちのモデルはすべての人にとって安全である」と言っていることを、そのまま鵜呑みにはしませんでした。代わりに、彼らはアーカイブに潜り込み、25の言語スライスにわたる21の異なる安全性データ・コレクション(AIを訓練するために使われる「ルールブック」)を監査しました。彼らは、リソースのレベルが異なる3つの言語に焦ロカスしました:ハウサ語(小さな村の図書館のような、低リソース言語)、スワヒリ語(町の図書館のような、中リソース言語)、そしてフランス語(巨大な都市の図書館のような、高リソース言語)です。
以下に彼らが見つけた内容を記します。それは、村の図書館の「安全性」コーナーはほとんど空っぽなのに、都市の図書館のコーナーは、英語からただコピーされただけの本で埋め尽くされていることを発見するようなものです。
「翻訳の罠」
最大の驚きは、多くのデータセットが「ネイティブ(その言語で育った人々によって書かれたもの)」であると主張しているにもかかわらず、著者が詳しく調べたところ、実際には英語から機械翻訳されたものだったということです。それは、あるレストランが「本場の郷土料理を提供しています」と謳っているのに、厨房を覗いてみると、ロボットが別の国のメニューを翻訳して、お皿に貼り付けているようなものです。低リソース言語(ハウサ語)の場合、ほとんどすべての安全性データは、ネイティブスピーカーによって書かれたものではなく、翻訳されたものか、コンピュータによって捏造されたものでした。さらに悪いことに、いくつかのケースでは、翻訳があまりにひどく、研究者たちが設定した最低許容基準の品質スコアを下回っていました。ある特定のパイプラインはハウサ語とスワヒリ語の両方をテストしましたが、スワヒリ語版は余裕を持って合格した一方で、全く同じプロセスを使用したにもかかわらず、ハウサ語版は失敗しました。これは、問題が翻訳の「難しさ」にあるのではなく、そのプロセスが特定の言語に対して不注意であったことを証明しています。
「欠落した章」問題
著者たちは、安全性に関するルールがすべての危険なトピックをカバーしているかどうかもチェックしました。彼らは大きなギャップを発見しました。彼らが調査したアフリカの言語については、自傷行為や性的コンテンツに関するネイティブなルールがほとんど存在しなかったのです。それはまるで、図書館に「盗みを働いてはいけない」「喧嘩をしてはいけない」というセクションはあるものの、「自分を傷つけてはいけない」や「プライベートなことを守る」という棚は完全に空っぽであるような状態です。これは単なる小さな隙間ではなく、完全な欠落です。フランス語についてはこれらのトピックはカバーされていましたが、ハウサ語やスワヒリ語については、ネイティブな形式でのデータが存在しませんでした。これは、ユーザーが自分の母国語でデリケートな話題についてAIに尋ねた場合、AIが文化的なニュアンスを理解できなかったり、適切なルールを教わっていないために危険な回答をしたりする可能性があることを意味します。
「二重カウント」の錯覚
著者たちが暴いたもう一つのトリックは、「二重カウント」です。想像してみてください、1万冊のユニークな本を持っていると主張する図書館を。しかし、よく見てみると、彼らは単に同じ1,000冊の本を取り出し、異なる表紙を付けて、新しい本としてカウントしていたことが分かります。研究者たちは、スワヒリ語において、多くのデータセットが単に同じ元のツイートや投稿を、異なるグループによって再アノテーション(再ラベル付け)されたものであることを発見しました。これにより、膨大な量のデータが利用可能であるかのように見せていましたが、実際には、その「多様性」は錯覚でした。それは、500曲入っているというプレイリストが、実は同じ50曲を名前を変えて何度も再生しているだけのようなものです。
「低リソース」というラベルがすべてではない理由
「小さな村の図書館は、大きな都市の図書館よりも本が少ないのは当然だ」と思うかもしれません。論文も、低リソース言語にはデータが少ないという点には同意しています。しかし、彼らは問題は単にデータの「量」ではなく、データの「質」にあると論じています。彼らは、特定のタスクにおいて、中リソース言語(スワヒリ語)が低リソース言語(ハウサ語)よりも悪い品質スコアを示すことがあり、また、中リソース言語が強力なネイティブ・カバレッジを持っている領域において、高リソース言語(フランス語)にギャップがあることもある、ということを発見しました。これは、問題が単に資金やコンピュータの不足ではなく、研究コミュニティが何を構築することを優先するかという問題であることを示唆しています。もしあるコミュニティが選挙の誤情報について深く関心を持っていれば、素晴らしいデータが作られます。もしそうでなければ、そのデータは、その言語がどれほど「豊か」であろうとも、存在しないのです。
現実世界への影響
なぜこれが重要なのでしょうか?論文は、これらの欠落したデータや質の悪いデータのギャップが、現実の安全性問題に直結していることを指摘しています。研究者たちは、AIモデルがアフリカの言語における単純な一文による「ジェイルブレイク(脱獄/AIを騙して不適切な発言をさせるトリック)」を防ぐ能力は向上している一方で、複雑なマルチターン(複数回のやり取り)の会話を阻止することには依然として失敗していることを発見しました。著者たちは、これは、それらの複雑な会話のためのトレーニングデータが、ネイティブなものではなく、主に合成されたもの(コンピュータによって生成されたもの)や翻訳されたものであることが原因であると主張しています。それは、ドライバーに「赤信号で止まること(簡単な、一段階のステップ)」は教えているけれど、「突然の嵐や滑りやすい路面での対処法(複雑で多段階のステップ)」は一度も教えていないようなものです。AIは単純なトリックには対処できますが、会話が複雑になると崩壊してしまうのです。
テイクアウェイ(結論)
この論文は、すべての人にとってAIを安全にしようとする試みをやめるべきだと言っているのではありません。そうではなく、「マルチリンガル(多言語対応)」という主張が、すべてが順調であることを意味していると、ふりをするのをやめるべきだと言っています。あるデータセットが14の言語をカバーしていると言っていても、すべての言語において安全性に関するルールが実際に存在しているとは限りません。著者たちは、作成者は正直である必要があると提案しています。もしある言語のスライスが翻訳されたものであるなら、翻訳されたのだと言いなさい。もしトピックが欠けているなら、欠けていると認めなさい。彼らは、私たちが「見出し」の数字を数えるのではなく、パイの個々のスライスを見るようになることを求めています。それに至るまで、AIは英語話者にとっては安全かもしれませんが、他の多くの人々にとっては、本が足りず、看板が壊れた図書館をナビゲートしているような状態なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。