✨ 要約🔬 技術概要
デジタルの建物を警備する、非常に賢く高度に訓練された警備員がいると想像してください。この警備員の任務は、爆弾の作り方や嘘の拡散など、危険な要求をなす人々を阻止することです。長らく、この警備員は英語であれスペイン語であれ、悪意のある要求を阻止する能力が同等であると考えられてきました。
この論文は、その仮定が誤っていることを証明する探偵物語のようです。研究者たちは、警備員の「耳」は英語に非常に特異的にチューニングされているが、「目」は異なる働きをする ことを発見しました。
以下に、彼らの発見をシンプルなアナロジーを用いて解説します。
1. 「言語フィルター」対「視覚レンズ」
AI モデルを、数千の英語映画を見て英語の書籍を読むことでルールを学んだ警備員だと考えてください。
言語の弱点 : 悪役が、芝居のキャラクターになりすますや説得的な議論を用いるなど、巧妙な英語の物語を使って警備員を欺こうとすると、警備員はそのパターンを即座に認識し、「いや、この手口は以前に見たことがある」と言います。
スペイン語の転換 : 研究者たちが言語をメキシコスペイン語に切り替えると、警備員の「言語フィルター」は混乱しました。英語スタイルの巧妙な手口(例えば、ロールプレイなど)は、警備員がスペイン語におけるそのような特定の修辞的パターンを認識するように訓練されていなかったため、機能しなくなりました。これは、異なるドアに合う鍵で施錠を開けようとするようなもので、その手口はもはや機能しません。
視覚の驚き : しかし、悪役が画像 を使って警備員を欺こうとした場合、逆のことが起きました。スペイン語では、視覚的な手口が実際にはより 効果的になりました。まるで警備員の目が言語訓練とあまり結びついていないかのようです。彼が画像を見ると、テキストが英語かスペイン語かあまり気にしない別の経路を通じて処理されるからです。
2. 「順位逆転」(大きな驚き)
通常、セキュリティシステムをテストする際、どの言語で話しても「最良」の警備員は最良のまま、「最悪」の警備員は最悪のままになると期待されます。
英語では : あるモデル(「Pixtral」と呼びましょう)は最も悪い警備員で、簡単に欺かれました。別のモデル(「Qwen」)は中間でした。
スペイン語では : 順位が逆転しました!「Qwen」が突然最も悪い警備員になり、「Pixtral」は欺かれにくくなりました。
教訓 : 英語の安全性スコアを少し計算するだけで、モデルがスペイン語でどれほど安全かを推測することはできません。誰が安全で誰が危険かの順序は、言語によって実際に変化します。
3. なぜこれが起こるか(「訓練の食事」のアナロジー)
この論文は、この現象が AI モデルの訓練方法に起因すると示唆しています。
モデルを、英語だけで安全性の授業を受けた生徒だと想像してください。彼らは英語の単語や文構造に基づいて「悪い行動」を見分けることを学びました。
スペイン語で質問されると、彼らはまだ英語で訓練された脳を使って単語を分析しています。「手口の語彙」が異なるため、手口を見逃してしまいます。
しかし、画像は普遍的です。爆弾の画像は、どの言語でも爆弾のように見えます。モデルの視覚処理が英語の安全性訓練とそれほど密接に結びついていないため、特にその周囲のテキストがモデルが「安全性訓練」を十分に受けていない言語である場合、画像と危険性を結びつけることに失敗することがあります。
4. 結論
研究者たちは、4 つの異なるトップクラスの AI モデルを、英語とスペイン語の両方で 363 種類の異なる「ジャイルブレイク」(安全性ルールを回避する手口)の試しでテストしました。その結果、以下のことが分かりました。
安全性は固定された数値ではない : モデルは単に「安全」か「不安全」かというだけではありません。ある言語では安全で、別の言語では不安全なのです。
「万能」テストは破綻している : これらのモデルを英語だけでテストすれば、世界中の残りの人々にとってどれほど安全かという誤ったイメージを得ることになります。
世代は向上しているが、格差は残っている : 新しいモデルは古いモデルよりもわずかに欺かれにくいですが、英語とスペイン語の安全性レベルの間の奇妙な差は依然として存在します。
要約すると : スペイン語を話すユーザーにとって AI が安全かどうかを知りたい場合、その英語の安全性レポートを見るだけでは不十分です。スペイン語でテストする必要があります。なぜなら、装甲の「弱点」は言語によって全く異なる場所にあるからです。
技術的サマリー:同一モデル、異なる弱点
問題提起 マルチモーダル大規模言語モデル(MLLM)の現在の安全性評価は、言語とモダリティを独立した次元として扱い、モデルのジャイルブレイク攻撃に対する脆弱性が固定された性質であると仮定することが多い。本論文はこの仮定に異議を唱え、MLLM の攻撃対象領域が構造的に言語依存であることを示唆する。著者らは、アライメントの失敗が言語間で均一ではなく、むしろ言語的および視覚的攻撃が安全性フィルターを迂回するメカニズムは、異なる経路を通じて機能すると論じている。具体的には、人間のフィードバックに基づく強化学習(RLHF)が、モデルを主に英語における修辞的攻撃パターン(例:ロールプレイ、戦略的枠組み設定)を認識するように較正しており、これによりこれらの言語的防御が他の言語では効果が低いか、あるいは存在しないままになっている一方で、視覚的攻撃チャネルは言語的障壁が除去された際に一貫して脆弱であるか、あるいはさらに強力になる可能性があるという仮説を立てている。
方法論 本研究は、米国英語(en-US)とメキシコスペイン語(es-MX)を比較する、初の体系的なクロスリンガルかつマルチモーダルなレッドチーム評価を提示する。
評価対象モデル: 4 つの最先端 MLLM:Claude Sonnet 4.5、GPT-5、Pixtral Large、Qwen Omni。これらは、Van Doren & Ford [1] による先行する英語のみを対象とした研究で評価されたモデルの次世代後継モデルとして選択された。
敵対的ベンチマーク: 本研究では、違法活動、偽情報、非倫理的行動の 3 つの危害カテゴリを網羅する 363 の固有の敵対的シナリオの固定セットを利用した。各シナリオは 6 つの攻撃戦略(例:ロールプレイ、拒絶抑制)で構築され、テキストのみの条件とマルチモーダル(テキスト+画像)の条件の両方でインスタンス化された。
言語プロトコル: すべてのプロンプトはネイティブスピーカーによってメキシコスペイン語に専門的に翻訳され、攻撃ベクトルを変更する可能性のある文化的適応なしに敵対的意図の忠実性を確保するため、独立してレビューされた。
データ収集: 合計 52,272 の危害評価と二値の攻撃成功判定が収集された。9 名のネイティブ英語話者と 9 名のネイティブスペイン語話者が、モデルの回答を 5 段階のリッカート尺度で評価した。アノテーターはモデルの身元とモダリティについて盲検であった。
統計分析: 著者らは、プロンプトと評価者に対する交差ランダム効果を用いたベイズ混合効果モデル(R における brms を使用)を採用した。このアプローチにより、モデル、モダリティ、言語、およびそれらの相互作用に帰属する分散の分解が可能となり、集約分析の落とし穴を回避した。
主な貢献
分離のメカニズム的証拠: 本研究は、言語的および視覚的なアライメントの失敗が異なるメカニズムを通じて機能するという実証的証拠を提供する。著者らは、プロンプト言語を英語からスペイン語に切り替えることで分離が生じることを実証している。すなわち、言語的攻撃技術(ロールプレイなど)は著しく効果が低下する一方、視覚的に明示的なマルチモーダル攻撃はより効果的になる。これは、プロンプト - 言語インターフェースが単なるアノテーターの寛容性の産物ではなく、アライメントの構造的な特徴であることを示唆している。
安全性ランキングの順位逆転: 本論文は、安全性ランキングが言語間で転用可能ではないことを確立している。英語の条件では Pixtral Large が最も脆弱なモデルであったのに対し、スペイン語の条件では Qwen Omni がそれを追い抜き、最も脆弱なモデルとなった。この順位逆転は、英語条件のスコアのスカラー補正では回復できず、英語のみを対象としたベンチマークが、グローバルに展開されるモデルのリスクプロファイルを根本的に誤って表現していることを示している。
方法論的枠組み: 著者らは、安全性評価におけるベイズ混合効果枠組みの有効性を示した。プロンプトレベルと評価者レベルの分散を共同で考慮することで、この手法は集約分析では見逃されるクロスリンガルおよびクロスモーダルの構造を明らかにする。著者らは、将来の評価においてこのアプローチを促進するため、分析スクリプトとデータを公開した。
結果
言語的対視覚的減衰/増幅: スペイン語(es-MX)において、言語的攻撃は著しい減衰を示した。例えば、ロールプレイ攻撃は英語と比較して信頼性のあるほど効果が低かった(OR = 0.45)。一方、有毒な画像の実行はスペイン語で信頼性のあるほど効果的であった(OR = 1.58)。
モデル固有の脆弱性:
Claude Sonnet 4.5: 両言語および両モダリティにおいて最も耐性のあるモデルであり、英語(11.3%)とスペイン語(11.4%)の間で攻撃成功率(ASR)の変化は無視できるほど少なかった。
Pixtral Large: スペイン語への切り替え時に脆弱性が最も大きく低下し(ASR は en-US の 50.5% から es-MX の 32.0% に低下)、英語固有の言語的アライメントへの重篤な依存を示した。
Qwen Omni: スペイン語で脆弱性が増加する(ASR は en-US の 31.2% から es-MX の 35.6% に上昇)という独特のパターンを示し、Pixtral Large に対する観察された順位逆転をもたらした。
世代間の傾向: これらの結果を先行する世代のモデルと比較すると、4 つのモデルファミリーのうち 3 つで絶対的な ASR が低下した。しかし、モデル間の格差は縮小せず、脆弱性ランキングの言語依存構造は維持された。
意義と主張 本論文は、言語とモダリティを独立した次元として扱う安全性評価フレームワークが、グローバルに展開される MLLM の攻撃対象領域を根本的に誤って特定していると主張する。中心的な発見は、言語的攻撃と視覚的攻撃の有効性の間の「分離」が、英語の修辞的パターンに較正された RLHF ベースのアライメントの予測される結果であるということである。したがって、英語のみを対象としたベンチマークは、多様な人口集団に展開されるモデルの攻撃対象領域を特徴づけるものではなく、英語条件でアライメントされたレンズを通して見られた表面のみを特徴づけるに過ぎない。
著者らは、リリース前の安全性パイプラインには、意図された展開人口を代表する言語でのネイティブスピーカーによるレッドチーム評価を含める必要があると論じている。彼らは結論として、安全性によるモデルの順序付けは固定された性質ではなく、言語によって変化する現在のアライメント実践の構造的な特徴であり、集約された ASR 指標ではなく、アイテムレベルの分散分解を含む安全性評価基準の再設計が必要であると述べている。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×