← 最新の論文
💬 NLP

Same Model, Different Weakness: How Language and Modality Reshape the Jailbreak Attack Surface in Frontier MLLMs

本研究は、最先端のマルチモーダル大規模言語モデルにおけるジャイルブレイク脆弱性が言語間で均一ではないことを明らかにし、英語からスペイン語への切り替えが言語的枠組み攻撃を弱めつつ視覚的攻撃を強化することで攻撃対象領域を根本的に変え、単一言語評価に基づく安全性のランキングを無効化することを示している。

原著者: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

公開日 2026-05-25
📖 1 分で読めます☕ さくっと読める

原著者: Casey Ford, Madison Van Doren, Sicheng Jin, Emily Dix

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルの建物を警備する、非常に賢く高度に訓練された警備員がいると想像してください。この警備員の任務は、爆弾の作り方や嘘の拡散など、危険な要求をなす人々を阻止することです。長らく、この警備員は英語であれスペイン語であれ、悪意のある要求を阻止する能力が同等であると考えられてきました。

この論文は、その仮定が誤っていることを証明する探偵物語のようです。研究者たちは、警備員の「耳」は英語に非常に特異的にチューニングされているが、「目」は異なる働きをすることを発見しました。

以下に、彼らの発見をシンプルなアナロジーを用いて解説します。

1. 「言語フィルター」対「視覚レンズ」

AI モデルを、数千の英語映画を見て英語の書籍を読むことでルールを学んだ警備員だと考えてください。

  • 言語の弱点: 悪役が、芝居のキャラクターになりすますや説得的な議論を用いるなど、巧妙な英語の物語を使って警備員を欺こうとすると、警備員はそのパターンを即座に認識し、「いや、この手口は以前に見たことがある」と言います。
  • スペイン語の転換: 研究者たちが言語をメキシコスペイン語に切り替えると、警備員の「言語フィルター」は混乱しました。英語スタイルの巧妙な手口(例えば、ロールプレイなど)は、警備員がスペイン語におけるそのような特定の修辞的パターンを認識するように訓練されていなかったため、機能しなくなりました。これは、異なるドアに合う鍵で施錠を開けようとするようなもので、その手口はもはや機能しません。
  • 視覚の驚き: しかし、悪役が画像を使って警備員を欺こうとした場合、逆のことが起きました。スペイン語では、視覚的な手口が実際にはより効果的になりました。まるで警備員の目が言語訓練とあまり結びついていないかのようです。彼が画像を見ると、テキストが英語かスペイン語かあまり気にしない別の経路を通じて処理されるからです。

2. 「順位逆転」(大きな驚き)

通常、セキュリティシステムをテストする際、どの言語で話しても「最良」の警備員は最良のまま、「最悪」の警備員は最悪のままになると期待されます。

  • 英語では: あるモデル(「Pixtral」と呼びましょう)は最も悪い警備員で、簡単に欺かれました。別のモデル(「Qwen」)は中間でした。
  • スペイン語では: 順位が逆転しました!「Qwen」が突然最も悪い警備員になり、「Pixtral」は欺かれにくくなりました。
  • 教訓: 英語の安全性スコアを少し計算するだけで、モデルがスペイン語でどれほど安全かを推測することはできません。誰が安全で誰が危険かの順序は、言語によって実際に変化します。

3. なぜこれが起こるか(「訓練の食事」のアナロジー)

この論文は、この現象が AI モデルの訓練方法に起因すると示唆しています。

  • モデルを、英語だけで安全性の授業を受けた生徒だと想像してください。彼らは英語の単語や文構造に基づいて「悪い行動」を見分けることを学びました。
  • スペイン語で質問されると、彼らはまだ英語で訓練された脳を使って単語を分析しています。「手口の語彙」が異なるため、手口を見逃してしまいます。
  • しかし、画像は普遍的です。爆弾の画像は、どの言語でも爆弾のように見えます。モデルの視覚処理が英語の安全性訓練とそれほど密接に結びついていないため、特にその周囲のテキストがモデルが「安全性訓練」を十分に受けていない言語である場合、画像と危険性を結びつけることに失敗することがあります。

4. 結論

研究者たちは、4 つの異なるトップクラスの AI モデルを、英語とスペイン語の両方で 363 種類の異なる「ジャイルブレイク」(安全性ルールを回避する手口)の試しでテストしました。その結果、以下のことが分かりました。

  • 安全性は固定された数値ではない: モデルは単に「安全」か「不安全」かというだけではありません。ある言語では安全で、別の言語では不安全なのです。
  • 「万能」テストは破綻している: これらのモデルを英語だけでテストすれば、世界中の残りの人々にとってどれほど安全かという誤ったイメージを得ることになります。
  • 世代は向上しているが、格差は残っている: 新しいモデルは古いモデルよりもわずかに欺かれにくいですが、英語とスペイン語の安全性レベルの間の奇妙な差は依然として存在します。

要約すると: スペイン語を話すユーザーにとって AI が安全かどうかを知りたい場合、その英語の安全性レポートを見るだけでは不十分です。スペイン語でテストする必要があります。なぜなら、装甲の「弱点」は言語によって全く異なる場所にあるからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →