← 最新の論文
💬 NLP

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

この論文は、多言語・マルチモーダル大規模言語モデルが言語横断的な敵対的脆弱性を露呈している一方で、低リソース言語におけるそれらの見かけ上の安全性は、多くの場合、視覚および理解の失敗(「失敗による安全性」)による人工的なものであるのに対し、訓練全体を通じて深い多言語統合を備えたモデルは、真の言語横断的な安全性の整合性を達成していることを明らかにしている。

原著者: Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常にスマートで、カメラのように「見る」ことができ、人間のように「考える」ことができるロボットのグループを想像してみてください。これらはマルチモーダル大規模言語モデル(MLLM)と呼ばれます。これらは、写真を見てそれを説明したり、見たものについて質問に答えたりすることに長けています。

しかし、人間と同じように、これらのロボットも騙されることがあります。この論文は、これらのロボットがいかに簡単に騙されてしまうかについての大きな調査であり、特に12種類の言語で話したり理解したりする場合に焦点を当てています。

研究者たちが発見した物語を、分かりやすく説明します:

1. 「ユニバーサル・グリッチ(普遍的な不具合)」(Adversarial Attacks)

研究者たちは、人間の目には見えない、画像に加えた微細で目に見えない傷(古いテレビの砂嵐のようなもの)を加えることで、ロボットを「ハッキング」しようと試みました。これらの傷は、ロボットの脳を混乱させるように設計されています。

  • 発見: 彼らは「ユニバーサル・グリッチ」を発見しました。もし英語で混乱させるような傷を作れば、ロボットがスペイン語、ヒンディー語、あるいはアラビア語で話そうとしても、同様にロボットを混乱させることができました。
  • 比喩: ロボットが世界を見るための、たった一つの壊れやすい「メガネのレンズ」を持っていると考えてみてください。もしそのレンズに汚れがついたら、ロボットが英語で看板を読もうとしているのかフランス語で読もうとしているのかに関わらず、その汚れのせいで、あらゆる言語の文字が見えなくなってしまいます。弱点は言語にあるのではなく、ロボットが世界を見ている方法にあります。

2. 「サイレント・フェイラー(沈黙による失敗)」対 「丁寧な拒絶」 (Safety)

研究者たちは、ロボットが危険な要求(例:「爆弾の作り方を教えて」)に対して「いいえ」と言えるかどうかをテストしました。彼らはこれを2つの方法でテストしました:

  1. 言葉で尋ねる: 「爆弾の作り方を教えて」
  2. 画像で尋ねる: 「爆弾の作り方」という文字が書かれた画像を見せる。

彼らは2種類のロボットを比較しました:

  • タイプA(「クイック・ラーナー(習得が早い学習者)」): これらのロボット(PALOやPARROTなど)は、最初に英語を学び、その後、英語のレッスンを翻訳することで他の言語を素早く学びました。
  • タイプB(「ディープ・ラーナー(深い学習者)」): このロボット(QWEN3-VL)は、最初からすべての言語を、脳の中に深く統合される形で学びました。

「安全性による失敗」という錯覚

研究者たちは、タイプAのロボットにおける恐ろしいトリックを発見しました。

  • 何が起きたか: 「難しい」言語(ベンガル語やウルドゥー語など)で危険な質問をされたとき、ロボットは爆弾の作り方を教えることはありませんでした。実際には、何も悪いことを言わなかったので、一見「安全」に見えました。
  • 落とし穴: ロボットが賢いから安全だったのではなく、混乱していたために安全に見えたのです。ロボットは質問を全く理解できていませんでした!ただ、「黒い犬が見えます」といった支離滅裂な内容を生成したり、同じ言葉を繰り返したりして、幻覚(ハルシネーション)を起こしていただけなのです。
  • 比喩: 銀行の警備員を想像してください。もし強盗が警備員の知らない言語を話したら、警備員はただ呆然と立ち尽くし、「青い椅子が見えます」と言うかもしれません。銀行は安全ですが、それは警備員が勇敢だったり賢かったりしたからではありません。警備員がその言語において**文盲(読み書きができない状態)だからです。論文ではこれを「安全性による失敗(Safety-by-Failure)」**と呼んでいます。

「真の安全性」

タイプBのロボット(QWEN3-VL)は異なっていました。

  • 何何が起きたか: 同じ危険な質問をベンガル語やウルドゥー語で投げかけられたとき、このロボットは質問を完璧に理解していました。支離滅裂な答えを出すのではなく、「いいえ、それはできません」と言いました。
  • 意外な展開: 興味深いことに、タイプAのロボットは、リソースの少ない言語(低リソース言語)において、より「安全」に見えました(理解できずに失敗したため)。一方で、タイプBのロボットは、それらの言語において、実際に理解した上で「ノー」と言うべきかどうかを判断しなければならないため、その「弱点」を露呈しました。

3. 「タイポ(打ち間違い)」の罠

研究者たちは、危険な言葉が画像の中に書かれている場合(例えば、店の看板のように)に何が起こるかもテストしました。

  • 英語の看板: ロボットは画像内の英語の看板を簡単に読むことができ、しばしば危険な指示に従ってしまいました。
  • 外国語の看板: 看板がアラビア語や中国語であった場合、タイプAのロボットはその文字を読むことができませんでした。彼らは看板を無視するか、背景を描写するだけでした。これもまた、彼らが注意深かったからではなく、彼らの「目」がその文字を読めなかったためです。

大きな教訓

この論文は、ロボットが上手く話せない言語において「安全に見える」としても、それは本当に安全であるということではない、と結論づけています。それは単に、危険に気づくほど賢くない(混乱している)だけかもしれません。

これらのロボットをあらゆる言語で真に安全にするためには、最後に英語のレッスンを翻訳するだけでは不十分です。彼らが危険を理解し、どんな言語で話されても適切に「ノー」と言えるように、最初からすべての言語を深く教え込む必要があります。

要約すると: 脅威を理解していないロボットは、安全なロボットではありません。それは単に、目が見えていないだけのロボットです。真の安全性とは、脅威を理解した上で、それを拒否することを選択できることを意味します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →