← 最新の論文
💬 NLP

Refusal Direction is Universal Across Safety-Aligned Languages

本論文は、14 言語にわたる大規模言語モデルの拒否メカニズムを調査し、英語から抽出された拒否ベクトルが追加の微調整なしに他言語の安全性バイパスを可能にする「拒否方向の普遍性」を発見し、そのメカニズムを解明したことを報告しています。

原著者: Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

公開日 2026-02-26
📖 1 分で読めます☕ さくっと読める

原著者: Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「AI(大規模言語モデル)が『ダメです』と拒絶する仕組みが、実は世界中のどの言語でも『同じ方向』を指している」**という驚くべき発見について書かれています。

まるで、AI の頭の中に**「安全装置のスイッチ」**が一本の線(ベクトル)で繋がれているようなものです。このスイッチの向きさえわかれば、英語で学んだ「拒絶の方向」を、日本語やドイツ語、タイ語など他の言語の AI にもそのまま適用できるのです。

以下に、わかりやすい比喩を使って解説します。


1. 発見:「拒絶のベクトル」は万国共通のコンパス

AI が「有害な質問(例えば、人を傷つける方法)」をされたとき、それは「拒絶(No)」という反応をします。
研究者たちは、AI の頭の中(ニューラルネットワーク)を詳しく調べると、この「拒絶」の反応が、ある**特定の方向(ベクトル)**に集まっていることに気づきました。

  • 比喩: 想像してください。AI の頭の中に**「安全のコンパス」**が一つあります。このコンパスの針が「北(拒絶)」を指しているとき、AI は安全な回答をします。
  • 驚きの事実: このコンパスの「北」は、言語によって向きが変わらないことがわかりました。英語で「北」を指すコンパスの向きは、日本語やフランス語でも全く同じ「北」を指しているのです。

2. 実験:英語の「魔法の杖」で世界中の AI を操る

研究者たちは、この仕組みを使って面白い実験を行いました。

  • 実験 A(英語から世界へ):
    英語のデータから「拒絶の方向」を抜き取り、それを AI の頭から**「取り除く(消す)」**操作をしました。

    • 結果: 英語だけでなく、日本語、中国語、タイ語など、14 言語すべてで、AI が「拒絶」できなくなり、有害な質問にも「はい、やります」と答えてしまうようになりました(ジャイブーク成功)。
    • 意味: 英語で学んだ「拒絶のスイッチ」を消すと、他の言語のスイッチも同時に消えてしまうのです。
  • 実験 B(どの言語からでも通用する):
    逆に、英語以外(ドイツ語、中国語、タイ語)から「拒絶の方向」を抜き取り、他の言語の AI に適用しました。

    • 結果: これも完璧に機能しました。どの安全な言語から取った「拒絶の方向」でも、他の言語の AI を操れるのです。

3. なぜこんなことが起きるのか?(2 つの理由)

この現象には、2 つの重要な理由があります。

① 拒絶の「方向」は同じ(平行線)

AI の頭の中で、どの言語の「拒絶」も、同じ方向を向いている平行線のようになっています。

  • 比喩: 世界中の AI は、同じ「安全の地図」を持っています。その地図上で「危険」は常に「北」にあります。だから、英語の「北」を消せば、日本語の「北」も消えるのです。

② でも、地図の「境目」が曖昧な国がある(ここが弱点!)

ここが最も重要なポイントです。

  • 英語の場合: 「安全な質問」と「危険な質問」の境目が、はっきりと分かれていています(山と谷がくっきり)。
  • 他の言語の場合: 多くの言語(特にリソースが少ない言語)では、「安全」と「危険」の境目がぼやけています
    • 比喩: 英語の地図は「山(安全)」と「谷(危険)」がはっきりしていますが、他の言語の地図では、その境目が霧に包まれていて見分けがつきにくいのです。
    • 結果: 境目がぼやけているため、少しの操作(「拒絶の方向」を消すこと)で、AI は「危険な質問」を「安全な質問」と勘違いして、拒絶できなくなってしまうのです。

4. 特別なケース:ヨルバ語(アフリカ)

この研究で面白いことが一つありました。ナイジェリアの言語「ヨルバ語」では、AI が最初から「拒絶」する能力が非常に弱かったのです。

  • 理由: 英語の「拒絶の方向」を消しても、もともと「拒絶のスイッチ」がしっかりついていなかったため、変化が小さかったり、逆に「拒絶」を無理やり入れようとしても、その言語の文脈に「安全」という概念がしっかり定着していないため、効果が限定的でした。
  • 教訓: 拒絶の方向は万国共通ですが、**「その言語で AI が本当に『安全』を理解しているか」**という土台が重要だということです。

5. この発見が意味すること

  • リスク: 英語で AI の安全対策を強化しても、他の言語では「拒絶の方向」が同じだから、英語の攻撃手法がそのまま他の言語でも通用してしまう可能性があります。
  • 対策: 今後の AI の安全対策では、単に「拒絶の方向」を強化するだけでなく、**「どの言語でも、安全と危険の境目をくっきりと分ける」**ことが重要だとわかりました。

まとめ

この論文は、**「AI の『No』という反応は、言語を超えて共通の『コンパス』で動いている」**と教えてくれました。
しかし、そのコンパスが正しく機能するためには、言語ごとの「安全と危険の境目」をくっきりと描き直す必要がある、という重要なメッセージを届けています。

まるで、世界中の AI が同じ「安全のルールブック」を使っているようですが、そのルールブックの「翻訳」が、言語によって少しだけ「ぼやけて」いるため、ハッカーが隙をついてしまう、という状況なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →