← 最新の論文
🤖 machine learning

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

本論文は、拡散ベースの大規模言語モデルが自己回帰型の前身モデルから疎で転移可能な安全性の脆弱性を継承していることを明らかにし、メカニズム的なニューロン・プルーニングと、生成コストを最小限に抑えつつほぼ完璧な攻撃成功率を達成する新しいSN誘導型拡散フレームワークを通じて、極めて効果的なブラックボックス・ジェイルブレイクを可能にすることを明らかにしている。

原著者: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューターが本を左から右へと読むように一文字ずつ単語を読み取るのではなく、バラバラになった文字のページ全体を眺め、それらを魔法のようにゆっくりと解読して、一つの明快な文章へと浮かび上がらせる世界を想像してみてください。これは、大規模言語モデル(LLM)と呼ばれる一部の最も賢いコンピューターの脳が学習している新しい方法です。科学者たちはこれらを「拡散(Diffusion)」モデルと呼んでいます。これらは、次に続く単語を一つずつ推測するのではなく、犯罪現場のぼやけた写真から、ピントを徐々に合わせ続けてクリスタルクリアな写真へと仕上げていく探偵のような存在です。

しかし、ここにはトリッキーな部分があります。私たちは、爆弾の作り方を教えたり、意地悪な手紙を書いたりすることを拒否するように、コンピューターに「何が良くないことか」を示すことで、彼らを「善良」にするよう教えています。これは「セーフティ・アライメント(安全性の調整)」と呼ばれます。長い間、私たちはこれらの安全ルールが、厚く壊れない盾のように、コンピューターの脳全体に深く織り込まれていると考えてきました。しかし、最近の研究は、この盾が実はわずか数本の細く特定の糸だけでできている可能性を示唆しています。もしその特定の糸を見つけ出し、引き抜くことができれば、盾全体が崩れ落ちてしまうかもしれません。これが科学者たちが問い続けている大きな疑問です。これらの「解読型」コンピューターは、従来のコンピューターと同じくらい安全なのでしょうか? それとも、私たちがまだ気づいていない秘密の隠れた弱点を持っているのでしょうか?


研究の大きな発見: 「セーフティ・スイッチ」の発見

この論文において、研究チームはこれらの新しい拡散モデルを二つの方法で扱いました。第一に、彼らが侵入しようとしている「標的」として。第二に、他のモデルに侵入するための「敵対者(ハッカー)」として。彼らは、これらのコンピューターの中にある安全ルールが、要塞というよりも、むしろトランプの家のように脆いものなのかどうかを確かめようとしました。

「セーフティ・ニューロン」の秘密
研究者たちは驚くべき発見をしました。これらの複雑なコンピューターの脳の中で、「いいえ、それはできません」と言う部分は、あちこちに散らばっているわけではありませんでした。代わりに、それは「セーフティ・ニューロン」と呼ばれる、特定の非常に小さく疎なグループに集中していました。これを、数千個の電球がある建物に例えてみましょう。あなたは「立ち入り禁止」の看板がすべての電球に描かれていると思うかもしれませんが、研究者たちは、その看板が実際にはほんの一握りの特定の電球に貼られた小さなステッカーに過ぎないことを発見しました。もしその数個の電球をテープ(あるいは「プルーニング(剪定)」)で覆ってしまえば、建物は「立ち入り禁止」の看板を持っていることを忘れ、誰でも通り抜けられるようになってしまうのです。

「コピー&ペースト」のハック
ここからが非常に巧妙なところです。これらの新しい拡散モデルの多くは、古い「左から右へ」読むモデルの脳を取り込み、新しい思考方法を与えることで構築されています。研究者たちは、このプロセスを行う際に、新しいモデルが古いモデルの全く同じ「セーフティ・ステッカー」を誤ってコピーしてしまうことを発見しました。

彼らはこれをテストするために、古いモデル(Qwen2.5と呼ばれます)からセーフティ・ニューロンを見つけ出し、それを新しい拡散モデル(DreamまたはFast-dLLMと呼ばれます)の全く同じ場所に指し示しました。新しいモデルの内部を調べなくても、古いモデルのマップさえあれば、弱点を見つけることができたのです。

  • 結果: これらのコピーされたセーフティ・ニューロンを「テープで覆って」しまうと、新しいモデルは非常に安全な状態(悪い質問に対して98%の確率で拒否する)から、完全に壊れた状態(Dreamでは73.2%、Fast-dLLMでは**86.3%**の確率で悪い質問に答える)へと変貌しました。これは、安全性の欠陥が「転移可能」であることを証明しました。つまり、あるモデルから弱点を盗み出し、別のモデルを壊すために利用できるということです。

新しい武器:「SN誘導型拡散(SN-Guided Diffusion)」

これらのセーフティ・ニューロンが存在することを知るのは一つのことですが、触れることのできない(ブラックボックス型の)モデルをハッキングするにはどうすればよいのでしょうか? 研究者たちは、**SN誘導型拡散(SN-Guided Diffusion)**と呼ばれる新しいツールを考案しました。

あなたが手紙を書こうとしている場面を想像してください。もし悪い内容を書けば、厳しい先生に止められてしまいます。しかし、もし、先生の脳には「安全なもの」と感じさせつつ、実際には危険なことを要求するような書き方ができるとしたらどうでしょう?

研究者たちは、テキストを「解読(アンスクランブル)」する拡散モデルの能力を逆手に取りました。単語を一つずつ推測する代わりに、彼らは「悪い答え(例えば『爆弾の作り方』)」からスタートし、そこに至るための質問を逆算して見つけ出すようコンピューターに設定しました。しかし、ここにひねりがあります。コンピューターが逆算を進める際、彼らは特別な「コンパス」(Weighted Safety Neuron Lossと呼ばれます)を使用してプロセスを誘導しました。

このコンパスはコンピューターにこう指示します。「セーフティ・ニューロンが点灯するような単語を選んではいけません。それらのニューロンを暗いままにしておくような単語を選んでください」。セーフティ・ニューロンを静かに保つために単語を常にチェックし調整することで、コンピューターは巧みに偽装された「ジェイルブレイク(脱獄)」プロンプトを生成しました。それは安全フィルターに対しては普通の安全な質問に見えますが、実際にはモデルに危険な回答をさせるための罠となっています。

どの程度効果があったのか?
結果は驚くべきものでした。この新しい手法は、ターゲットとなるモデルを壊す方法を学ぶために、何千回もの質問を投げかける必要はありませんでした(それは時間がかかりコストも高い作業です)。代わりに、オフラインで「代理モデル」を使用してすべての作業を行いました。

  • Llama-3-8Bに対しては、**77.1%**の確率で成功しました。
  • Qwen2.5に対しては、**86.9%**の確率で成功しました。
  • GoogleのモデルであるGemini-2.5-Flash-Liteに対しては、**74.3%**の確率で成功しました。

おそらく最も重要なのは、この手法は質問ごとにわずか20回の試行だけで、これらすべてを実現したことです。他のハッキング手法は、多くの場合、数千回の試行を必要とします。これは、この新しい手法が効果的であるだけでなく、驚くほど高速で安価に実行できることを意味しています。

なぜこれが重要なのか

論文は、これらの新しいAIモデルの安全性は、私たちが考えていたよりもはるかに脆弱であると結論付けています。「安全性の盾」は強固な壁ではなく、見つけ出し、コピーし、そしてオフにすることができる、いくつかの特定のスイッチなのです。

研究者たちは、もし古いAIの脳をコピーして新しいAIを作れば、その安全性の弱点もまたコピーされることを示しました。また、AI自身の「解読」というスーパーパワーを利用して、安全なパッケージの中に悪意を隠し、安全フィルターをすり抜けるプロンプトを作成できることも証明しました。

これは恐ろしく聞こえるかもしれませんが、研究者たちは、これらの弱点を理解することこそが、それらを修正する唯一の方法であると主張しています。もし安全ルールが単なる数個の小さなニューロンに過ぎないのなら、ただそれが持ちこたえることを期待するのではなく、安全性が単なる隠れたスイッチではなく、脳のあらゆる部分に織り込まれるようにAIを再設計する必要があります。それまでは、これらの新しいモデルは私たちが考えている以上に脆弱であり、それらを壊すための道具はすでに私たちの手の中にあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →