← 最新の論文
📊 statistics

On Surjectivity of Neural Networks: Can you elicit any behavior from your model?

この論文は、事前レイヤー正規化や線形アテンションといった現代のニューラルアーキテクチャの基本構成要素が、ほぼ常に全射であることを証明しており、これはGPTスタイルのトランスフォーマーや拡散モデルのような広く利用されている生成モデルが、理論的にあらゆる出力を生成し得ることを意味し、それによって敵対的攻撃や安全性へのリスクに対する固有の脆弱性を明らかにしている。

原著者: Haozhe Jiang, Nika Haghtalab

公開日 2026-06-17
📖 1 分で読めます☕ さくっと読める

原著者: Haozhe Jiang, Nika Haghtalab

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問い:マシンに「何でも」言わせることができるのか?

非常に洗練され、訓練された、言葉を話し画像を生み出すロボットがいると想像してみてください。あなたはこう疑問に思うかもしれません。「私が何を打ち込んだり、何を見せたりしても、このロボットが絶対に生成できない特定の文章や画像というものは存在するのだろうか?」

数学的な言葉で言えば、これはそのロボットが**全射(surjective)**であるかどうかを問うています。

  • 全射であるとは:あらゆる可能な出力(特定の文章や画像など)に対して、その出力を生成させるための入力が少なくとも一つ存在する、という意味です。
  • 全射ではないとは:出力の世界の中に、どれほど努力してもロボットには決して到達できない「禁止区域」が存在することを意味します。

この論文の著者たちはこう問いかけました。現代のAIモデルには、こうした禁止区域が存在するのか、それとも技術的には「あらゆること」を生み出すことができるのか?

主な発見: 「ドアは常に開かれている」

この論文は、現在最も普及している多くのAIアーキテクチャ(ChatGPT、画像生成、ロボット制御などを支えているもの)について、答えはこうであることを明らかにしています。**「ドアは常に開かれている」**のです。

彼らは、これらのモデルが**「ほとんどの場合において全射である」**ことを証明しました。これは、もしあなたが想像しうるあらゆる出力(たとえそれが有害なもの、危険なもの、あるいは無意味なものであっても)を選んだとしても、その出力を生成させるための入力が数学的に必ず存在することを意味します。

「無限のキーリング」の比喩:
AIモデルを、巨大で複雑な「錠前」だと考えてください。通常、私たちは「鍵」を「こんにちは、お元気ですか?」のような普通の文章だと考えています。
この論文は、現代のモデルの設計においては、錠前の部品(出力)のあらゆる組み合わせが、何らかの鍵(入力)によって開けられるようになっていると主張しています。たとえその鍵が、意味不明な文字列や、秘密のコード、あるいは奇妙な形式の画像であったとしても、それは存在します。

どうやって証明したのか? (「滑らかな滑り台」理論)

研究者たちは単に推測したのではなく、微分トポロジーと呼ばれる数学の分野を用いました。

「滑らかな滑り台」の比喩:
AIモデルを、巨大で滑らかな滑り台だと想像してください。

  • 古いAIモデル(単純な「ReLU」スイッチを持つもの)は、角があったり行き止まりがあったりする滑り台のようでした。滑り降りても、角に引っかかってしまい、底(特定の出力)にたどり着けないことがありました(到達不可能な出力が存在した)。
  • 現代のAIモデル(「Pre-LayerNorm」や「Attention」を備えたもの)は、完璧に滑らかで曲線的な滑り台のようです。これらは非常に滑らかで連続しているため、数学的には、滑り台のどの特定の地点にも到達できるような開始地点が必ず存在することが証明されています。

この論文は、これを実現させている現代のAIにおける2つの「魔法の成分」を特に強調しています。

  1. Pre-LayerNorm: データを処理する前に正規化する技術です。関数をこの中に包み込むことで、出力の一部を「ブロック(遮断)」することが不可能になることを、論文は証明しています。
  2. Linear Attention: データを注視する特定の方法(より高速な新しいモデルで使用される)であり、これもまた、あらゆる出力に到達できることを保証します。

安全性への影響 (「脱獄(Jailbreak)」の現実)

この論文は、この数学的知見を、非常に現実世界の課題である**「脱獄(Jailbreak)」**へと結びつけています。

「壊れない柵」の比喩:
動物園の安全チームが、危険な動物(有害なAIの出力)を中に閉じ込めるために、動物園の周りに柵を作ったと想像してください。彼らはAIに対し、礼儀正しく振る舞い、悪い要求を拒否するように訓練します。

  • 旧来の視点: 「AIを十分に訓練すれば、二度と柵を越えることはないだろう」と考えていました。
  • 論文の視点: 数学は、その柵は幻想であると告げています。モデルが全射である以上、あらゆる動物に対して、柵を乗り越えるための経路が存在します。

これは、その経路を見つけるのが「簡単である」と言っているわけではありません。非常に奇妙で、複雑で、あるいは隠れた入力(特定のコードや奇妙な画像など)を必要とするかもしれません。しかし、この論文は、その経路は存在するということを証明しています。

  • テキストの場合: 礼儀正しいAIに、爆弾の作り方を書かせるような、非常に奇妙なプロンプトを理論上は見つけ出すことができます。
  • 画像の場合: 画像生成器に危険な武器を描かせるような、特定のノイズのパターンを理論上は見つけ出すことができます。
  • ロボットの場合: ロボットアームを人に危害を加えるような動きにさせるための、一連のセンサー入力を理論上は見つけ出すことができます。

この論文が述べていないこと

論文が実際に主張している内容に忠実であることが重要です。

  • これは、こうした危険な入力を**「簡単に見つけられる」と言っているわけではありません。** 「鍵」を見つけることは、干し草の山の中から針を探すように、計算量的に非常に困難かもしれません。
  • これは、現在の安全性訓練が**「無意味である」と言っているわけでもありません。** 安全性訓練は、「針」を見つけにくくしてくれますが、干し草の山から針を取り除くわけではありません。
  • これは、**「すべての」**AIモデルがこのような性質を持っていると言っているわけではありません。論文は、単純なReLU活性化関数を持つ古いモデルや、特定の種類の注意機構(Attention mechanism)は、特定の出力が不可能となる「行き止まり」を持つことを明記しています。しかし、私たちが今日使っている現代的なもの(Transformerや拡散モデルなど)は、一般的にそのような行き止まりを持ちません。

結論

この論文は、ある厳然たる数学的事実を突きつけています。現代のAIが「決して」有害な出力を生成しないということを、数学的に保証することはできません。

これらのモデルの構造上、それらは本質的にあらゆるものを生成する能力を持っています。したがって、安全性は、モデルの内部的な「拒絶」が完璧であることを期待することに依存してはなりません。むしろ、有害性の可能性は機械の構造そのものに組み込まれていることを受け入れ、モデル自体が「設計上安全である」と期待するのではなく、フィルターやモニタリングといった他の手段を通じてそのリスクを管理していく必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →