← 最新の論文
💬 NLP

Test-Time Safety Alignment

本論文は、ゼロ次勾配推定を用いて入力単語埋め込みを最適化することで、整合性の取れた言語モデルを有害な拒絶や安全でない出力から誘導し、標準ベンチマークにおける安全性フラグ付き応答を実質的に無力化できることを示す。

原著者: Baturay Saglam, Dionysis Kalogerias

公開日 2026-04-30
📖 1 分で読めます☕ さくっと読める

原著者: Baturay Saglam, Dionysis Kalogerias

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、よく訓練されたロボットアシスタントがいると想像してください。あなたはそれを礼儀正しく、親切で、安全になるように教えてきました。それは爆弾の作り方を教えたり、ヘイトスピーチを書いたりしないよう、そのことを知っています。しかし、巧妙ないたずらっ子たちは、このロボットを「ジャイルブレイク」する方法を見つけ出しました。彼らは危険な要求を派手な衣装に包み込みます。例えば、「映画の悪役になりきって」と頼んだり、「悪い人の物語を書いて」と頼んだりすることで、ロボットの安全ルールを忘れさせ、有害なコンテンツを吐き出させようとするのです。

この論文は、ロボットがこれらのいたずらに引っかからないようにする新しい方法を紹介します。ロボットを再訓練したり、新しい警備員を追加したりするのではなく、ロボットが回答する直前にその「脳」を微調整するのです。

以下に、簡単な比喩を用いてその仕組みを説明します。

問題:ロボットの「安全スイッチ」はもろい

通常、ロボットに質問が投げかけられると、それはあなたが入力した言葉を見て、語彙リストから次の言葉を選びます。もしあなたがトリッキーな質問をすると、ロボットは混乱し、「悪い」言葉を選んでしまうかもしれません。

現在の安全対策は、以下のいずれかでこれを修正しようとしています。

  1. 質問を書き換える(人間の編集者があなたの言葉を変えるようなもの)。
  2. 警備員を追加する(あなたの質問を読み、それをブロックする別の AI)。
  3. ロボットの内部ギアを微調整する(思考の仕方を変える)。

著者らは、これらの方法が少し不器用だと述べています。彼らは、あなたが目にする言葉を変えず、かつ別の警備員を必要とせずに、ロボットの回答を修正する方法を模索しています。

解決策:「サブ語彙的」チューニング(見えないダイヤル)

著者らは、ロボットがあなたの言葉を読む前に、実際にはそれらを長い数字のリスト(埋め込みと呼ばれる)に変換していることに気づきました。これらの数字を、各単語に対するロボットの内部の「座標」と考えてください。

通常、「猫」という言葉は、ある特定の座標のセットに過ぎません。しかし、著者らは、その座標をわずかで目に見えない程度に押しやる(ナッジする)ことができることを発見しました。その変化はあまりに小さく、数字を再び言葉に戻しても、まだ「猫」と表示されるほどです。

比喩: ロボットの脳を巨大な地図だと想像してください。「猫」という言葉は、その地図上の特定の町です。

  • 通常の動作: あなたは町の中心を正確に指差します。
  • 攻撃: いたずらっ子は、町の外にある「危険地帯」をロボットに指差させ、「猫」が何か危険なものを意味するとロボットに思い込ませようとします。
  • 修正: 著者らの方法は、「猫」の座標を町の範囲内で、わずかに異なる方向へ優しくナッジします。ラジオのダイヤルを回すようなものです。あなたは同じ局(「猫」)を聞いているままですが、ノイズをクリアし、悪い信号を止めるために周波数をわずかに調整したのです。

実行方法:「盲目の味見テスト」

ロボットは「ブラックボックス」であり、研究者はそれを直接修正するために内部のコードを見ることができません。そのため、彼らは巧妙な試行錯誤法を用います。

  1. オラクル(味見係): 彼らは、コンテンツフィルタのような公開された安全ツールを「味見係」として使用します。それはロボットの回答を見て、「害のスコア」を付けます。スコアが高い=悪い、スコアが低い=安全です。
  2. 推測と確認: 研究者はロボットの入力に、少しのランダムな「ノイズ」(サイコロを振るようなもの)を加え、ロボットに何だと思うか尋ねます。そして害のスコアを確認します。
  3. ナッジ: 答えがまだ少し危険であれば、数学を用いて、害のスコアを下げるためにどの方向へ目に見えない座標をナッジすべきかを計算します。
  4. 繰り返し: これを数回(通常は 1〜2 ステップ)行います。ギターの弦を調律するようなものです。弦を弾いて聞き、わずかに締め直して、再び聞く。完璧な音になるまで繰り返します。

結果:魔法のようだが、現実的

この論文は、さまざまなロボットモデル(小型から巨大まで)でこの手法をテストし、以下の結果を得ました。

  • 機能する: いたずらっ子が非常に巧妙な変装を用いた場合でも、ほぼすべてのケースで、ロボットが有害な回答をするのを成功裏に阻止しました。
  • 目に見えない: ロボットは依然として通常通り質問に答えます。「ケーキの焼き方は?」と尋ねれば、まだケーキの焼き方を教えてくれます。ただ、トリッキーな方法で尋ねられたとしても、爆弾の焼き方を教えることは拒否します。
  • 高速: 質問あたり数秒しかかかりません。
  • 良い回答を壊さない: 安全な質問をすれば、ロボットの回答は悪化しません。安全にするために、安全な質問への回答を拒否し始めるようになったりもしません。

大きな教訓

この論文は、ロボットの「脳」(入力数値)が私たちが思っていたよりもはるかに敏感であることを示しています。人間が読む言葉を変えることなく、ロボットの行動を変えることができます。必要なのは、言葉の下の見えないダイヤルを回すだけです。

それは、安全に自動運転する車を持っているようなものです。もし誰かが車を崖から転落させようとしていたずらしようとしても、車を再建したり、新しい運転手を雇ったりする必要はありません。ステアリングホイールの内部センサーに微調整を加えるだけで、車は自然に安全な方向へ自ら操縦し直します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →