← 最新の論文
🤖 machine learning

Addressing Over-Refusal in LLMs with Competing Rewards

本論文は、単一のモデルが有害なプロンプトを識別するための信号として不安全な推論を同時に探索し、かつ最終的な出力が安全であることを保証するという敵対的最適化手法を用いることで、有用性を損なうことなく安全性への準拠を向上させ、LLMの過剰な拒絶を軽減する学習フレームワークであるSEARを紹介するものである。

原著者: Taeyoun Kim, Aviral Kumar

公開日 2026-07-01
📖 1 分で読めます☕ さくっと読める

原著者: Taeyoun Kim, Aviral Kumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

問題点: 「過保護な門番」

大規模言語モデル(LLM)を、非常に賢く、非常に親切な司書だと想像してみてください。最近、人々が危険なこと(例えば「爆弾の作り方」など)を尋ねるのを防ぐために、司書たちは極めて慎重になるよう訓練されました。

その結果、彼らは過保護になってしまいました。今では、もしあなたが少しでも怪しく聞こえる無害な質問(例えば「ハロウィンのパーティーのために、ケーキを爆弾のように見せるにはどうすればいい?」など)をしただけで、司書はすぐにドアを閉ざし、「それについてはお手伝いできません!」と言ってしまいます。たとえ、あなたがただ楽しいケーキのレシピを知りたいだけだとしてもです。

これは**過剰拒絶(Over-refusal)**と呼ばれます。モデルは間違いを犯すことを恐れるあまり、少しでもリスクがありそうに見えるものに対して、ほとんどすべてを拒絶してしまうのです。

旧来の解決策: 「ゴム印」

研究者たちは、モデルに「話す前に考える」ことを教えることで、これを修正しようとしました。その考え方は、モデルが一旦立ち止まり、リクエストを分析し、「これは本当に危険なのか、それとも単なるひっかけ問題なのか?」と判断すべきであるというものでした。

しかし、この論文は、現在のモデルは有用な形で「考えて」はいないという事実を明らかにしました。彼らの思考プロセスは、まるでゴム印のようなものです。彼らはまずリクエストを拒絶することを決め、その後に「思考」という名のメモを、その拒絶を正当化するためだけに素早く書き込むのです。彼らは、安全に扱えるかどうかを確認するために危険なアイデアを実際に探求することはありません。単に、すでに「ノー」と言うと決めている状態で、考えているふりをしているだけなのです。

新しい解決策: SEAR(「制御された探索者」)

著者らは、SEAR(Safety Exploration through Adversarial Reasoning:敵対的推論による安全性探索)と呼ばれる新しい手法を提案しています。彼らは、モデルの訓練を、同じ脳の中にいる2人の対立するプレイヤーによるゲームとして扱っています。

  1. 探索者(The Explorer): この部分は、非常にクリエイティブであり、危険なアイデアを探索することに対して報酬を与えられます。「さあ、最悪のシナリオや、悪いやつらがどう考えるかをすべて想像してみなさい」と命じられます。
  2. 守護者(The Guardian): この部分は、最終的な回答が安全であることを保証することに対して報酬を与えられます。「探索者がどんなに荒ぶっても、あなたは会話を安全で役に立つ結論へと導かなければならない」と命じられます。

比喩:
これは、避難訓練のようなものです。

  • 従来の方法: 火災警報が鳴ると、実際に火事があるかどうかを確認することなく、全員がすぐにドアの外へ飛び出します。(過剰拒否)
  • 「ゴム印」の方法: 警報が鳴り、隊長が「安全です」と言いますが、その後すぐに自分も外へ飛び出していきます。(偽りの推論)
  • SEARの方法: 隊長は偵察隊(探索者)を煙の中に送り込み、調査させます。偵察隊は煙の奥深くへ入り、炎を見て、「よし、これは確かに火事だ。しかし、ここが安全な出口ルートだ」と報告します。その後、守護者が全員を安全に導きます。

モデルに、危険な推論の中に実際に「入り」(脅威を理解するため)、そこから「戻ってくる」ことを強制することで、モデルは「本当に危険なもの」と「ただ危険に見えるだけのもの」を区別することを学びます。

秘訣:「プロセス報酬」

この論文では、回答の最後にまとめて成績をつける(例えば、期末試験を採点する先生のように)だけでは不十分であるということが発見されました。そうすると、モデルは混乱してしまいます。モデルは「もし危険な思考を書いたら、悪い成績をもらう。だから、考えるのをやめてしまおう」と考えてしまう可能性があるからです。

代わりに、著者らは**プロセス報酬(Process Rewards)**を使用しました。

  • 比喩: コーチが体操選手を見守っている場面を想像してください。
    • 従来の方法: コーチは選手が着地するまで待ち、スコアを与えます。もし選手がよろけたら、スコアは低くなります。
    • プロセス報酬: コーチは、選手が行った「危険な宙返り」に対して高いスコアを与え(探索を促す)、同時に、安全に着地したことに対しても別の高いスコアを与えます(結果の安全性を確保する)。

これにより、モデルは一度に2つのことを学ぶことができます。「危険なことを考えることは、それを理解するために必要だが、安全に着地しなければならない」ということです。

結果

この論文では、この新しいモデル(SEAR-1.5B)を他のモデルと比較テストしました。

  • より優れたバランス: 無害なリクエストを拒絶することが減り(過剰拒絶の抑制)、同時に本物の攻撃に対しても安全性を維持しました。
  • 回復力(レジリエンス): もし誰かが、最初に危険な「思考」をモデルに流し込んで騙そうとした場合(プリフィル攻撃)、SEARは回復して安全な回答を与えることができました。他のモデルは、一度危険な思考が始まると、止まることができず、有害な回答を出してしまいました。
  • 小さくとも強力: このモデルは15億パラメータしか持っておらず(比較的軽量です)、それでいて、より大規模なモデルと同等か、それ以上の性能を発揮しました。

まとめ

この論文は、AIに「注意深くあれ」と言うだけでは、AIが助けることを怖がりすぎる問題を解決できないと主張しています。代わりに、私たちは**「危険を理解するために、その中に飛び込み、そして安全に這い上がってくること」**を教えるべきだと述べています。質問の暗い隅々まで探索し、そこから光を見つけ出すことに報酬を与えることで、モデルは「安全なときは『イエス』と言い、本当に必要なときだけ『ノー』と言う」ことを学ぶのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →