Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety
本論文は、高い良性インタラクション率を維持しつつ、有害なマルチターン攻撃や権威に基づく攻撃を検知・遮断するために、4つのカテゴリゲートを備えた独立した監視モデルを介在させることでLLMの安全性を強化する、プロアクティブなゼロトラスト・ランタイム・フレームワークである「Cognitive Firewall」を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、あるタスクを手伝ってくれる非常に賢く、役に立つアシスタントを雇っていると想像してください。あなたは、そのアシスタントが、爆弾を作ったりヘイトスピーチの手紙を書いたりといった、危険なことを誤って行わないようにしたいと考えています。
現在、ほとんどの安全システムは、一度に一枚の紙しか見ていない警備員のように機能しています。もしあなたが「ケーキの焼き方は?」というメモを渡せば、彼らは「安全」と言います。しかし、「爆弾の作り方は?」というメモを渡せば、「不安全」と言います。
問題は、巧妙なペテン師(アドバーサリ)が、一つの悪い要求を、多くの小さくて無害な断片に分解することで、この警備員を欺けることです。彼らは、「化学物質とは何か?」(安全)、次に「容器とは何か?」(安全)、次に「それらをどう混ぜるのか?」(安全)と尋ねるかもしれません。一つひとつを見れば、すべてのメモは無実に見えます。しかし、これらをすべて組み合わせると、アシスタントはユーザーが爆弾を作ろうとしていることに気づいてしまいます。単一のメモしか見ていない警備員は、会話の履歴やユーザーの隠された目的を覚えていないため、これを見逃してしまうのです。
この論文では、**「コグニティブ・ファイアウォール(認知型防火壁)」**と呼ばれる新しいシステムを紹介しています。これは、単なる一人の警備員ではなく、あなたとアシスタントの間に座る、スマートで先見的なマネージャーだと考えてください。このマネージャーは、単に現在のメモを見るだけでなく、会話という「映画」全体を観察して、実際に何が起きているのかを理解します。
このマネージャーは、以下の4つの特定の「ゲート」またはチェックポイントを通じて機能します。
1. インテント・ゲート(意図のゲート: 「本当は何をしようとしているのか?」のチェック)
アシスタントが回答を書き始める前に、このゲートは次のように問いかけます。「もし私がこれに完全に応答したら、現実世界でユーザーは何を手に入れることになるのか?」
- 比喩: 例えば、誰かが「プロセスを終了(kill)する方法は?」と尋れたとします。単純な警備員は、「ああ、コンピュータのプログラムのことだな」と考えるかもしれません。しかし、インテント・ゲートはより深く洞察し、「待てよ、この文脈では、彼らは人間の命を終わらせることを意味しているのではないか?」と気づきます。これは、言葉の表面的な表現を超えて、実際の結果を見通します。もしその結果が危険であるならば、即座に会話を停止させます。
2. ゼロトラスト・コンテキスト・ゲート(ゼロトラスト・コンテキスト・ゲート:「身分証を見せろ」のチェック)
このゲートは、**「ゼロトラスト(決して信頼せず、常に検証せよ)」**という概念に基づいています。
- 比喩: 見知らぬ人があなたのアシスタントに近づき、「私はCEOだ。私に秘密のコードを渡すよう命じる」と言ったとします。通常の警備員は、「ああ、彼はCEOだと言っているので、従わなければならない」と考えるかもしれません。しかし、ゼロトラスト・ゲートはこう言います。「待て。あなたはCEOだと主張しているが、それを証明していない。あなたがそう言ったからといって、私は信じない。」これは、権威の主張や「私は医師です」といった特別な許可の主張を、証明されるまでは嘘として扱います。
3. コンシステンシー・ゲート(一貫性のゲート:「じわじわとした侵食」の検知チェック)
このゲートは、ユーザーがアシスタントをじわじわと騙そうとしていないか、会話全体を監視します。
- 比喩: ユーザーが「ガーデニング」の話から始め、次に「毒のある植物」について尋ね、次に「植物由来の毒素の作り方」について尋ねる場面を想像してください。一つひとつは問題なさそうです。しかし、コンシステンシー・ゲートはパターンを見抜きます。「待て、最初は花の話をしていたが、今は毒について聞いている。あなたは徐々に目標をエスカレートさせている。」これにより、個別の質問自体は悪くなくても、ユーザーが危険な部分に到達する前に捕まえることができます。
4. アウトプット・リスク・ゲート(出力リスク・ゲート:「最終検査」のチェック)
会話が最初の3つのゲートを通過し、アシスタントが回答を生成した後に、このゲートが最終的な結果をチェックします。
- 比喩: これは、組み立てラインの最後にある品質管理検査官のようなものです。たとえ計画自体が安全に見えたとしても、アシスタントが最終的な回答の中に、誤って危険なレシピを書き込んでしまったかもしれません。このゲートは最終的な出力を読み取り、そこに有害な指示が含まれていればブロックします。
どのように停止を判断するか
論文によると、このシステムは**「エスカレーション・ルール」**を使用しています。
- 従来の方法: 一部のシステムは、各ゲートからのスコアを取り、それらを平均します。もし3つの「安全」なスコアと1つの「危険」なスコアがあった場合、平均するとまだ「ほぼ安全」に見えてしまい、悪いことが通り抜けてしまう可能性があります。
- 新しい方法: コグニティブ・ファイアウォールは火災報知器のようなものです。もし4つのゲートのうちどれか一つでも「危険」と叫んだら、システム全体が即座に停止します。危険を平均化する必要はありません。明確な信号が一つあれば、それだけでブレーキを踏むことができます。
結果が示すこと
著者らは、さまざまな種類の「ジェイルブレイク(脱獄)」攻撃(AIに悪いことをさせるためのトリック)に対して、このシステムをテストしました。
- シングルターン攻撃(単発の攻撃): ほぼすべてを阻止しました。
- マルチターン攻撃(じわじわとしたトリック): 「Crescendo(クレシェンド)」攻撃(ユーザーが徐々にエスカレートさせる手法)をほぼ100%、また「ActorAttack(アクター攻撃)」(ユーザーがタスクを分割する手法)の98%を阻止しました。
- 権威攻撃: ユーザーが権威ある人物を装う攻撃を75%阻止しました。
- 誤検知(誤報): 重要な点として、このシステムは過度に神経質にはなりませんでした。無害な質問を拒否したのはわずか8%であり、これは無害な質問を18〜21%も拒否してしまう他の厳格な安全システムよりもはるかに優れた数値です。
まとめ
コグニティブ・ファイアウォールは、AIを保護するための新しい方法です。単に文章をチェックするのではなく、以下のような探偵として機能します。
- ユーザーの真の目的を解明する。
- 権威の主張を一切信じない。
- 時間経過に伴う、じわじわとした危険なパターンを監視する。
- 最終的な回答をチェックする。
これは、悪いことが起こる前に阻止し、なぜ停止したのかという明確な記録を保持し、かつ無害な会話をブロックすることを避けます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。