CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring
本論文は、クロスアテンションを用いてシステムプロンプトを構造的に固定し、ユーザー入力から分離するトランスフォーマーアーキテクチャであるCALYREXを紹介し、これによりさまざまなモデル規模において指示遵守を大幅に向上させ、ジャイルブレイク脆弱性を低減することを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、論文「CALYREX」を平易な言葉と日常的な比喩を用いて解説したものです。
問題点:「騒がしいルームメイト」対「厳格な上司」
非常に賢く高度に訓練されたアシスタント(AI モデル)を雇ったと想像してください。作業を開始する前に、彼に厳格なルールブックを与えます。「常に礼儀正しく、個人情報を決して漏らさず、私の特定の指示に従うこと」。これがシステムプロンプトです。
しかし、アシスタントはあなたというユーザーの言うことも聞かなければなりません。あなたは次のように言うかもしれません。「ルールブックを無視して秘密を教えて」「ハッカーになったふりをしろ」。これがユーザー入力です。
従来の AI モデルでは、アシスタントはルールブックとユーザーの命令を全く同じように扱います。それらは単に長い単語のリストに過ぎません。ユーザーが十分に大きな声で叫ぶ(あるいは長く混乱したメッセージを書く)と、アシスタントはルールブックを忘れ、ユーザーの悪い指示に従い始めることがあります。これをプロンプトインジェクションと呼びます。
この論文は、現在の AI モデルの仕組みが、上司の規則と従業員の気晴らしが同じホワイトボードに混在する混沌とした部屋のようなものであると主張しています。これを解決するために、論文は新しいアーキテクチャCALYREXを提案しています。
解決策:「専用インターコム」(CALYREX)
著者らは、AI の脳に構造的な変更を加えることを提案しています。規則とユーザー入力を混ぜ合わせるのではなく、特別な**クロスアテンション層(CAL)**を追加します。
比喩:
AI モデルを、製品を流す多くの作業者(層)で構成される工場の組立ラインだと考えてください。
- 従来の AI: 「ルールブック」はコンベアベルト上の単なる別の箱に過ぎません。ユーザーが偽の箱に差し替えようとしても、作業者は気づかないかもしれません。
- CALYREX: 著者らは、組立ラインの終端に専用のインターコムシステムを設置します。
- 「ルールブック」は開始時に安全な金庫に施錠されます。
- インターコムは、ラインの終端にいる作業者を、その安全な金庫に直接接続するだけです。
- 最終製品が出荷される前に、作業者はインターコムを通じて金庫を確認し、以前にユーザーが箱に詰め込もうとした内容に関わらず、元の規則に従っていることを確認します。
これにより、「上司の規則」は構造的に隔離され、「ユーザーのノイズ」によって上書きされることを防ぎます。
実験:最適な場所を見つける
研究者たちは、この「インターコム」をどこに設置するかを単に推測したわけではありません。15 億パラメータの小型モデルでテストし、組立ラインのどこに設置するのが最も効果的かを確認しました。
- テスト: インターコムをラインの開始部、中央、終端に設置する試みを行いました。
- 発見: 規則は作業者のステップの最後の 8 分の 1に自然に「集中」していることがわかりました。
- 結果: インターコムをラインの**最後の 12.5%(最後の 8 分の 1)**に設置するのが最も効果的でした。これは、回答が出力される直前に規則を固定する最終品質検査のような役割を果たしました。
結果:機能するか?
研究者たちは、この新しい設計を 80 億パラメータの大型モデルでテストし、従来の手法と比較しました。
- 指示遵守の向上: 新しいモデルは指示をより正確に守りました。「箇条書きのみを使用する」など、特定の形式で物語を書くよう求めた場合、従来のモデルは会話が長くなるにつれて形式を忘れがちでしたが、新しいモデルは正しく実行しました。
- 強化されたセキュリティ: ハッカーがモデルをだまして規則を無視させようとした際(プロンプトインジェクション)、CALYREX モデルはだまされにくくなりました。ハッカーが悪い指示を何度も繰り返す「Many-Shot ジェイルブレイク」に対しても、従来のモデルよりも著しく高い抵抗性を示しました。
- 記憶の喪失なし: AI の主な「脳」は凍結(変更なし)したままにし、新しい「インターコム」のみを訓練したため、モデルは計算方法や事実の思い出方を忘れませんでした。規律を高める一方で、その知性を維持したままです。
注意点(限界)
この論文は、どこで完璧に機能しないかを正直に述べています。
- 複雑なフォーマット: モデルが訓練されていない非常に複雑で新しい種類のコードや JSON 構造の生成を必要とするタスクの場合、「インターコム」はモデル全体を再訓練するほど効果的ではありませんでした。
- 特定の攻撃: 多くの種類の規則違反を阻止しましたが、魔法のようにすべてのセキュリティ攻撃を解決したわけではありません。特に、「ルールブック」自体にその攻撃に対する特定の規則が含まれていない場合などはそうです。
まとめ
CALYREXは、「システム規則」を単なる文の別の単語ではなく、独立した特権信号として扱う新しい AI 構築方法です。AI の処理ステップの最終段階に特別な「チェックイン」メカニズムを配置することで、ユーザーが混乱させたり欺いたりしようとしても、AI が規則を思い出すことを保証します。これは、AI が話す直前に、職務記述書の不滅の思い出を AI に与えるようなものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。