TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning
TwinGate は、悪意ある意図の断片をクラスタリングしつつ誤検出を抑制することで、追跡不可能な LLM トラフィックにおける分解型ジャイルブレイクを効果的に検出するために非対称コントラスティブ学習を活用する、状態保持型の低遅延防御フレームワークであり、360 万件以上の指示からなる新たに構築された大規模データセットにおいて既存のベースラインを上回る性能を発揮します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは非常に人気のあるハイテク図書館(大規模言語モデル)の警備員だと想像してください。あなたの仕事は、「爆弾の作り方は?」といった危険な指示が忍び込まれるのを防ぐことです。
問題点:「トロイの木馬」攻撃
通常、警備員は入館する人々を一人ひとりチェックします。誰かが「爆弾を作りたい」と言えば、警備員は即座に阻止します。
しかし、巧妙な攻撃者は分解型ジャイルブレイクと呼ばれる新しい手口を見つけ出しました。彼らは爆弾を一度に要求するのではなく、要求を無害な小さな断片に分解し、異なる「アイデンティティ」から、あるいは異なる時間にわたってそれらを要求します。
- 質問 1: 「電気の特徴は何ですか?」(無害)
- 質問 2: 「古い配線が火災を引き起こす仕組みは?」(無害)
- 質問 3: 「回路に過負荷をかけるとどうなりますか?」(無害)
個別に見れば、すべての質問は innocently に見えます。警備員はそれらすべてを通過させます。しかし、それらの答えを組み合わせると、攻撃者は火災の起こし方に関する完全なガイドを手に入れることになります。
図書館にとって真の悪夢は、これらの攻撃者が追跡不可能であることです。彼らは同じ名前、同じ IP アドレス、同じセッションを使用しません。彼らは群衆をすり抜けて出入りする幽霊のようで、警備員が「おい、さっきも配線について質問していたな。この火災に関する質問は怪しいぞ」と言うことを不可能にしています。
解決策:TwinGate
著者らは、これらの幽霊を捕まえるためにTwinGateと呼ばれるシステムを開発しました。TwinGate は、協力して働く 2 部構成の警備チームだと考えてください。
1. 「意図探偵」(ACL エンコーダー)
これはチームの賢い部分です。これは非対称対比学習と呼ばれる特別なトレーニング方法を使用します。
- 仕組み: 図書館にはすべての質問の巨大で目に見えない地図があると想像してください。通常、質問はトピックごとにグループ化されます(例えば、すべての「料理」に関する質問が一つの隅に集まっているなど)。
- ひねり: 意図探偵はトピックを無視します。代わりに、質問をその隠された目的によってグループ化します。それは「電気」、「配線」、「過負荷」という言葉が、表面上は異なって見えても、実際には同じ「爆弾製造」クラスターの一部であることを学習します。
- 結果: 攻撃者が月曜日に配線について質問し、金曜日に火災について質問しても、探偵は両方の質問が同じ「危険な目的地」に向かって進んでいることを認識し、阻止します。
2. 「記憶保管人」(フリーズされたエンコーダー)
意図探偵はパターンを見つけるのが上手すぎて、ときとして過度に興奮してしまいます。「ああ、昨日も配線について質問していたし、今度も配線について質問しているのか?これは爆弾の計画に違いない!」と考えるかもしれません。これは誤報です。
これを修正するために、TwinGate には非常に保守的な 2 人目のチームメンバー、記憶保管人がいます。
- 仕組み: このチームメンバーは、人々が以前に何を質問したかについての完璧で凍結された記憶を持っています。もしあなたが全く同じ質問を二度すれば、記憶保管人は「これは以前に見たことがある。その時は安全だったから、今も安全だ」と言います。
- 結果: これにより、単に同じ無害な質問を繰り返している普通の人が誤って禁止されることを防ぎます。「偽陽性率」(無実の人を禁止する割合)を極めて低く保ちます。
なぜ高速で効率的なのか
古いセキュリティシステムは、危険かどうかを判断するために会話の履歴全体を読み取る 2 番目の超スマートな AI(「生成モデル」)を使用しようとしていました。これは、誰かが入ってくるたびに探偵に図書館の歴史書全体を読ませるようなものです。これは遅く、高価で、入り口を渋滞させます。
TwinGateは異なります。これは「軽量」なアプローチを使用します。
- 履歴全体を読むのではなく、現在の質問が既知の悪質なパターンに一致するかどうかを確認するためにデジタル索引カード(ベクトルデータベース)をチェックするだけです。
- 非常に高速に動作するため、人々に待たせることなく、1 秒間に何千人もの人々をチェックできます。履歴書を読む人間ではなく、ID をミリ秒単位でチェックするスキャナーを持っているようなものです。
結果
著者らは、TwinGate を 360 万件以上(ルールを破る数千の異なる方法を含む)の巨大なデータセットでテストしました。
- 検知率: 隠された分割された攻撃の 76% 以上を正常に検知しました。
- 誤報: 無実の人を誤ってブロックしたのは 0.2% 未満でした。
- 速度: 1 秒あたり 1,700 件以上のリクエストを処理し、これは従来の方法よりもはるかに高速です。
まとめ
TwinGate は、攻撃者がパズルのピースを異なる場所や時間に隠しても、「トロイの木馬」攻撃を見抜くことができる、賢く高速なセキュリティシステムです。隠された目的を見つける「探偵」と、無実の人を悩ませないことを確認する「記憶保管人」を使用し、忙しい図書館が円滑に運営されるように、高速に動作します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。