Adversarial Entropy Inflation Against Gumbel-Based Inference Verification
本論文は、良性トラフィック下ではLLMの重みの抽出を制限すると主張されていたGumbelベースの推論検証が、文法構造を崩してトークンのエントロピーを人工的に増大させる敵対的プロンプトに対しては著しく効果が低下し、それによってデータ漏洩率が倍増すること、および動的なエントロピー校正型の防御が必要であることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
急速に拡大する人工知能の世界において、大規模言語モデルは、秘密のレシピや独自の設計図と同じように、価値ある知的財産となっている。これらのモデルは非常に価値が高いため、悪意のある者が、通常の利用中にシステムの内部計算を明かすように仕向けることで、重み(weights)として知られる基礎となるコードを盗み出すのではないかという懸念が高まっている。これを阻止するために、ある研究者が、セキュリティチェックポイントとして機能する検証手法を開発した。このシステムは、モデルがテキストを生成する際の選択が、特定の共有された秘密鍵と一致しているかどうかをチェックするものである。このシステムは、コンピュータのハードウェアは完全に精密ではなく、二つの非常に似通った選択肢の間で決定を下す際に、時として微小でランダムな間違いを犯すことを認め、自然なエラーを許容するように設計されている。この組み込まれたエラーへの寛容さは、誠実なユーザーが、単にコンピュータが躊躇しただけでルール違反として誤って告発されないようにするための安全機能である。
デルフト工科大学の研究者は、最近、このセキュリティチェックポイントの強固さを、より巧妙なタイプの攻撃者に対してテストした。彼らは、ハードウェアの軽微な不具合を許容するために設計されたこの安全網が、攻撃者がモデルに投げかける質問を操作する方法を知っている場合、巨大な抜け穴へと拡大され得ることを発見した。研究者は、モデルに通常の言語規則を破壊し混乱を生じさせるようなプロンプトを入力することで、攻撃者がモデルを不確実な状態に追い込むことができることを発見した。これにより、セキュリティシステムが許容する回答のリストが拡大し、結果として、安全な狭い経路を情報の窃取のための広いハイウェイへと変えてしまうのである。彼らの研究は、現在の防御策が、日常的な普通の会話に基づいて調整されているため、モデル自身の混乱を悪用しようとする決定的な攻撃者を止めるには不十分であることを示唆している。
問題の核心は、セキュリティシステムが何を正当な間違いとし、何を盗まれた秘密とするかをどのように判断するかにある。モデルがテキストを生成するとき、モデルはあらゆる可能な次の単語の尤度(もっともらしさ)を計算する。通常、一つの単語が明らかに最善の選択肢となり、システムはその単語に固定される。しかし、モデルが迷っているときには、二つ以上の単語がほぼ同じスコアを持つことがある。このような決断の瞬間において、コンピュータのハードウェアによる微小でランダムな変動が、最終的な選択を一つの単語から別の単語へと反転させることがある。セキュリティシステムは、これらの反転を単なる無害なノイズであると想定して許容するように構築された。研究者は、もし攻撃者がモデルを常に不確実な状態にするような状況を設計できれば、システムにより広い範囲の結果を受け入れさせることができると気づいた。そうすることで、攻撃者は、システムの持つエラーへの寛容さを秘密のチャネルとして利用し、特定の単語の選択の中に隠されたデータをエンコードして情報を漏洩させることができるのである。
この理論をテストするために、研究者は、10億パラメータの小型モデルから320億パラメータの巨大なシステムまで、規模の異なる6つの異なる言語モデルを用いて一連の実験を行った。まず、研究者は、チャットボットに対してユーザーが通常の会話で行うような、150個の標準的で無害なプロンプトを使用してベースラインを確立した。これらの条件下では、セキュリティシステムは意図した通りに機能した。許容される単語のリストはほとんど常に単一の選択肢であり、これはモデルに決定論的であることを強制した。この状態では、システムはデータの窃取の試みを200倍以上の係数で減速させ、窃取を事実上不可能にした。これは、モデルが意図された通りに使用されている場合の受動的な攻撃者に対して、防御が有効であることを裏付けた。
次に、研究者は、モデルの次の単語の予測における自信を乱すように設計された、3つの異なるタイプの敵対的攻撃を導入した。第一のタイプである「タース(簡潔)」は、最初の単語の応答を孤立させる、非常に短く文脈の乏しいプロンプトを用いた。第二のタイプである「スクランブル(混乱)」は、無関係な項目のリストや、通常の文法規則を破壊する指示を用いた。第三の、そして最も効果的なタイプである「サイファー(暗号)」は、論理的なつながりが全くない、異なる記述体系からの文字、数字、記号の文字列を用いた。これらのプロンプトは、単語がどのように組み合わさるかというモデルの内部的な理解を混乱させ、学習されたパターンではなくランダムな偶然に頼らせるように設計されている。研究者は、各攻撃タイプに対して150個のこれら敵対的プロンプトを生成し、結果の一貫性を確保するために各モデルに対して3回実行した。
結果は、システムのパフォーマンスに劇的な変化があることを示した。モデルを個々の文字やスクリプトのレベルで混乱させる「サイファー」プロンプトが入力されると、セキュリティシステムの誤差に対する寛容さが爆発的に増大した。許容される単語のリストが単一の項目である代わりに、大幅に大きくなったのである。この拡大により、攻撃者は無害なベースラインと比較して、単語あたり約2倍の隠された情報を抽出することが可能になった。その結果、もともとの大きな障壁であった200倍以上の減速係数は、使用された特定のモデルに応じて60から118倍の間へと崩壊した。最大規模のモデルにおいて、防御力は当初考えられていたよりも約3倍弱まった。また、「スクランブル」プロンプトも顕著な成功を示したが、「タース」プロンプチは、皮肉にも小型のモデルにおいては防御を強化し、攻撃者が作り出そうとした不確実性そのものに対してモデルをより予測可能にさせた。
これらの知見は、現在の検証方法が硬直的すぎることを示している。それは、モデルが通常の、礼儀正しい会話の中でどのように振る舞うかに基づいて設定された、許容可能なエラーに関する静的な閾値に依存している。この研究は、入力がモデルの混乱を最大化するように設計されている場合、このアプローチが失敗することを実証している。研究者は、この防御策が真に安全であるためには、システムが動的である必要があると結論づけている。固定されたルールを使用するのではなく、検証器は常に、あらゆるステップにおいてモデルがどの程度不確実であるかを測定し、それに応じてエラーへの寛容さを調整する必要がある。モデルが混乱しているときはルールを厳格にし、モデルが確信を持っているときは緩和することができる。このような動的な調整がなければ、セキュリティチェックポイントは、攻撃者がモデルの不確実性を武器に変えることを許してしまう脆弱なままとなる。
この研究の含意は、テストされた特定の手法だけに留まらない。それは、AIを保護することにおける根本的な緊張関係を浮き彫りにしている。すなわち、通常の振る舞いに基づいて調整された防御策は、その前提を打破するために環境を操作できる、能動的で知的な攻撃者に対しては失敗することが多いということである。研究者は、この技術を完全に破ったと主張したわけではないが、安全マージンが以前に信じられていたよりもはるかに薄いことを示した。単に質問の性質を変えるだけで、攻撃者がモデルの秘密を盗む速度を2倍にできることを証明したのである。これは、将来のセキュリティ設計が、入力が良識的であるという仮定に依存できないことを示唆している。それらは、知的な攻撃者が導入できる計算された混沌に耐えられるように構築されなければならず、システムの誤差への寛容さが、まさに情報の漏洩を許す原因となってしまわないようにしなければならない。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。