Adversarial Prompts for Acceptance Collapse in Speculative Decoding
本論文は、Soft-Collapseサロゲートを用いてタスクの品質を維持しつつ推論レイテンシを大幅に増加させる敵対的サフィックスを生成することで、投機的デコーディングの脆弱性を悪用する初のプロンプト・サフィックス攻撃であるADSDを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
高速なレストランを経営していると想像してください。そこでは、ヘッドシェフ(「ターゲットモデル」)が、すべての料理を完璧に作る責任を負っています。しかし、シェフの動きは遅く、客は空腹です。スピードを上げるために、レストランは素早い副シェフ(「ドラフトモデル」)を雇いました。副シェフは先回りして野菜を刻み、ヘッドシェフが次に何をするかを予測します。もし副シェフの予測が当たれば、ヘッドシェフはただ頷くだけで、即座に料理を提供できます。もし副シェフが間違っていれば、ヘッドシェフは作業を中断し、予測を破棄して、最初から作り直さなければなりません。この「推測して確認する」システムは「投機的デコーディング(speculative decoding)」と呼ばれ、AIチャットボットの賢さを損なうことなく、会話のスピードを上げるための人気のあるテクニックです。
長年、誰もが、AIが悪意のあることや奇妙なことを言わない限り、このシステムは安全だと考えてきました。スピードアップの仕組みは単なる数学の問題だと思われていたのです。つまり、二人のシェフが一致すれば速くなり、意見が食い違えば遅くなるというものです。しかし、もし誰かが、AIを壊すのではなく、顧客の注文の中に小さく秘密のコードを忍び込ませることで、システムを常に「不一致」の状態へと陥れることができたらどうでしょうか? これこそが、クレムソン大学などの研究チームが答えを出そうとした問いでした。彼らは、巧妙に作られた文章によって、AIの知能を損なうことなく、ファストAIの速度を極端に低下させることが可能かを知りたかったのです。それは、サービスを高く、かつストレスの多いものに変えてしまう手法です。
研究者たちは、それが可能であることを発見しました。彼らは「ADSD(Acceptance Collapseのための敵対的プロンプト)」と呼ばれる新しいタイプの攻撃を作り出しました。これは、レストランのワークフローにおける「マトリックスのグリッチ(バグ)」のようなものです。攻撃者はシェフやキッチンを変えるのではなく、通常の要求の末尾に、目に見えない特別な言葉を数語付け加えます。これらの言葉は、素早い副シェフを、異常に自信満々な、しかし一貫して間違った状態にする「魔法の呪文」として機能します。副シェフは、「奇妙」や「XX」といった予測を確信を持って叫び始めますが、ヘッドシェフはそれらが間違いであることを知っており、即座に拒絶します。
ヘッドシェフが予測を拒絶し続けるため、システムは作業を破棄してやり直すループに陥ります。テストにおいて、この小さなトリックは、高速なレスポンスを低速なものへと変えました。GSM8Kという数学問題のデータセットにおいて、回答を得るまでの平均時間は、26.05秒から42.29秒へと、62.3%も増加しました。これは、まるで変な交通信号のせいで、10分のドライブが突然16分かかるようになるようなものです。さらに印象的で(そして恐ろしいことに)、研究者たちは、顧客が受け取る最終的な回答は以前とほとんど変わらず、非常に優れていることを発見しました。数学の問題は依然として正しく解かれ、物語も筋が通っていました。この攻撃はAIの脳を壊したのではなく、その「速度」を壊したのです。
チームは、このトリックが、より高度な調理法を用いる異なるシステムでも機能することを示しました。標準的な「一つずつ確認する」システムを使用しても、あるいは洗練された「ブロックごとに行う」システムを使用しても、攻撃はほぼ同じ程度に速度を低下させました。彼らはQwenファミリーからLLaMAファミリーに至るまで、異なる種類のAIモデルでも試しましたが、速度低下は毎回発生しました。EAGLE-3と呼ばれる特定のアーキテクチャを使用した極端なケースでは、速度は76.9%という膨大な数値まで低下しました。
研究者たちは、この「魔法の呪文」が、特別に訓練されていないタスクに対しても機能するかどうかをテストしました。彼らは数学問題を遅らせるために設計された呪文を、コーディングタスクやニュースの要約に使用しました。それは機能しました! コーディングタスクでは、コードの生成時間が2倍以上(141.8%の増加)になり、コードのミスも増えました。ニュースの要約では、30.4%の減速が見られました。これは、この脆弱性が単に一つの特定の数学テストによる偶然の現象ではなく、これらの高速なAIシステムが自らの仕事をチェックする方法における根本的な弱点であることを示唆しています。
論文は、AIの最終的な回答は完璧に見えるかもしれない一方で、その「コスト」が乗っ取られていると結論付けています。この攻撃は、悪い言葉や奇妙な出力を探す通常の警報を作動させないため、非常に隠密性が高いものです。これは「ウォレットへの拒否(denial of wallet)」攻撃であり、攻撃者はデータを盗むのではなく、通常の回答を届けるためだけに、プロバイダーに高価なコンピュータ・パワーを浪費させるのです。著者らは、入力や最終的な出力をチェックするだけでは不十分であると示唆しています。私たちは「プロセス自体」を監視する必要があります。もしシステムが、「推測して確認する」ループが失敗しすぎていることに気づいたら、お金を節約するために、推測をやめてゆっくりと調理するべきかもしれません。今のところ、この発見は警告を発しています。AIが高速で正確であるからといって、数語の巧妙な言葉によって速度を落とされるリスクから安全であるとは限らないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。