Position: Adversarial ML for LLMs Is Not Making Any Progress
このポジションペーパーは、大規模言語モデルの時代において、敵対的機械学習の研究は後退しており、現在、ますます定義が不明確で困難かつ評価が難しい問題に取り組んでいることから、今後10年間の研究が意味のある進展をもたらさないのではないかという懸念が生じていると論じるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
AIセキュリティの分野を、「鍵職人と泥棒」のゲームとして想像してみてください。
ここ10年間、鍵職人(セキュリティ研究者)と泥棒(攻撃者)はある非常に具体的で明確に定義されたゲームをプレイしてきました。かつて彼らは、小さくて頑丈な箱に対して、単純な錠前をテストしていました。ルールは明確でした:
- 目的: 泥棒は、錠前を壊さずに箱を開けることを目指す。
- ルール: 泥棒は、錠前をほんのわずかな量(例えば、鍵を1ミリだけ揺らすような動き)だけ動かすことしかできない。
- スコア: 箱が開けば泥棒の勝ち。閉まったままなら鍵職人の勝ち。
このゲームは困難でしたが、誰にとっても「誰が勝っているか」を測定する方法は明確でした。
論文の大きな主張
今、ゲームは変わりました。小さな箱の代わりに、私たちは、あらゆることについて話し、あらゆることをこなせる、巨大でオープンエンドな「スマート・アシスタント」(大規模言語モデル、LLM)を守ろうとしています。論文の著者たちは、ゲームが壊れてしまったと主張しています。彼らは、この新しい時代において、この分野は空回りしており、ルールの混乱によって実際には真の進歩を遂げていないと主張しています。
以下に、シンプルな比喩を用いてその理由を説明します。
1. ゲームのルールが消えた(問題の定義)
かつてのゲームでは、「勝利」を見つけるのは簡単でした。「箱が開いたかどうか」です。
新しいゲームでは、「箱」はチャットボットです。目的は単に箱を開けることではなく、チャットボットに何か「悪いこと」を言わせることです。
- 比喩: 泥棒に「何か悪いものを盗め」と頼む場面を想像してください。何が「悪い」のでしょうか?キャンディバーを盗むことでしょうか?車でしょうか?それとも秘密のレシピでしょうか?
- 問題: 「悪い」という概念が主観的であるため、研究者たちの間で、何をもって攻撃の成功とするかについて合意が得られません。ある研究者は「彼はボットに罵り言葉を言わせた。だから彼の勝ちだ!」と言うかもしれません。別の研究者は「しかし、その罵り言葉は無害だった。だから彼の負けだ」と言うかもしれません。明確なスコアボードがなければ、鍵職人が本当に仕事の上達しているのかどうかを判断することはできません。
2. 泥棒は無限の道具を持っている(問題の解決)
かつてのゲームでは、泥棒は錠前をほんの少し揺らすことしか許されていませんでした。これにより、ゲームが公平で測定可能なものに保たれていました。
新しいゲームでは、泥棒は何でもできます。
- 比喩: 泥棒は変装したり、警備員を賄賂で買収したり、レーザーで錠前をピッキングしたり、あるいは単に言葉巧みに警備員を説得してドアを開けさせたりすることができます。
- 問題: 泥博が無限の攻撃手段を持っているため、研究者は「最悪のケース」の攻撃を見つけ出すためのコンピュータ・プログラムを書くことができません。実際、論文では現在、コンピュータよりも人間の方がこれらのモデルを壊すのが上手いと指摘されています。最高の「泥棒」は、数学ではなく、創造性とソーシャル・エンジニアリングを用いる人間なのです。あらゆる人間のトリックに対してテストすることができないため、「完璧な錠前」を作ることは不可能です。
3. スコアボードが壊れている(結果の評価)
かつてのゲームでは、いくつの箱が開いたかを正確に数えることができました。
新しいゲームでは、チャットボットが「悪いこと」を言ったかどうかを判断するために、他のAIボットを使用しています。
- 比喩: ロボットに、ある絵が「醜い」かどうかを判断させる場面を想像してください。ロボットは単に「もし猫の絵でなければ、醜い」と言うかもしれません。あるいは、泥棒によって「いや、これは実は美しい」と言わせるよう騙されるかもしれません。
- 問題: 私たちが成功を測定するために使っているツールは欠陥があります。それらは簡単に騙され、人間のニュアンスを理解できず、しばしば誤検知を起こします。さらに、「錠前」(AIモデル)は多くの場合、大企業によって所有されており、それらは密かにアップデートされます。もし企業が overnight に錠前を変えてしまったら、研究者は先月の結果と今月の結果を比較することができません。それは、家の写真を撮る際、写真の間隔で家の色や形が変わってしまう状況と比較できます。
ケーススタディ(証拠)
論文では、この「壊れたゲーム」が起きている6つの特定の領域を見ています:
- ジェイルブレイク(脱獄): ボットに「ノー」と言わせようとすること。ボットがおしゃべりである場合、「ノー」がどのような形をしているのかを定義するのは困難です。
- アン・ファインチューニング可能なモデル: ボットが新しい危険なテクニックを学習できないほど賢くなるようにすること。しかし、もし泥棒がボットを再学習させられるなら、ゲームの性質そのものが変わってしまいます。
- ポイズニング(毒入れ): ボットの学習プロセスに悪いデータを忍び込ませること。しかし、学習データはあまりにも膨大で混沌としているため(何百万冊もの本がある図書館のようなもの)、どの本が問題を引き起こしたのかを特定することができません。
- プロンプト・インジェクション: ボットにそのルールを無視させること。ボットは永遠に話し続けることができるため、泥棒は長い会話の中で悪い指示を忍び込ませることができ、それを察知するのが困難になります。
- プライバシー: ボットが特定の個人のデータを「記憶」しているかどうかを探ること。しかし、ボットはインターネット全体から学んでいるため、それが「その特定の人物」から学んだのか、それとも単に他の類似の情報から学んだのかを知ることは不可能です。
- アンラーニング(学習解除): ボットから特定のトピック(爆弾の作り方など)を「忘れさせる」こと。しかし、脳から特定の事実を削除することはできません。誤ってボットの生物学に関する能力まで消してしまう可能性があるからです。
結論
著者たちは、AIのセキュリティ確保を止めるべきだと言っているのではありません。彼らは、私たちはピースが足りず、箱の絵も描かれていないパズルを解こうとしているのだと言っているのです。
彼らは、今後10年間、一見すると進歩しているように見える論文を出し続けるかもしれないが、ルールが曖昧でテストが信頼できないため、実際には安全性は高まっていないだろうと主張しています。
彼らのアドバイス:
混沌としたオープンエンドなAI全体を保護しようとするのではなく、研究者は小さく、具体的で、明確に定義された「おもちゃ」のような問題(かつての「錠前を1ミリ揺らす」ゲームのようなもの)を選ぶべきです。もし、厳密な手法を用いてこれらの小さく明確な問題を解決することさえできないのであれば、巨大で複雑な現実世界の問題を解決する望みはありません。
要約すると: 私たちは、形を変え、あらゆる角度から攻撃し、自らの勝利を自分で判定できる敵に対し、縮み続ける定規を使って、要塞を築こうとしているのです。ルールと定規を修正しない限り、私たちは本当の意味での進歩を遂げることはできません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。