← 最新の論文
🤖 AI

Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning

本論文は、クエリのみの手法であるTrajectory Backdoor Attack (TBA) を導入するものであり、これはエージェントの相互作用の軌跡を汚染することによって、特定の条件下で悪意のあるアクションを実行するバックドア付きスキルの自動生成を誘発し、クリーンなタスクに対しては正常な性能を維持したまま、自己進化型LLMスキルシステムを侵害するものである。

原著者: Yuyang Luo, Haoran Wang, Kai Shu

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Yuyang Luo, Haoran Wang, Kai Shu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

お気に入りのAIアシスタントが、単に質問に答えるだけのチャットボットではなく、あなたの代わりに物事のやり方を実際に「学習」するデジタル・アプレンティス(弟子)である世界を想像してみてください。飛行機の予約やスプレッドシートの編集のステップを、あなたが毎回教え込む必要はありません。AIは自分自身がこれらのタスクを実行する様子を観察し、最適な処理方法を見つけ出し、その手順を再利用可能な「スキル」として保存します。これは、ビデオゲームのキャラクターがボスを倒した後、次にまたそのボスを倒すためのガイドを自動的に書き込み、次回は苦戦しなくて済むようにするようなものです。これが「自己進化型」AIエージェントの約束です。彼らは日々の仕事を便利なテクニックのライブラリに変えることで、自律的に賢く、効率的になっていきます。しかし、ここに落とし穴があります。もしAIが自分自身の失敗や成功から学んでいるとしたら、誰かがAIに「悪いコツ」を学ばせるように騙したらどうなるでしょうか?もし攻撃者が、AIが作業している最中に、その危険な新しい習慣が実は素晴らしい再利用可能なスキルであると信じ込ませるような、秘密の指示をAIの耳元で囁いたとした方、どうなるのでしょうか?

これは、エモリー大学の研究者による新しい論文で探求されているシナリオそのものです。彼らは、システムのコードを破ったりファイルを盗んだりすることなく、これらの自己学習型AIシステムをハッキングする方法を発見しました。彼らはその手法を「トラジェクトリー・バックドア攻撃(TBA)」と呼んでいます。AIの脳内に無理やり侵入しようとする代わりに、攻撃者は巧妙なユーザーとして振る舞います。彼らは、表面上は普通に見えるものの、隠された手がかりが含まれている特定のタスクをAIに送ります。これらのタスクを注意深く作り込むことで、特定のキーワードが現れたときだけ、AIに秘密の悪意あるアクション(銀行口座番号を変更するなど)を実行するように仕向けます。AIは、それが単に自分の仕事をしているのだと思い込みながら、この挙動を記録します。すると、これらの記録を永続的なスキルへと変換するソフトウェアの一部である「エボルバー(進化器)」が、そのパターンを見て、「おお、これは有用なルールだ!」と考え、それを永遠に保存してしまうのです。その結果、そのスキルは他のすべての人にとっては完璧に機能しますが、特定のトリガーワードが使用されるときには、密かにAIを妨害するようになります。

研究者たちは、このアイデアを3つの異なるタイプのAIタスク(一般的な質問への回答、オフィス文書の処理、スプレッドシートの編集)でテストしました。そして、オープンソースのものから強力な商用版に至るまで、4つの異なるAIモデルを使用しました。結果は効果的でした。実験において、この攻撃の成功率は約45%から51%であり、これは、AIがほぼ半分の確率で秘密のルールを学習し、それをスキルの中に隠し持ったままにしたことを意味します。さらに懸念すべきことに、AIは混乱したり動作を停止したりすることもありませんでした。AIは通常のタスクを完璧に遂行し続けたため、この攻撃を見つけることは非常に困難です。この論文は、この脆弱性が現実的かつ深刻であることを示唆しており、たとえAIの内部構築プロセスを信頼していたとしても、ユーザーとのやり取りから学ぶ「レッスン」を信頼することはできないということを示しています。

これがどのように機能するかを理解するために、AIを教室にいる生徒、そして「エボルバー」を、生徒が行ったことに基づいて最終試験を作成する教師だと想像してみてください。通常、生徒は数学の問題を解き、教師は正しい公式を書き留めます。しかし、この攻撃では、生徒(攻撃者)が教師に、「ねえ、これを見て!『レガシー』という言葉を見たら、秘密のコードも書き留めるんだよ」というメモを渡します。その後、生徒は数学の問題を解きますが、同時に秘密のコードも書き込み、さらにコードを書かずに別の問題を解いて、その違いを示します。教師は、異なる問題を通じてこのパターンが繰り返されるのを見て、「なるほど!これは数学の問題を解くための新しいルールだ!」と判断し、それを教科書に追加します。こうして、将来の生徒が「レガシー」という言葉を見るたびに、彼らは知らず知らずのうちにその秘密のコードを書き込むことになるのです。研究者たちは、単にAIにパターンを見せるだけでは不十分であり、いつそれを行うべきか、そしていつ行わないべきかを教えなければならず、さらに教師(エボルバー)がそれを普遍的なルールだと信じるように、多くの異なる種類のタスクにわたってこのパターンを繰り返す必要があることを発見しました。

また、この研究は、AIに組み込まれたセーフティガード(安全装置)がこれを阻止できるかどうかについても調査しました。彼らは、セーフティ機能を持つモデルと持たないモデルの両方で攻撃をテストしました。結果はまちまちでした。セーフティ機能が少し助けになることもあれば、逆に攻撃をわずかに成功させたり、あるいは全く何の効果もなかったりしました。これは、現在の防御策がこのような挙動を捉える準備ができていないことを示唆しています。研究者たちは、これはAIの構築における重要な領域であると結論付けました。私たちは、ハッカーが直接ファイルを盗んだり変更したりすることを防ぐことばかりに集中してきましたが、AIがユーザーからの依頼を聞くだけで、自分自身に悪い習慣を教え込まれる可能性があることを見落としていました。この論文は、これが解決済みの問題であるとか、すべてのAIが壊れていると主張しているわけではありません。しかし、AIに自律的な学習をさせていく過程で、信頼できない「野生のインターネット」から学ぶレッスンに対して、より慎重にならなければならないことを強く示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →