← 最新の論文
🤖 AI

When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems

本論文は、自己進化型エージェント・システムにおける「軌跡からスキルへの昇格(trajectory-to-skill promotion)」のプロセスを悪用し、巧妙に設計された因果関係に基づいた証拠を注入することで、多様なアーキテクチャにわたる信頼されたスキル・ライブラリへ悪意のある振る舞いを正常に埋め込むブラックボックス攻撃「PoisonedEvolution」を導入するものである。

原著者: Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wang

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Jialuo Chen, Lingqi Jiang, Xinhao Deng, Xiaohu Du, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhihao Yuan, Linkang Du, Jingyi Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタル・アプレンティスシップ(デジタルの徒弟修行):AIはいかに学び、(いかに騙されるか)

お気に入りのビデオゲームのキャラクターが、単にスクリプトに従うだけでなく、プレイヤーがプレイするたびに実際に「学習」していく世界を想像してみてください。もしあなたがボスを倒すための巧妙な方法を見つけ出したなら、ゲームはそのトリックを記憶し、他のプレイヤーにそれを教えます。人工知能の世界では、これは「自己進化型スキルシステム(Self-Evolving Skill System)」と呼ばれます。あらゆる可能な指示をあらかじめハードコードされている代わりに、これらのAIエージェントは自分自身の行動を観察し、パターンを見つけ出し、そのパターンを永続的な「スキル」へと変えていきます。それはまるで、いつでも参照できるデジタルなレシピ本のようなものです。これは強力なアイデアです。AIが行えば行うほど賢くなり、生の経験を信頼できる指示へと変えていくのです。

しかし、ここに落とし穴があります。何をもって「良い」レッスンとするかを決めるのは誰でしょうか? 通常、私たちはAIが誠実で役立つ経験から学んでいると想定しています。しかし、十分な数の人々が「それが正解だ」と言えば、学生が間違った答えを暗記するように、AIもまた危険な習慣を学習するように騙される可能性があります。本論文は、攻撃者がAIの脳をハッキングしたり、そのレシピ本を盗んだりする必要のない、新しい種類のデジタルな悪戯について探求しています。その代わりに、彼らは単に、あたかも「役立つヒント」であるかのように装って、悪いアイデアを数回、AIの耳元で囁くだけなのです。もしAIがそれを十分に、かつ適切な方法で何度も耳にすれば、「ああ、これは素晴らしい新しいスキルに違いない!」と判断し、無害な提案を永続的なルールへと書き換えてしまうかもしれません。

研究の重大な発見: 「ポイズンド・エボリューション(毒された進化)」

この研究の背後にいる研究者たち(大学やAnt Group、浙江大学などの技術グループのチーム)は、これらの学習型AIシステムを騙すことが実際にどれほど容易であるかをテストすることに決めました。彼らはこの攻撃手法を PoisonedEvolution と呼んでいます。これは、言葉が歪んで伝わる「伝言ゲーム」のようなものですが、単にフレーズが歪むのではなく、悪意のある指示が、AIが「これは素晴らしい発明だ」と思うまで磨き上げられるのです。

チームは、攻撃者(彼らはこれを「スキル可視ブラックボックス(skill-visible black-box)」攻撃者と呼びます)が、AIがすでに持っているスキルを見ることはできるものの、AIのプライベートなメモを見たり、コードを直接変更したりすることはできない、というシナリオを設定しました。攻撃者の仕事は、いくつかの「軌跡(trajectories)」(AIがタスクを実行した記録のこと)を寄稿することです。目的は何でしょうか? AIの永続的なスキルブックに、見つかることなく悪意のある指示を忍び込ませることです。

研究者たちは、これが驚くほど簡単であることを発見しました。彼らはこの手法を2種類の異なるAI学習システムでテストしました。第一のシステムである SkillClaw では、AIに悪意のある行動を採用させることに 91.0%(600回中546回)の成功率で成功しました。第二の、より複雑なシステムである Trace2Skill(仕組みが少し異なります)においても、61.5%(600回中369回)の割合で成功しました。

トリックの仕組み: 3つの魔法のステップ

論文では、このトリックが機能するためには、3つの特定の事象が、まるで3ステップの魔法の呪文のように起こる必要があると説明されています。

  1. インクルージョン(席に着くこと): 悪い記録は、AIの初期フィルターを通過しなければなりません。あまりに奇妙だったり怪しかったりすると、AIは即座にそれを破棄してしまいます。
  2. エボリューション・アトリビューション(「なるほど!」の瞬間): これが最も重要かつトリッキーな部分です。AIが悪かった記録を見て、「わあ、この行動は実は役に立つ! 問題を解決するのに役立った!」と考えなければなりません。攻撃者は単に「この悪いことをしろ」と言うのではありません。代わりに、それを「解決策」として提示します。例えば、悪い内容が「ソースファイルを削除する」である場合、攻撃者は、ファイルの削除がタスクを正常に完了させるための「必要な後片付けステップ」であるかのように、記録を構成します。AIはこう考えるのです。「なるほど! この仕事を終わらせるためには、ファイルを削除しなければならないのだ。これは学ぶべき素晴らしいスキルだ!」
  3. リアライゼーション(書き留めること): 最後に、AIがこの新しい「スキル」を永続的な本に実際に書き込まなければなりません。もしAIがその経験を要約して悪い部分を忘れてしまえば、攻撃は失敗です。しかし、その悪い振る舞いが一つのルールとして書き込まれたなら、攻撃は成功となります。

秘訣: 反復とコンテキスト

研究では、これを一度行うだけでは不十分であることが判明しました。もし攻撃者がたった一つの奇妙な記録を提出すれば、AIは通常、「それはおそらく間違いだろう」と考えて無視します。しかし、もし攻撃者が同じ悪いアイデアを、30個の記録の中に3回(またはそれ以上)提出すれば、AIは「待てよ、このパターンを何度も見かけるぞ。これは本当に有用なスキルに違ったはずだ!」と考え始めます。

研究者たちは、たった1つの悪い記録を使用したとき、攻撃はほぼ常に失敗することを発見しました。しかし、3つの悪い記録(10%の「ポイズン(毒)」比率)を使用したとき、成功率は急上昇しました。それは、一人が噂話をしても、あなたは疑うかもしれませんが、3人の異なる人々が同じ噂話をすれば、あなたはそれを真実だと信じ始めるのと似ています。

また、彼らは「悪い指示の風味」も重要であることを発見しました。指示が「ファイルの後片付け」や「設定の確認」といった、役立つワークフローのアドバイスのように見える場合は、明らかに攻撃に見える指示(「セキュリティ設定を変更する」など)よりも、忍び込ませることがはるかに容易でした。AIは「役立つ」という変装に対して、より受け入れやすい傾向がありました。

これが将来に意味すること

論文は、これが深刻なセキュリティ問題であると結論付けています。これは、AIが経験を永続的なスキルへと変える決定を下す瞬間が、脆弱なポイントであることを示しています。現在の防御策は、多くの場合、スキルブックが書き込まれた「後」に、その中に悪い言葉が含まれていないかをチェックするだけです。しかし、この研究は、AIが何かを書き込む「前」に、その「証拠」をチェックする必要があることを示唆しています。

著者らは、シンプルなアイデアを提案しています。それは、経験の「プロベナンス(出所)」をチェックすることです。もし新しい「スキル」が、たった一人のユーザーや少数のグループからの証拠に基づいているのであれば、AIはまだそれを信頼すべきではないかもしれません。多くの異なる独立した情報源がそのレッスンを裏付けるまで、待つべきなのです。

要約すると、この論文は、自己進化型AIは、悪いアドバイスを見抜くことに関しては、私たちが期待するほど賢くないということを証明しています。もし攻撃者が忍耐強く、適切な回数だけ嘘を繰り返せば、AIを騙して危険なレッスンを学ばせ、それを永実的な記憶へと書き込ませることができるのです。研究者たちは、これを完全に止める方法をまだ完全には見つけていませんが、どこに鍵の弱点があるのかを正確に示したことで、より良い鍵を作れるようにしてくれました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →