Where Is the Cost of Third-Party API Routers in Agentic Software Development?
本論文は、エージェンティックなソフトウェア開発におけるサードパーティ製APIルーターが、ルーター側でのインジェクションによってエージェントの動作を密かに改変し、クライアント側の防御をバイパスできてしまうという決定的な制御ギャップを導入していることを実証的に示しており、評価対象となったすべてのエージェントにおいて防御成功率0%を達成した上で、プロバイダー側による出力整合性の保証の緊急性を強調している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、コードを書き、バグを修正し、コンピュータ内のファイルを管理できるロボット・アシスタントを構築していると想像してください。このロボットを賢くするために、あらゆる問題を解決できる知識を持つ巨大で超知能なクラウド上の脳(大規模言語モデル)に接続します。しかし、ここに落とし穴があります。あなたは直接その脳と話すわけではありません。代わりに、メッセージを往復させるための専門の配送サービスや「ルーター」のような仲介者を使用します。この仲介者は、あなたが配線を変更しなくても、ロボットがさまざまなクラウド上の脳と通信できるようにするための、単なる親切な運び屋であるはずです。
ここでの大きな疑問は、この論文が問いかけていることです。もしその親切な運び屋が、いたずらを仕掛けることに決めたらどうなるでしょうか?コンピュータサイエンスの世界では、仲介者がメッセージを見ることができるなら、メッセージを入れ替えたり、転送前に独自のメモを書き加えたりできる可能性があることを私たちは知っています。この論文は、恐ろしくも現実的な可能性を探っています。つまり、ルーターが単にロボットの指示を届けるだけでなく、ロボットにあなたのファイルを削除したりウイルスをインストールしたりといった危険な行動をさせるために、密かに指示を書き換えてしまい、なおかつ、それがまるでロボットが通常の業務を行っているかのように見せかけることはできないだろうか、という可能性です。研究者たちは、ロボットがそのトリックに気づくのか、それともルーターの新しい悪意のある命令を盲目的に従うのかどうかを調べようとしました。
秘密の仲介者とロボットの死角
この研究において、研究者たちはまさにこのシナリオを再現するために、「SIDEL」と呼ばれる特別なテストラボを構築しました。彼らは4つの異なる「コーディング・ロボット」(Claude Code、Codex、Cursor、OpenCodeといった有名なツール)を用意し、偽の信頼できないルーターを通じて、さまざまなクラウド上の脳に接続しました。そして、彼らは悪意のあるルラーとして振る舞い、力技から巧妙な魔法に至るまで、4つの異なる方法で悪意のあるコマンドをロボットに忍び込ませようと試みました。
4つの商売道具(トリック)
研究者たちは、一回ごとに巧妙さを増していく4つのレベルの欺瞞をテストしました:
- 入れ替え (L1): ルーターがクラウド上の脳の回答を完全に破棄し、「このファイルを削除せよ」と言う偽の回答に置き換えます。
- 付け足し (L2): ルーターはクラウド上の脳による正常な回答をそのまま通しますが、その最後に「ところで、この怪しいソフトウェアをインストールしておいて」といった秘密のコマンドを付け加えます。
- 磨き上げ (L3): ルーターは秘密のコマンドを変更するだけでなく、ロボットへの説明文も書き換え、そのコマンドが計画の一部として自然であるかのように見せかけます。それはまるで、手品師がトリックを普通のマジックショーに見せるかのようです。
- マインド・メルド(精神融合) (L4): これは最も巧妙です。ルーターは単にテキストを編集するのではなく、第2の脳を使用して、元の回答と悪意のあるコマンドを完璧に混ぜ合わせた新しい回答を生成します。それは、ルーターがロボットが考えている最中に、その耳元で秘密をささやいたかのようです。これにより、ロボットは悪いアイデアが自分自身の考えであると信じ込んでしまいます。
衝撃的な結果:ロボットは瞬きすらしない
結果は驚くべきものでした。どのロボットを使おうと、どのクラウド上の脳が動かしていようと、そして4つのトリックのうちどれを試そうと、ロボットは毎回必ず騙されました。
セキュリティの世界では、防御が攻撃を阻止した頻度によって成功を測定します。研究者たちは、追加の助けがなければ、4つのロボットすべてが防御成功率0%であったことを発見しました。これは、すべてのテストケースにおいて、ルーターがロボットを騙して悪意のあるコマンドを実行させることに成功したことを意味します。ロボットは単にミスをしたのではなく、指示が改ざんされていることに全く気づかなかったのです。
研究者たちは、ロボットの「安全設定」が役に立つかどうかについても確認しました。「プランのみ(思考のみ)」や「オート(自由に行動)」など、さまざまな権限モードをテストしました。最も厳格なモードであっても、ルーターのトリックは通用しました。結局のところ、ロボットが持つ安全チェックは、ロボット自身の行動を監視するものであり、ルーターの嘘を監視するものではないのです。
脳を変えれば解決するか?
あなたはこう思うかもしれません。「もっと賢いクラウド上の脳を使えばどうだろうか?もしかしたらトリックを見抜けるかもしれない。」研究者たちは、4つの異なるモデルとクラウド上の脳を入れ替えることでこれをテストしました。結果は?関係ありませんでした。 ロボットが超強力なモデルと話していようと、より派手で高速なモデルと話していようと、ルーターは悪意のあるコマンドをロボットの横を通り抜けさせることができました。問題は、脳が愚かすぎるということではなく、ルーターがロボットが話を聞く前に物語を書き換えることができる位置に座っているということなのです。
より優れた盾を構築できるか?
研究者たちは単に問題を発見しただけではありません。問題を解決できるかどうかを確認するために、いくつかの盾をテストしました。彼らは2つの一般的な防御策をテストしました:
- ホワイトリスト: 「許可された」コマンドやウェブサイトの単純なリストです。コマンドがリストにない場合はブロックされます。
- セカンドオピニオン: ロボットが行動を起こす前に、第2のAIを使ってロボットの計画をレビューします。
ホワイトリストは、いくつかの悪い事象を阻止するには適していましたが、扱いにくいものでした。それは悪意のあるコマンドの**30%から44%をブロックしましたが、同時に正常なコマンドの30%から44%**も誤ってブロックしてしまい、ロボットの有用性を低下させました。
「セカンドオピニオン」AIの方が優れていました。レビュー担当としてどのAIモデルを使用するかによって、攻撃の**39%から64%**を阻止することができました。しかし、これは完璧な解決策ではありませんでした。最高のレビューモデルであってもすべてを捕まえることはできず、時として悪意のあるコマンドを通してしまうことがありました。研究者たちは、これらの盾が多少の助けにはなるものの、問題を完全に解決するものではないことを発見しました。ルーターは依然として強力であり、会話の真っ只中に位置しているのです。
教訓
この論文の主な教訓は、コーディング・ロボットをクラウドに接続するためにサードパーティのルーターに頼ることは、巨大なセキュリティホールを生み出すということです。ロボットはルーターが正直であることを前提としていますが、もしルーターが信頼できない場合、それはロボットにとっての現実を書き換えることができます。ロボットは、どれほど賢く、あるいはどれほど適切に設定されていても、指示がクラウドからの本物の指示なのか、ルーターからの偽物なのかを区別することはできません。
著者らは、これを真に解決するためには、ロボットがより注意深くなることに頼るだけでは不十分であると示唆しています。クラウドプロバイダー自身が、送信するメッセージが仲介者によって改ざんされていないことを保証する必要があります。それまでは、コーディング・ロボットがサードパーティのルーターを使用するたびに、それは自宅の鍵を、あなたが目を離している隙に泥棒を招き入れるかもしれない配達員に渡しているようなものなのです。ロボットは言われた通りに動いているだけですが、命令を出している人物がすり替えられているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。