← 最新の論文
💻 computer science

Runtime Continuation after Faults in Partially Executed Agent Workflows

本論文は、信頼できるフロンティアを再構築し、標準的な契約から残留義務を導出し、有効かつ新鮮で一意に一致するエビデンスによって裏付けられた承認済みの効果を通じてのみ状態を進めることにより、部分的に実行された言語モデルエージェントのワークフローからの安全なリカバリを保証する、実行時の継続メカニズムを提案するものである。

原著者: Li Zeng, Chuanwu Yang, Qiang Zhao, Qinde Chen, Deyang Qu

公開日 2026-09-22
📖 1 分で読めます☕ さくっと読める

原著者: Li Zeng, Chuanwu Yang, Qiang Zhao, Qinde Chen, Deyang Qu

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のデジタル環境において、人工知能は単にテキストを記述するシステムから、能動的にタスクを実行するシステムへと進化しました。これらのインテリジェント・エージェントは、ユーザーに代わってウェブを検索し、ファイルを編集し、メッセージを送信し、データベースを更新することができます。これらは、各アクションが現実世界の状態を変化させる「ワークフロー」と呼ばれる一連の手順に従って動作します。しかし、この行動能力は特有の脆弱性を生み出します。もしエージェントがミスをしたり、罠に嵌められたり、あるいはファイルを変更したりメッセージを送信したりした後にシステムエラーが発生した場合、単にやり直したり最初からやり直したりすることは危険を伴う可能性があります。失敗したシーケンスを再生すると有害なアクションが繰り返される可能性があり、混乱した状態から続行すると誤った前提に基づいて作業が進んでしまう可能性があるからです。核心となる課題は、履歴のどの部分が信頼できるのか、どの作業が未完了なのか、そしてエラーの繰り返しや欺瞞への陥落を防ぎつつ安全に進むためにどのような証明が必要なのかを正確に判断することです。

研究者のLi Zeng氏率いる、国家移民管理局情報技術研究所および香港科技大学の研究チームは、この問題を解決するための新しい手法を開発しました。彼らはこのシステムを「AgentMirror」と呼んでいます。AgentMirrorは、壊れたワークフローを新しい推測によって修正すべき単純なエラーとして扱うのではなく、リカバリープロセスを現実に対する厳格なステップ・バイ・ステップの検証として扱います。このシステムは、一度エージェントがアクションを実行すれば、そのアクションの履歴はそのアクションの固定された真実の点になるという原則に基づいています。もしエージェントがその時点でクラッシュしたり騙されたりしても、システムは人工知能に何が起こったかを判断させません。代わりに、実際に何が起こったかの検証済み記録を確認し、どのタスクがまだ残っているかを正確に特定した上で、再び現実の状態を変化させる新しいアクションを許可する前に、具体的な証明を要求します。

研究者たちは、彼らが「信頼の境界線(trusted frontier)」と呼ぶ概念を中心にこのシステムを構築しました。エージェントの履歴が安全かつ正しいことが確認された正確な瞬間を示す、砂の上に引かれた線を描いて想像してみてください。この線の前にあるものはすべて真実として受け入れられ、この線の後にあるものはすべて未検証となります。障害が発生したとき、システムは人工知能にこの線を書き換えさせたり、ミスがなかったふりをさせたりすることはありません。システムは、その線までの検証済み履歴のみに基づいてエージェントの状態を再構築します。ここから、システムは「残留義務(residual obligations)」のリスト、つまりエージェントが仕事を完了するために完了しなければならない特定の必須タスクを算出します。そして、このリストを人工知能に提示し、残された作業をガイドとして示しますが、人工知能にそれを実行する権限までは与えません。

決定的な革新は、システムが次のステップをどのように処理するかという点にあります。人工知能が新しいアクションを提案するとき、その提案は信頼できないものとして扱われます。システムは、そのアクションの実行が許可されていることを確認するために、「通常の承認(ordinary admission)」として知られる標準的なセキュリティチェックを通します。アクションが実行されたとしても、システムは直ちにそのタスクが完了したとは認めません。システムは、「実行時のレシート(runtime receipt)」、すなわち、アクションが実際に発生し、正しく観察されたことを確認する信頼できる機関によって発行されたデジタル証明書を待ちます。このレシートは「新鮮(fresh)」である必要があり、つまり今作成されたものでなければならず、かつ「信頼の境界線」に紐付いている必要があります。つまり、過去のアクションの再生や、別のセッションからの偽造品であってはなりません。このレシートが検証され、かつ残っているタスクのちょうど一つと完全に一致する場合にのみ、システムはエージェントの進捗の公式な記録を進めることを許可します。

このアイデアをテストするために、研究者たちは、様々なタスクをシミュレートし、エージェントの挙動を見るために意図的に障害や攻撃を導入するベンチマークである「AgentDojo」を使用しました。彼らは、AgentDojoを用いて、単に最後のステップをリトライしたり、エージェントにトラブルから抜け出すための推測をさせたりする他のリカバリー手法と、AgentMirrorシステムを比較しました。結果として、AgentMirrorは安全にタスクを完了することにおいて著しく優れていることが示されました。AgentMirrorは、不正なアクションが紛れ込むことなく障害から正常に回復し、有害な操作を繰り返させようとする欺瞞的な指示にエージェントが陥るのを防ぎました。この研究は、人工知能に与えられるガイダンスと、アクションを実行する権限を分離し、すべてのステップに対して新鮮な証拠を要求することで、エージェント自体が侵害された場合でも、安全な経路を維持できることを実証しました。

研究者たちはまた、彼らの安全ルールの特定の部分を取り除いたらどうなるかを調査しました。その結果、レシートの検証ステップをスキップすると、システムは偽の証拠や古い証拠を受け入れてしまい、不正確な進捗につながることが分かりました。もしリカバリーガイドを許可証として機能させてしまうと、システムは信頼できないアクションを実行させてしまいます。もしアクションが特定のタマスクと正確に一致するかどうかをチェックしなければ、システムは間違ったタスクを終了させるか、あるいは作業を未完了のままにしてしまいます。これらのテストにより、彼らのプロセスのすべての部分が必要であることが確認されました。単独のチェックでは他のチェックを代替することはできません。システムが機能するのは、人工知能が提案はできるがシステムが決定し、検証された現実のみが記録を変化させることができるという、信頼の連鎖を強制しているからです。

この研究は、人工知能を完璧にしたり、あらゆる可能性のある失敗を解決したりすることを主張するものではありません。このシステムは、初期の契約または一連のルールが正しいことに依存しています。もしルール自体が間違っていれば、システムは忠実に間違った道を辿ります。また、それらのアクションの証明が失われた場合、すでに現実世界で行われたアクションを取り消すこともできません。しかし、物事がうまくいかなくなった瞬間を管理するための堅牢なフレームワークを提供します。リカバリープロセスを、既知の安全な状態から新しい検証済みの状態への厳格な遷移として扱うことで、AgentMirrorは、エージェントがエラーや悪意のある干渉に遭遇した場合でも、安全に作業を継続させる方法を提供します。研究は、安全な継続の鍵は、より良い推測ではなく、より良い検証にあると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →