← 最新の論文
💬 NLP

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

本論文は、AIエージェントが複雑なマルチターンのタスクを正しい永続的状態遷移とともに確実に実行できる能力を測定することにより、ステートフルなビジネスワークフローにおける評価を行うために設計されたサンドボックスおよびベンチマークであるThinkingboxを紹介し、507のポリシー条件付きシナリオを通じて、時折の成功と一貫した信頼性の間にある顕著な隔たりを明らかにしている。

原著者: Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

公開日 2026-08-21
📖 1 分で読めます☕ さくっと読める

原著者: Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、「エージェント」として知られる新しい世代のコンピュータプログラムが登場しました。単に質問に答えたり文章を書いたりする従来のチャットボットとは異なり、これらのエージェントは行動を起こすように設計されています。彼らはウェブを閲覧したり、ソフトウェアコードを実行したり、デジタルツールを呼び出してタスクを実行したりすることができ、それはまるで人間の従業員が行うかのようです。長年、研究者たちは、壊れたコードの修正やウェブサイト上の特定の事実の検索といった、明確で確認が容易な答えを持つ問題を解かせることで、これらのエージェントをテストしてきました。これらの分野における成功は、エージェントが正しい最終出力や有効なコマンドを生成したかどうかによって測定されました。しかし、現実のビジネスの世界は、それほど単純ではありません。企業のオフィスでは、コンピュータシステムが正しく更新され、ポリシーが遵守され、データベースの状態が特定の方法で変化しなければならないという、一連の長いイベントを伴う作業が多く存在します。もしエージェントがプロセスの途中で間違いを犯したり、誤ったレコードを変更したりすれば、その結果は現実的かつ深刻なものになり得ます。このテクノロジーの将来における決定的な問いは、エージェントが一度だけ成功する方法を見つけられるかどうかではなく、予期せぬ損害を与えることなく、毎回必ず、信頼性を持ってそれを実行できるかどうかです。

ピッツバーグ大学、ノースウェスタン大学、カリフォルニア大学アーバイン校、およびマイクロソフトの研究チームは、この問いに答えるための新しいテスト場を構築しました。彼らは「ThinkingBox」と呼ばれるデジタル環境を作成しました。これは、AIエージェントがシミュレーションされたユーザーや複雑なビジネスツールと相互作用できる、安全で隔離されたサンドボックスとして機能します。このサンドボックス内では、オンライン注文の返金処理、ホテルの予約変更、保険請求の更新、あるいは従業員からのITサポート依頼への対応といった、現実的なタスクがエージェントに与えられます。この環境は、情報はしばしば不完全であり、ルールは厳格であり、あらゆる行動がデジタル記録に永続的な痕跡を残すという、オフィスの仕事の混沌とした現実を模倣するように設計されています。研究者たちは、エージェントに単に会話をさせるだけでなく、実際にシステムの「状態」を変更することを要求しました。テストの公平性と再現性を確保するため、サンドボックスは毎回の試行後に完全にリセットされ、二つの試行が同じデータや隠れた履歴を共有しないようになっています。

その後、研究者たちはこの環境に、小売、旅行・ホホスピタリティ、自動車保険、銀行、コンサルティングの5つの異なる業界にわたる507の明確なタスクを配置しました。彼らは、主要なテック企業による独自のシステムとオープンソースモデルの両方を含む、利用可能な幅広い最先端の人工知能モデルを招待し、これらのタスクに挑戦させました。各モデルには、各問題を解決するための20回のチャンスが与えられました。評価は厳格でした。エージェントは、単に丁寧な回答をしたからといって、あるいは表面上は正しく見えるツール呼び出しを行ったからといって、合格したことにはなりません。代わりに、システムは最終的な結果を要求されたアウトカム(成果)と照合しました。返金は実際にデータベースに反映されたか? ホテルの客室は正しく変更されたとマークされたか? 保険請求は、誤って他の顧客のポリシーを変更することなく更新されたか? システムはまた、「副作用(collateral effects)」についてもチェックしました。つまり、エージェントが触れてはいけないものを誤って変更してしまっていないかを確認したのです。これは、現実世界のソフトウェアにおいて一般的かつ危険なエラーです。

結果は、エージェントが時折できることと、信頼して任せられることの間の大きな隔たりを明らかにしました。最も成績の良いモデルは、最初の試行でタスクを正しく解決できた割合は約65パーセントでした。これは印象的に聞こえるかもしれませんが、研究者が「信頼性」に着目すると、状況は一変しました。モデルが20回の試行すべてにおいてタ速にタスクを成功させられた頻度を確認したところ、その数値はわずか25パーセントへと劇的に低下しました。これは、スマートなエージェントであれば、十分な試行回数があれば成功への経路を偶然見つけ出すことはできても、エラーを起こすことなく一貫してその成功を繰り返すことはできないということを意味しています。研究者たちは、多くの失敗が、エージェントがリクエストを理解できなかったり、ユーザーとの対話に失敗したりしたことによるものではないことを発見しました。むしろ、最も一般的な問題は、ツールがエラーメッセージを出した際にエージェントが回復できなかったこと、あるいは、正しいアクションを誤ったデータに対して実行してしまったことでした。例えば、エージェントはレコードを更新するためのツール呼び出しには成功したものの、その変更を誤った顧客に適用してしまったり、あるいは必要なステップを完了する前にプロセスを停止してしまい、システムを壊れた状態のままにしてしまったりすることがありました。

この研究はまた、モデルによって苦手とする仕事の種類が異なることも浮き彫りにしました。一部のモデルは小売の注文を扱うことには非常に長けていましたが、複雑な保険政策や銀行規制を扱う際にはパフォーマンスが低下しました。これは、ある領域での高いパフォーマンスが、エージェントが別の領域でも信頼できることを保証するわけではないことを示唆しています。研究者たちは、エージェントがユーザーに対して完璧に見える最終メッセージを生成したとしても、その背後にあるデータベースが更新されていなかったり、破損していたりすることがあるのを観察しました。この発見は、会話の質やツール呼び出しの妥当性に焦点を当てがちな、現在の多くのシステムの評価方法に疑問を投げかけています。論文は、人工知能が重大なビジネス業務を任されるためには、単に一度成功する経路を見つけるだけでなく、その経路を一貫した、繰り返しの可能な精度で実行することを学ぶ必要があると結論付けています。ThinkingBoxサンドボックスとそのベンチマークは現在一般に公開されており、これらのデジタルワーカーが真に現実世界への準備ができているかを測定するための新しい基準を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →