ISE: An Execution-Grounded Recipe for Multi-Turn OS-Agent Trajectories
本論文は、高品質で実行に基づいたマルチターンOSエージェントの軌跡を生成する3段階の合成パラダイムであるISEを導入しており、これによりファインチューニングされたモデルのツール使用性能を大幅に向上させ、より大規模なゼロショットベースラインを凌駕する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
非常に賢いが経験の浅いロボットに、コンピュータの使い方を教えようとしている場面を想像してください。あなたは、そのロボットが「ファイルを整理し、それらに基づいてレポートを作成し、上司にメールで送る」といった複雑なタスクをこなせるようにしたいと考えています。
問題は、この論文によれば、これらのロボットを教えるために使われてきた「教科書」(学習データ)に3つの欠陥があることです。
- ツールから始まっており、ユーザーから始まっていない: ほとんどのデータは、利用可能なコンピュータコマンド(「ファイルを削除する」や「メールを送信する」など)のリストから出発し、それらを使う理由を後付けで作るという仕組みになっています。これは、シェフに教える際に、「ここに包丁があります、さあ何かを切る理由を想像してください」と言うようなもので、「お腹が空いたので、サンドイッチを作ってほしい」というところから始めるのとは異なります。
- 短すぎる: 現実は、やり取りの連続です。ロボットがミスをすれば、人間がそれを修正します。成功すれば、次のステップを指示します。しかし、ほとんどの学習データは、自動販売機の取引のような「一つの問いと一つの答え」だけであり、本当の会話にはなっていません。
- 偽物である: ロボットは通常、「シミュレーションされた」結果に基づいて学習します。コンピュータはファイルを削除した「ふり」をしたり、エラーメッセージがどうなるかを「推測」したりします。実際には本物のコンピュータには一切触れていないため、現実の世界で何かがうまくいかなかった時にどうすべきかを学ぶことができません。
解決策:ISE(Intent → Simulate → Execute / 意図 → シミュレート → 実行)
著者らは、これらの問題を解決するために、ISEと呼ばれる新しい3ステップのレシピを提案しています。これは、ロボットのための高級料理学校のようなものです。
ステップ1:メニュー(Intent / 意図)
ツールのリストから始めるのではなく、現実の人間が必要としていることから始めます。
- 比喩: パンの棚に何があるかではなく、さまざまな人々が実際に何を食べてみたいかというメニューに基づいて、メニューを作成するシェフを想像してください。
- 手法: 彼らは50,000通りのユニークな「ペルソナ」(多忙な財務マネージャー、クリエイティブなライター、あるいは学生など)を作成し、それらをさまざまな種類のタスクや難易度と組み合わせました。これにより、ロボットが単に簡単で一般的なリクエストだけでなく、現実世界の幅広いリクエストを処理できるようにしています。
ステップ2:ロールプレイ(Simulate / シミュレート)
ここで「短すぎる」という問題を解決します。彼らは、特別なAIを人間のユーザーとして機能させます。
- 比喩: 苛立った顧客の役を演じるメソッド俳優を想像してください。その俳優は「サンドイッチを作って」と言って終わるわけではありません。もしロボットがパンを落としたら、俳優は「ちょっと、パンを落としたわよ、拾いなさい!」と言います。もしロボットがうまくやったなら、「いいわ、次はチーズを乗せて」と言います。
- 秘訣: 著者らは、この「役者」AIがキャラクターを維持するように徹底しました。AIが誤って「親切なアシスタント」になってしまうと(それはトレーニングを台無しにするからです)、それは学習になりません。AIは厳格に「ユーザー」の役割に留まり、ロボットが「実際に何をしたか」に対して反応するのであって、「ロボットが何をしたと思ったか」に対して反応するのではありません。
ステップ3:本物のキッチン(Execute / 実行)
これが最も重要なステップです。ロボットは結果を推測するのではなく、実際に隔離されたコンピュータ上で作業を行います。
- 比喩: 本物のまな板の上で野菜を切るのではなく、シェフが実際に野菜を切る様子を想像してください。もし包丁が滑ってテーブルを傷つけたとしても、システムはその現実のミスを記録します。
- なぜ重要か: ロボットがコマンドを実行して失敗したとき(例:「ファイルが見つかりません」)、「役者」であるユーザーは実際のエラーメッセージを目にし、それに対して反応します。これにより、ロボットは現実世界の災難からどのように回復すべきかを学びます。偽のシミュレーションでは不可能なことです。
結果
彼らはこの新しい「教科書」(ISETraceと呼ばれます)を取り、ロボット(具体的には Qwen3-8B というモデル)の学習に使用しました。
- 以前の状態: この新しい学習がない場合、ロボットは複雑で多段階のコンピュータ・タスクを約**19%**しか解決できませんでした。
- 以後: この新しい学習により、ロボットは**37%**のタスクを解決できました。
- 比較: この学習を受けた80億パラメータのロボットは、以下のものよりも優れたパフォーマンスを発揮しました:
- このデータで学習されていない、より大規模な(320億パラメータの)ロボット。
- このデータで学習されていない、非常に有名な高価な商用ロボット(GPT-4o)。
まとめ
この論文は、どのような学習データを作るかは、何のデータを作るかと同じくらい重要であることを主張しています。現実のニーズから始め、長い会話を強制し、そして(失敗も含めて)本物のコンピュータで練習させることで、彼らはより賢いエージェントを作り出しました。
彼らはまた、「長い会話」の部分こそが鍵であることを証明しました。学習データを単一の質問(やり取りを排除したもの)に削減すると、ロボットのパフォーマンスは大幅に低下しました。これは、ロボットが真に有用であるためには、会話を扱う方法を学ぶことが不可欠であることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。