← 最新の論文
🤖 machine learning

Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling

本論文は、自然言語タスクを実行可能コードに変換し、従来の逐次的なウェブエージェントループに比べて大幅な高速化と精度向上を実現する、プランナー、スケジューラー、不変条件強制プロトコルからなるエージェントJITコンパイルというフレームワークを紹介する。

原著者: Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Caleb Winston, Ron Yifeng Wang, Azalia Mirhoseini, Christos Kozyrakis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに「タコベルから最も安いタコを注文する」といった複雑な用事を頼むと想像してみてください。

現在、ほとんどのロボットは非常に慎重で遅い人間の助手のように動作します。画面を見て、次に何をすべきか超知的な頭脳(AI)に尋ね、ボタンをクリックし、画面が切り替わるのを待ち、再び頭脳に尋ね、単語を入力し、待ち、そして再び尋ねます。この「見て・考え・行動する」というループが繰り返し行われます。これは遅く、高価です(AI 頭脳に尋ねるたびにコストがかかるため)、また画面が少し違っているだけでロボットが間違ったものをクリックしてしまう可能性があるため、ミスが発生しやすいのです。

この論文は、これらのロボットをより速く、より賢くするための新しい手法、「エージェント JIT コンパイル」を紹介しています。これは、ロボットが動き出す前に「ステップバイステップの指示書」から「カスタムソフトウェアスクリプトの作成」へ切り替えるようなものです。

その仕組みは、以下の 3 つの簡単な部分に分解されます。

1. 「離陸前」のプランナー(JIT-Planner)

各ステップごとに AI に「次に何をすべきか?」と尋ねる代わりに、システムはまずあなたのリクエスト(「最も安いタコを注文する」)を受け取り、即座に問題を解決できる複数の異なるコンピュータプログラム(コード)を生成します。

  • アナロジー: ニューヨークからボストンへ車を運転する必要があると想像してください。
    • 旧来の方法: 各ガソリンスタンドで立ち止まり、地元の人に「ボストンへの道はどちらですか?」と尋ねます。1 マイル運転して再び尋ね、さらに 1 マイル運転して再び尋ねます。
    • 新しい方法: 出発する前に、地図アプリに 3 つの異なるルート生成を依頼します。アプリは交通状況、道路状態、距離を確認します。そして、絶対的に最速のルートを選び、GPS 座標を車のナビゲーションシステムに一度だけ入力します。その後、あなたはただ運転するだけです。
  • 魔法: システムは、生成されたこれらのルートが論理的であることを確認します(例:「カートに追加」をクリックする前に「注文」をクリックすることはできないなど)。そして、最も少ない「頭脳パワー」(AI 呼び出し)と時間を要するものを選び出します。

2. 「交通整理員」(JIT-Scheduler)

ロボットが計画を立てると、それをどのように実行するかを決定する必要があります。すべてを一つずつ行うべきか?3 つの作業を同時に試みるべきか?それとも同じタスクを並列で 3 回試し、最初完了したものだけを使用すべきか?

  • アナロジー: パーティーの食事を注文すると想像してください。
    • シリアル(一つずつ): 1 つのレストランに電話し、答えを待ち、次に電話し、待つ……
    • 並列: 3 つのレストランに同時に電話します。
    • ヘッジング: 3 つのレストランに電話しますが、最初に受話したものにのみ関心があります。もし一つが遅ければ、待たずに速い方からの答えを採用します。
  • 魔法: システムは特定のタスクを分析し、過去のデータを用いてどの戦略が最適か推測します。タスクが単純であれば、一つずつ進めます。タスクが難易度が高く、行き詰まる可能性がある場合は、迅速に完了することを保証するために、複数の経路を同時に試みます(ヘッジング)。最も時間を節約できる戦略を選択します。

3. 「規則集」(不変条件強制プロトコル)

ロボットがクラッシュしたり、間違ったボタンをクリックしたりしないように、ロボットが使用するすべてのツール(「ボタンをクリック」や「テキストを入力」など)には、厳格な規則集が付属しています。

  • アナロジー: 自動販売機を想像してください。
    • 旧来の方法: 単にボタンをランダムに押します。機械が空の時に「お菓子」ボタンを押しても、何も起こらないことがあります。
    • 新しい方法: 機械にはセンサーがあります。確認します。「機械はオンか?中にお金はあるか?扉は閉まっているか?」条件が満たされていない場合、機械はボタンを押すことを拒否します。
  • 魔法: ロボットがコードを実行する前に、これらの規則をチェックします。「カート」が空なのに「注文」を試みる計画があれば、システムはロボットが実際に動き出すにそのミスを検知し、エラーと時間の無駄を防ぎます。

結果

著者らは、この手法を 5 つの異なるウェブサイト(フードデリバリー、メール、ショッピングサイトなど)でテストしました。結果は印象的でした。

  • 速度: 新しい手法は、標準的な「各ステップで AI に尋ねる」方法よりも10 倍速いものでした。
  • 精度: 精度も28% 向上し、実際に正しいタコを注文できる頻度が 28% 高まりました。
  • 比較: 他の高度な AI エージェント(OpenAI や Anthropic のものなど)と比較しても、彼らの手法は2.4 倍速く9% 高い精度を誇りました。

まとめ

要約すると、この論文はこう述べています:AI にステップバイステップで車を運転させるべきではありません。代わりに、AI に運転ルート全体をスクリプトとして記述させ、そのルートが安全であることを確認し、最も速い実行方法を選択し、その後スクリプトを実行させます。これにより、遅く、つまずきのある会話が、滑らかで高速な実行へと変わります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →