← 最新の論文
🤖 machine learning

Building Interactive Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

本論文は、非同期 I/O と推測的ツール呼び出しを組み合わせるフレームワークを提案し、複雑なマルチターンツール呼び出しを伴うリアルタイムかつ低遅延なエージェント型インタラクションを実現するとともに、許容可能な精度を維持しつつクラウドおよびエッジ規模のモデルの両方で大幅な高速化を達成する。

原著者: Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

公開日 2026-05-14
📖 1 分で読めます☕ さくっと読める

原著者: Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な指示を、非常に賢いものの、少し反応が遅いアシスタントに伝えようとしている状況を想像してください。従来の方法(「標準的」な手法)では、あなたが文を話し終えるまで待たなければ、アシスタントは何かをするための思考を開始することさえできませんでした。その後、アシスタントが電話番号を調べたり、テキストを送信したりする必要がある場合、彼らは会話を中断し、そのタスクを実行し、結果を待ち、そしてそれから何があったかをあなたに報告するために戻ってきました。この行き来は多くの沈黙と待機を生み出し、会話をぎこちなく不自然なものに感じさせます。

この論文は、リアルタイムの人間同士の会話に非常に近いと感じさせる、AI エージェントが作業する新しい方法を紹介します。彼らはその方法を非同期 I/O推測的ツール呼び出しと呼んでいます。これがどのように機能するかを、簡単な比喩を用いて説明します。

1. 「マルチタスクシェフ」(非同期 I/O)

標準的な AI エージェントを、一度に一つのことしかできないシェフだと考えてください。彼らは注文が終わるのを待ち、それから野菜を切り、それからコンロが温まるのを待ち、それから調理します。

新しい方法は、AI をマルチタスクシェフに変えます。

  • あなたがまだ話している間: シェフは、あなたが言った最初の数語に基づいて野菜の切り始めます。文が終わるのを待ちません。
  • コンロが温まるのを待っている間: シェフがツール(データベース検索など)の完了を待つ必要がある場合、彼らは壁をじっと見つめて待っているだけではありません。その待機時間を使って次のステップの計画を立て始めたり、次の材料の準備をさえ始めたりします。

技術的な用語で言えば、これは AI が「あなたの話すこと」から「思考」を「分離(デカップリング)」することを意味します。あなたや外部世界からの情報を待つ間、その場を凍り付かせるのではなく、作業を継続します。

2. 「安全網を持つギャンブラー」(推測的ツール呼び出し)

時には、AI が推測をしなければならないことがあります。あなたが「ジョーに電話を…」と言うと、AI は誰かに電話をかける必要があることを知っていますが、どのジョーかはまだわかりません。

  • 従来の方法: AI は「待って、どのジョー?」と言い、あなたが明確にするまですべてを停止します。
  • 新しい方法: AI は推測的な動きをします。「わかった、念のため『ジョー・スミス』を調べておくよ」と言い、プロセスを即座に開始します。

安全網:
この論文は、「安全な」推測と「危険な」推測の間に決定的な区別を設けています。

  • 安全なツール(読み取り専用): AI が単に電話番号を調べているだけなら、即座に行うことができます。後で「実は、ジョー・ジョーンズのことだった」と言われた場合、AI は単に番号を差し替えるだけです。悪いことは何も起こりません。
  • 危険なツール(書き込み専用): AI がテキストメッセージを送信したり、ファイルを削除したりしようとしている場合、単に推測することはできません。その動作を「保留」ボックスに保持します。メッセージを準備しますが、実際に「送信」ボタンを押す前に、最終的な「ゴーサイン(あなたが話し終わったことの確認)」を待ちます。

もし AI が間違えて推測し、あなたが考えを変えた場合、それが実際に起こる前に保留中のアクションを単にキャンセルできます。これは、シェフが玉ねぎの切り始めようとしたが、ナイフがまな板に触れる前に「実は、今日はベジタリアンなんだ」と言われたら、即座に止めるようなものです。

3. 「時計ベースのトレーニング」

AI にこれを教えるために、研究者たちは単に「もっと速くしろ」と指示しただけではありません。彼らは時計を備えた特別なトレーニングジムを構築しました。

  • このジムでは、AI は情報(あなたの声やツールの回答など)が特定の遅延した時刻に到着することを期待するように訓練されます。
  • AI は、その遅延の間も作業を続けることを学びます。
  • また、トレーニングデータに AI が早期に誤って推測したような架空の「間違い」を作成し、パニックにならずに後でその間違いを修正する方法を学ばせるようにしました。

結果

この論文は、2 種類の AI でこの方法をテストしました。

  1. 大規模クラウドモデル: 既存の強力な AI API(OpenAI のものなど)を使用する場合、この方法は精度をわずかに低下させるだけで、1.3 倍から 1.7 倍高速化しました。
  2. 小規模エッジモデル: 彼らがラップトップで実行できるような小規模な AI モデルを、彼らの特別な「時計」方式を用いて訓練した場合、これらのモデルは高い精度を維持しながら1.6 倍から 2.2 倍高速化しました。

まとめ: この論文は、AI エージェントが思考中や待機中に「一時停止」することをどう防ぐかを示しています。待っている間も作業を続け、後で修正可能な安全な推測を行うことを可能にすることで、人間とリアルタイムで相互作用できるようになり、音声アシスタントをより自然で反応性の高いものにするのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →