← 最新の論文
🤖 machine learning

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRTは、中間表現、静的解析、および反復的なベンチマークングを伴う「プログラムの連鎖(chain-of-program)」という斬新なパラダイムを通じて、単純な参照実装を多様なハードウェアプラットフォーム上の高度に最適化されたリアルタイム・マルチモーダル展開へと自動的に変換し、大幅なレイテンシ削減とスループット向上を実現する、コーディングエージェントを導くためのエージェントハーネスである。

原著者: Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、キャラクターがあなたの声を聞き、話し、即座に反応できるような、超高速でリアルタイムなビデオゲームを作ろうとしていると想像してください。これを実現するには、いくつかの異なる「脳」(AIモデル)を連鎖させる必要があります。あなたの声を聴くためのもの、返答を考えるためのもの、その返答を音声に変換するためのもの、そして言葉に合わせて顔を動かすためのものです。コンピュータサイエンスの世界では、これを「マルチモーダル・アプリケーション」と呼びます。難しいのは、これらの「脳」を持っていること自体ではなく、それらが互いに足を引っ張り合わないように、どのように一緒に動かすかを考えることです。これらすべてを一つの小さなプロセッサに詰め込むと、動きが遅すぎます。逆に、あまりにバラバラに配置しすぎると、データのやり取りに時間がかかりすぎてしまいます。長年、専門家たちは、新しいアプリができるたびにカスタムの「交通管制システム」を手作業で構築しなければなりませんでした。これは時間がかかり、コストがかかり、再現も困難なプロセスでした。

ここで、「AIエージェント」というアイデアが登場します。これは、コードを読み、それをより速く動作するように書き換えることができる、超スマートで疲れを知らないデジタル・インターンだと考えてください。しかし、ここには落とし穴があります。もしこのインターンに単に「速くして」と頼むだけなら、彼らは混乱し、ランダムなことを試したり、最高のテクニックを見逃したりすることがよくあります。なぜなら、問題が非常に複雑だからです。それはまるで、巨大で動いているパズルを、一度もピースを書き留めることなく、頭の中だけで並べ替えようとする人間に頼むようなものです。ここで、FlashRTと呼ばれる新しいシステムが登場します。FlashRTは、単にAIに推測させるのではありません。AIに構造化されたゲームプラン、道具のセット、そして自分のアイデアをテストする方法を与え、混沌とした推測ゲームを精密なエンジニアリングの偉業へと変えるのです。

問題点:AIの交通渋滞

この論文の著者たちは、リアルタイム・アプリケーション(音声アシスタントやライブビデオ生成器など)が普及している一方で、それらを効率的に実行することが極めて困難であることに気づきました。これらのアプリは、異なる機械(モデル)が異なる仕事を行う組み立てラインのようなものです。時には、ライン全体のスピードを最大限に高めたい場合もありますし(高スループット)、時には、最初のアイテムが最も早く出てくるようにしたい場合もあります(低レイテンシ)。

問題は、これらの機械を配置する「最善」の方法は、目的によって変わるということです。スピードを求めるなら、複数のコンピュータに機械を分散させて並列に動作させたいかもしれません。一方、遅延を最小限にしたいなら、データをやり取りする時間を無駄にしないよう、機械同士を近くに配置したいかもしれません。既存のシステムは硬直的であり、固定された配置を強制してしまいます。他のツールも自動化を試みていますが、これらは単純な単一タスクには機能するものの、このような複雑な多段階のパイプラインには対応できません。その結果、開発者は新しいアプリごとにカスタムソリューションを手作業で作らざるを得ず、スケールさせることもできません。

解決策:FlashRTと「Chain-of-Program」

研究者たちは、マルチモーダル・アプリに最適なデプロイメント(展開)を自動的に設計するAIコーディングエージェントを用いたシステム、FlashRTを構築しました。しかし、彼らは単にAIに「直して」と言ったわけではありません。AIに直接解決策へ飛びつくよう指示すると、失敗することが多いということに気づいたのです。AIは一つの優れたテクニックは見つけても、他のテクニックを見逃したり、見た目は良くても実際に動かすと壊れてしまうような解決策を生み出したりすることがあります。

これを解決するために、FlashRTは**「Chain-of-Program(プログラムの連鎖)」**と呼ばれる巧妙な戦略を採用しています。あなたがミステリーを解こうとしている探偵だと想像してください。いきなり犯人を逮捕するのではなく、まず現場のマップを作成し、誰がどこにいて何をしていたのかを記録します。次に、そのマップを分析して手がかりを見つけます。最後に、自分の理論をテストします。

FlashRTもコードに対して同じことを行います:

  1. マップ(中間表現): まず、AIエージェントは開発者のシンプルで低速なコードを取り込み、構造化された「マップ」(中間表現、またはIRと呼ばれます)に翻訳します。このマップは、データが異なるモデル間でどのように流れ、どこでメモリを共有しているかを明確に示します。これにより、AIは変更を試みる前に、構造を理解するために一旦立ち止まることができます。
  2. 分析: AIはこのマップを見て、チャンスを見つけ出します。例えば、モデルAはモデルBが完全に終了するのを待つ必要はなく、モデルBがデータの小さな断片を生成した時点で作業を開始できる、といった具合です。これは、お湯が沸騰するのを待ってから包丁を握るのではなく、お湯が沸騰している間に野菜を切り始めるシェフのようなものです。
  3. テスト走行(検証ループ): これが最も重要な部分です。AIは単に推測するのではなく、「テストハーネス」を構築します。ユーザーがアプリと対話している様子をシミュレートし、偽の入力を与え、出力が戻ってくるまでの時間を正確に測定します。もしAIの新しい設計が以前より遅かったり、間違った答えを出したりすれば、すぐにそれを知ることができます。その後、AIは別の戦略を試し、再びテストを行い、最適なセットアップが見つかるまで反復を繰り返します。

結果:未来を加速させる

チームは、対面型会話エージェント、ビデオ背景エディタ、ビデオワールドモデルを含む、いくつかの実世界のアプリケーションでFlashRTをテストしました。その結果は驚異的でした。

NVIDIA B200 GPUにおいて、FlashRTは基本的な低速の実装を、最初のレスポンスまでの時間(レイテンシ)を最大70倍短縮する高速デプロイメントへと変貌させることができました。また、継続的なストリームを処理する速度(スループット)も2.8倍向上させました。

さらに興味深いことに、彼らはまだ専門家による最適化が進んでいない別のタイプのハードウェアであるAMD MI355X GPUでもテストを行いました。FlashRTは単に動作しただけでなく、そこで真価を発揮しました。レイテンシの改善を実現しただけでなく、スループットを3.6倍に高めました。Qwen3-Omniというモデルを用いた特定のテストでは、FlashRTは人間の専門家が構築したシステムと比較して、レスポンス時間を**65%**削減しました。

なぜこれが重要なのか

この論文は、新しいAIアプリごとに人間の専門家が手動でチューニングするのを待つ必要はないことを示しています。AIエージェントに、構造化された思考法(マップ)と、アイデアをテストする方法(検証ループ)を与えることで、異なるハードウェアや異なる目標に適応する、極めて効率的なシステムを自動的に生成できるのです。

著者たちは、これは大きな前進ではあるものの、すべてを解決する魔法の杖ではないことも慎重に注記しています。彼らはまだ、モデル内部の微細な低レベルの数学的演算を最適化するAIの能力を統合しておらず、また、特定の種類のAIエージェントのみをテストしています。しかし、核心となる発見は明白です。適切なガイダンスがあれば、AIエージェントは、今日私たちが手作業で作れるものよりも速く、かつ柔軟な、リアルタイム・システムを設計することを学ぶことができるのです。これは、「手作業で未来を作る」ことから「未来を導く」ことへの転換なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →