← 最新の論文
🤖 AI

Real-Time Execution with Autoregressive Policies

本論文は、トークナイゼーションのホライゾンを調整し制約付きデコーディングを適用することで、自己回帰型ポリシーが厳格なレイテンシ境界を維持したままリアルタイム実行を実現でき、それによってタスク完了速度と汎化性能の両面においてフローマッチング型のモデルを凌駕できることを実証している。

原著者: Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

公開日 2026-06-12
📖 1 分で読めます☕ さくっと読める

原著者: Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、コップを積み上げたりおもちゃを拾ったりといったタスクを教えている場面を想像してください。これを行うために、ロボットは「世界」を観察し、「何をすべきか」を考え、「腕」にコマンドを送るというプロセスを持つ「脳」(大規模なAIモデル)を使用します。

こうした巨大なAIの脳には、問題があります。それは、彼らが「考えるのが遅い」ことです。情報を処理するまでに時間がかかり、言葉を発するまでにラグが生じます。従来のやり方(同期推論 / Synchronous Inference)では、ロボットは完全に動きを止め、脳が考え終わるのを待ってから、再び動き出す必要がありました。これは、ドライバーがすべての赤信号で車を止め、信号が青になるのを待ってから再び走り出すようなものです。これでは、ロボットはぎこちなく、動作が遅くなり、急な変化への対応もできません。

この問題を解決するために、研究者たちは通常、より速く思考できる別のタイプの「脳」(拡散ポリシー / Diffusion Policies と呼ばれるもの)を使おうとしてきました。しかし、この論文の著者たちはこう問いかけました。「もし、元の、もっと遅い『自己回帰型(Autoregressive)』の脳を、そのままリアルタイムで動かせるようにしたらどうなるだろうか?」

彼らは、以下のようなシンプルな比喩を用いて、この方法を実現しました。

「シェフとウェイター」の比喩

ロボットの脳をシェフ(AIモデル)、ロボットの腕をウェイターだと想像してください。

旧来の問題(同期型):
ウェイターがシェフに「次は何をすればいいですか?」と尋ねます。シェフは料理の手を止め、長い時間をかけて考え、10ステップのフルレシピを紙に書き上げ、それをウェイターに渡します。ウェイターはその全文を読み、ステップを開始します。ウェイターが最初の5ステップを実行している間、シェッションの間、シェフは次のレシピを考えるのを待ちながら、何もせずに座っています。これが、ロボットの「停止」やラグを引き起こします。

新しい解決策(自己回帰型ポリシーによるリアルタイム実行):
著者たちは、シェフの「脳」自体を変えることなく、シェフとウェイターの「話し方」を変えることでこれを実現しました。

  1. 小さなバッチ(トークン化のホライゾン):
    シェフに一度に10ステップのレシピ全体を書かせるのではなく、一度に2ステップ分だけを求めます。これにより、書くスピードが格段に上がります。

    • 比喩: シェフは短いメモを書きます。「ステップ1:コップを掴む。ステップ2:皿へ移動する」。ウェイターはこのメモをすぐに受け取り、動き始めます。
  2. アクション・キュー(コンベアベルト):
    ウェイターは、これらの小さなメモを入れた小さなトレイ(キュー)を持っています。ウェイターが最初のメモを終えるとすぐに、トレイから次のメモを取り出します。

    • 比喩: ウェイターは決して動きを止めません。なぜなら、トレイには常に次のメモが用意されているからです。ウェイターが現在の指示を実行している間に、シェフは次のメモを書き進めています。これが非同期推論(Asynchronous Inference)、つまり「動きながら考える」ことです。
  3. 安全ガード(制約付きデコーディング):
    シェフが素早く書いているため、指示が長すぎたり、意味不明なもの(例:「月までジャンプしろ」というレシピ)を書いたりするリスクがあります。そこで、著者たちはシェフの成果物をチェックする「安全ガード」を追加しました。

    • 比喩: 安全ガードは、シェフがウェイターが時間内に読み切れる長さのメモだけを書くように保証します。もしシェフが長すぎる文章を書こうとしたら、ガードがそれを遮断するか、より単純なバージョンに強制的に変更します。これにより、ウェイターが待機のために止まることがないよう保証されます。
  4. 「最善の推測」戦略(マルチ・トラジェクトリ・デコーディング):
    ウェイターが作業している間、シェフには少しだけ余分な時間があります。単に一つのメモを書くだけでなく、シェフは次のステップの4つの異なるバージョンを素早く下書きし、その中からベストなものを選びます。

    • 比喩: シェフは「案A:左へ動く。案B:右へ動く。案C:高く持ち上げる。案D:低く持ち上げる」と考えます。安全ガードがこれら4つを素早くチェックし、ウェイターは実行すべき最善の案を選びます。これにより、速度を落とすことなく、ロボットはより賢く、正確になります。

何が分かったのか?

研究者たちは、コンピュータ・シミュレーションと現実世界の双方で、この新手法をロボットにテストしました。

  • 「遅い」脳よりも高速: 元の「自己回帰型」の脳は遅いことで知られていましたが、この新手法を用いることで非常にスムーズに動作し、多くのタスクにおいて、より新しい「高速な」拡散型の脳を実際に上回る性能を発揮しました。
  • 指示への追従性が高い: 自己回帰型の脳は、複雑な言語(人間がレシピを読むような動作)を理解することに長けているため、高速に動いている時でも、他のタイプのロボットよりも指示を正確に理解できました。
  • 停止がなくなった: ロボットは決して動きを止めませんでした。「シェフ」が常に一歩先を行き、ウェイターが動いている間に次のメモを書き続けていたため、変化に対して即座に反応することができました。

大きな教訓

この論文は、ロボットをリアルタイムで動かすために、必ずしも全く別の種類のAIの脳に切り替える必要はないということを証明しています。ただ、「脳にどのように指示を求めるか」を変えるだけでよいのです。指示を小さな塊に分解し、速度をチェックし、ロボットが動いている間に脳に考えさせることで、たとえ「遅い」思考を持つ脳であっても、高速でスムーズ、かつ反応性の高いものにすることができます。

要するに、**「エンジンを変えるのではなく、トランスミッション(変速機)を変えなさい」**ということです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →