Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference
Deltorisは、時間的ビットスパース性、投機的推論、およびカスタムビットシリアル・シストリック・アクセラレータを活用することで、既存のソリューションに対して大幅な高速化を実現し、エッジデバイス上での拡散ベースのVision-Language-Actionモデルのリアルタイムかつエネルギー効率の高い推論を可能にするアルゴリズム・ハードウェア協調設計フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットがキャッチボールの遊び方を学ぼうとしている場面を想像してみてください。これを実現するために、ロボットにはボールを見つけ、ルールを理解し、腕をどのように動かすかを正確に決定できる「脳」が必要です。ロボット工学の世界では、この「脳」はしばしば「Vision-Language-Action(VLA)モデル」と呼ばれる特殊な種類のコンピュータプログラムと呼ばれます。これは、ロボットが見聞きしたことを物理的な動きへと変換する、超スマートな翻訳者のようなものです。長い間、これらのロボットは、動きを作るための数学的計算が非常に重かったため、少し動作が遅く不器用でした。それはまるで、レンガが詰まったバックパックを背負ってマラソンを走っているようなものです。
最近、科学者たちは「拡散(ディフュージョン)」と呼ばれる、ロボットに動きを教える新しい方法を発見しました。これは、ロボットがまず霧の立ち込める部屋の中でよろめきながら歩き回り、その後、ステップごとにゆっくりと霧を晴らしていくことで、完璧な経路を見つけ出すプロセスに似ています。この手法により、ロボлоトは以前よりもずっと滑らかに動き、新しい状況にもうまく対処できるようになりました。しかし、問題があります。この「霧を晴らす」プロセスは計算量が非常に多いため、リアルタイムでの使用には遅すぎるのです。ロボットがバランスを保ち安全に動くためには、1秒間に50回から200回の判断を下す必要がありますが、これらの新しいモデルは、まるでチーターとのレースで勝とうとしているカタツムリのように時間がかかっていました。これが、研究チームが解決しようとした問題です。つまり、超スマートで滑らかな動きをするロボットを、現実世界のスピードに追いつくほど速くするにはどうすればよいのか、という問題です。
ここで、ロボットの脳を賢さを損なうことなく高速化するために設計された、巧妙な新システム「Deltoris」が登場します。研究者たちは、ロボットが生きている世界では、すべてが瞬時に変化するわけではないということに気づきました。ロボットがコップに手を伸ばしているとき、ある瞬間から次の瞬間にかけてのコップの視覚的な変化は、ほぼ全く同じです。それは、映画のフレームの98%が同一であるようなものです。毎回絵全体を描き直す必要はなく、変化したわずかな部分だけを描けばよいのです。
Deltorisはこの観察を活かし、「時間的整合性を考慮したビットレベルのスパース性(temporal-aware bit-level sparsity)」という技術を利用しています。毎回の動きに対して数学の問題全体を再計算する代わりに、システムは現在の瞬間と直前の瞬間の「差分」のみを計算します。これは、手を2インチ上げたときに、毎回自分の伝記を書き直すのではなく、「手を2インチ上げた」というテキストメッセージだけを送るようなものです。これにより、膨大な不要な作業をスキップし、計算量を90%以上削減しています。
しかし、難点がありました。「差分」だけを送ることで、システムは新しい情報と比較するために、常にメモリから「古い」情報を呼び出す必要があり、それがデータパイプラインにおける交通渋滞を引き起こしていました。これを解決するために、チームは「投機的推論(speculative inference)」という第二のトリックを追加しました。これは、小さな素早いアシスタントが試合の次の数手を見越し、その後、大きくて遅い超スマートなコーチがそれらの予測をまとめてチェックする様子を想像してください。これにより、重いデータを一度だけロードして、複数のステップを検証するために使用することができ、交通渋滞を解消しました。
これらすべての魔法を実現するために、研究者たちは単にソフトウェアを書いただけでなく、これらの「差分」計算を処理するために特別に設計されたカスタムハードウェアチップ(アクセラレータ)を構築しました。彼らは、小さなプロセッサが完璧に連携して働く特殊な組み立てラインを作り上げ、データ待ちで誰も何もできない状態にならないようにしました。
彼らの実験結果は素晴らしいものです。Deltorisを標準的なモバイルコンピュータチップ(ハイエンドのスマートフォンのようなもの)や他の専用ロボットチップと比較したところ、圧倒的な勝利を収めました。Deltorisは、モバイルGPUよりも最大34.2倍速く、従来の専用アクセラレータよりも6.1倍高速でした。さらに重要なことに、消費電力は最大822分の1に抑えられました。これは、バッテリー駆動のロボットにとって非常に大きなことです。チームはまた、これらのショートカットによってロボットが混乱しないことも確認しました。精度はほぼ正確に維持されており、パフォーマンスの低下は無視できるほど微々たるものでした。
要するに、Deltorisは、「何を」計算するか(変化した部分のみ)と、「どのように」計算するか(予測をグループ化する)について賢くなることで、具現化されたAI(Embodied AI)が現実世界でリアルタイムに動くために必要なスピードと効率性をようやく提供できることを示しています。これは、ロボットが単に考えるだけでなく、私たちと同じ速さで行動できるようになるための重要な一歩なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。