Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models
本論文は、潜在的な特徴量を独立したコードブックを持つ特化したヘッドへと分解することで、微細なアクションのダイナミクスをより適切に捉え、再構成誤差を大幅に削減し、Vision-Language-Actionモデルの性能を向上させる、新しいマルチヘッド・マルチコードブック・アクション・トークナイザーであるTokを提案している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットは長らく、人間の手の持つ流れるような優雅な動きに苦戦してきました。現代の人工知能は詩を書き、病気を診断し、見事な画像を生成できるようになりましたが、機械に物理的に世界を操作する能力を与えることは、依然として困難な課題のままです。問題の核心は、コンピュータがどのように動きを理解するかという点にあります。テキストは個別の文字で構成され、画像はピクセルで構成されていますが、ロボットアームの物理的な動作は連続的なデータの流れです。ロボットアームは単に一つの位置から別の位置へと飛び跳ねるのではなく、その間にある無限の微細な位置を通り抜けて流れていきます。今日のAIを動かしている強力な言語モデルを用いてロボットを教えるには、エンジニアはまず、この滑らかで連続的な動きを、まるで流れる川を個々のビーズの列に変えるかのように、一連の離散的なステップへと翻訳しなければなりません。この翻訳プロセスは「トークン化」と呼ばれます。もし翻訳が粗すぎれば、ロボットは動きの細部を失い、繊細な作業に失敗するぎこちなく不正確な動作になってしまいます。逆に翻訳が複雑すぎると、コンピュータはリアルタイムで反応できるほど速く処理することができません。
長年、研究者たちはこの翻訳問題を解決しようと試みてきましたが、既存の手法はしばしば「丸い穴に四角い杭を打ち込む(不適合なものを無理に当てはめる)」ようなものでした。あらゆる動きを単純な固定カテゴリのリストとして扱う手法は、ステップ間の微妙なタイミングや関係性を無視してしまいます。また、動きをグループ化してデータを圧縮しようとする手法もありますが、それらは手首の正確な角度やグリッパーの優しい握りといった、精密な制御に必要な特定の詳細を失ってしまうことがよくあります。この詳細の喪失がボトルネックとなり、壊れやすい物体を積み重ねたり、複雑な部品を組み立てたりといった高度なスキルを学習することを妨げています。その結果、ロボットは広範で単純なタスクは実行できるものの、現実世界の微妙な要求に直面すると躓いてしまうのです。
研究チームは現在、動きの豊かさを維持しながら、現代のAIが処理できるほどデータをコンパクトに保つ新しい翻訳方法を提案しています。彼らは、連続的なロボットの動作の流れを、言語モデルが理解できる形式へと、成功に必要な微細なダイナミクスを失うことなく分解するように設計されたツール「M2Tok」と呼ぶシステムを開発しました。ロボットの全身を一つの巨大なデータの塊として扱うのではなく、彼らのアプローチは動きを別々の特化したチャンネルに分割します。例えば、ロボットアームが肩、肘、手首、そしてグリッパーを同時に動かす必要がある場面を想像してください。古い手法では、これらすべての異なる動きを一つの単一のコードに圧縮しようとし、その結果、アームの精度を取るかグリッパーの精度を取るかの選択をシステムに強いることがよくありました。しかし、この新手法はこれらの動きを別々のグループに分離することで、AIが各部位の特定のニュ Nuance(ニュアンス)に独立して集中できるようにしています。
研究者たちは、ロボットの動きのデータを複数の「ヘッド」に分割することでこれを実現しました。各ヘッドは動きの異なる側面を担当します。あるヘッドはアームの位置を追跡し、別のヘッドはグリッパーの開閉を追跡します。決定的なのは、これらの各ヘッドが独自の独立した動きの辞書を使用している点です。複数の辞書を並行して使用することで、システムは単一の辞書が提供できるよりもはるかに多くの、膨大な数の組み合わせを作り出すことができます。この組み合わせの力により、システムは非常に高い精度で、より幅広い種類の動きを表現することが可能になります。これは、音楽家が異なる楽器間で限られた音符を組み合わせることで無限のメロディを生み出せるのと似ています。新しいシステムは、ロボットの体の異なる「楽器」の間で限られた動きのコードを組み合わせることで、複雑な動作を驚異的な忠実度で再現するのです。
このアイデアをテストするため、研究者たちはブロックにハンマーで叩きつけることから、多様なボトルの持ち上げ、容器を皿の上に置くことまで、シミュレーション上の幅広いロボットタスクを用いてシステムを訓練しました。彼らはこの新手法を、この分野で使用されてきたいくつかの既存技術と比較しました。結果は、この新しいアプローチの明確な優位性を示しました。12種類の異なるシミュレーションタスクにおいて、新手法を用いたロボットは試行の51パーセントで成功し、次点の優れた手法が45パーセントの成功率であったことを大きく上回りました。困難で高い精度を要するタスクでは、その差はさらに劇的でした。例えば、缶を鍋に移動させるタスクでは、新手法は従来の最良のアプローチよりもほぼ2倍高い成功率を記録しました。また、バーガーとフライドポテコの箱をトレイに乗せるタスクでは、新手法は64パーセントの成功率を達成しましたが、従来の最良の手法は52パーセントにとどまりました。
研究者たちはまた、習得したスキルが新しい状況に転移できるかどうかを確認するために、異なる一連のシミュレーション環境でもシステムをテストしました。ここでも新手法は優れたパフォーマンスを発揮し、既存の主要な代替案が21パーセントであったのに対し、28パーセントの成功率を達成しました。最も顕著な違いは、ナスを持ち上げてバスケットに入れるタスクで見られました。ナスは形状が不規則で掴みにくい物体ですが、従来の手法はこのタスクを全く解決できませんでした。しかし、新手法は33パーセントの確率で成功しており、その微細な詳細を捉える能力が、他の手法では不可能だった複雑な物体の幾何学的構造に対処できたことを示唆しています。
これらの結果が単なるシミュレーションの産物ではないことを確認するため、チームは訓練したモデルを実世界のロボットに持ち込みました。彼らは4本のロボットアームとカメラを備えた移動プラットフォームを使用し、ベルを鳴らす、容器を皿に置く、さまざまなボトルを掴むという3つの異なるタスクをロボットに依頼しました。これらは「ゼロショット」テストであり、つまりロボットはこれらの特定の現実世界の物体や環境を一度も見たことがなく、シミュレーションで学んだことに完全に依存して実行しなければならないテストです。新手法はここでも他を圧倒し、3つのタスク全体で平均33パーセントの成功率を達成しました(最善の代替案の最大値は28パーセント)。テストからの視覚的な証拠は、ロボットが物体の位置を特定し、正確な把持操作を実行していることを示しており、動きのデータの高品質な翻訳が、ロボットがコンピュータを離れて物理的な世界に入ったときにも通用することを裏付けました。
精度を超えて、研究者たちはシステムがどれだけ速く動作できるかについても調査しました。ロボットが有用であるためには、環境に反応できるほど迅速に意思決定を行う必要があります。この新手法により、ロボットは8ヘルツ以上の頻度で動作でき、つまり1秒間に8回以上の意思決定ができるようになりました。これは、わずか2ヘルツで動作していた古い手法に比べて大幅な改善です。さらに、研究者が専用のプロセッシングエンジンを使用して速度を最適化したところ、ロボットは56ヘルツに達し、ほとんどのリアルタイム操作タスクに求められる速度をはるかに超えました。この高い精度と高速性の組み合わせは、この新手法が動的な環境における高度なロボットの配備に対する実用的な解決策となり得ることを示唆しています。
この研究の成功は、動きのデータがどのように処理されるかという根本的な転換に基づいています。すべての動きを一律のコードに圧縮するという考えを拒絶することで、研究者たちは、システムがロボットの体の異なる部位のユニークな性質を尊重することを可能にしました。動きを独立したチャンネルに分離し、複数の特化した辞書を組み合わせることで、従来の手法が見逃していた、動きの微妙で高周波な詳細を捉えることができるシステムが構築されました。このアプローチは、ロボットを駆動する言語モデルの基礎となるアーキテクチャを変更する必要はなく、むしろ、そのモデルにデータを供給するためのより優れた方法を提供したのです。その結果、ロボットは、以前は手の届かなかったレベルの器用さを持って、複雑な物理的タスクを理解し実行できるようになり、言語モデルのデジタルな知性と、それがナビゲートすべき世界の物理的な現実との間の溝を埋めたのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。