← 最新の論文
💻 computer science

ViBe: Visual Behavior Adaptation for Perceptive Humanoid Whole-Body Control

ViBeは、低ランクアダプターを介してタスクに関連する視覚的フィードバックを移植することで、モーショントラッカーを知覚的なヒューマノイド全身制御へと適応させる、パラメータ効率の高いポストトレーニングフレームワークであり、多様な移動および操作タスクにわたる堅牢なゼロショットのsim-to-real転送を可能にする。

原著者: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

公開日 2026-09-10
📖 1 分で読めます☕ さくっと読める

原著者: Lokesh Krishna, Sarvesh Venkatesan, An Zhang, Quan Nguyen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人間のように歩き、動くロボットは長年の工学的な目標であったが、現実世界でそれを行わせることは二つの明確な部分からなるパズルのようなものである。第一に、人間の動きを模倣する能力であり、これは研究者が膨大な人間の動作データのライブラリをコピーするように機械を訓練することで習得してきたスキルである。これらの「トラッカー」はスクリプトに従うことには非常に優れており、平坦で予測可能な地面の上では、手足を自然かつ流暢に動かすことができる。しかし、これらは意図的に周囲の状況が見えないように設計されており、縁石やボール、あるいは箱を見ることができない。第二に、世界を認識し、それに反応する能力がある。従来、エンジニアはこの問題を解決するために、「プランナー(計画立案者)」として機能する別個のシステムを構築してきました。それは環境を観察し、ロボットが何をすべきかを決定し、その後に盲目のトラッカーに対してその計画を実行するよう指示を出します。この分離は機能しますが、そこにギャップを生み出します。トラッカーは、岩を避けるために足をずらしたり、飛んでくる物体を避けたりといった、小さく即時的な調整を行うことができません。なぜなら、上層部からの指示を待っているからです。そこには、考えなしにつまずいて回復できる人間に備わった視覚的反射神経が欠けているのです。

サザンカリフォルニア大学の研究チームは、このギャップを埋める新しい方法を開発し、ロボットが移動しながら直接見て反応することを可能にしました。彼らは自らのシステムをViBeと呼び、すでに人間のように歩くように訓練されたロボットに対し、ゼロから歩行を再学習させることなく、見たものに基づいて動きを適応させる能力を与える手法です。新しい脳や新しいプランナーを構築する代わりに、彼らはロボットの目と筋肉の間に、小型で効率的なインターフェースを挿入しました。このインターフェースは、タスクにとって重要な特定の視覚的詳細(例えば、縁石の端やボールの位置など)を選び出し、その情報をロボットの運動システムに直接送り込むことを学びます。その結果、不整地でのパークール、投げられたボールの回避、手に持った立方体の向きを変えるといった複雑でダイナミックなタスクを遂行しながらも、元々教え込まれた自然で人間らしい動きを維持できるマシンが誕生しました。

研究者たちは、最初から平坦な地上で完璧に人間の動きを追跡できるようになったロボットから始めました。このロボットは、歩行のステップを導くためのカメラ画像を使用していないという意味で「盲目」でした。単に設定された一連の動きに従っていただけなのです。視覚を与えるために、チームは事前に訓練されたビジュアル・システム(数百万枚の画像から物体やシーンを識別することを既に学習しているもの)を取り付けました。しかし、単にカメラ映像を見せるだけでは十分ではありませんでした。ロボットは画像のどの部分が重要なのかを知る必要があったのです。壁のようなピクセルの集合体にはあまりにも多くの情報が含まれており、その大部分は歩行や回避というタスクにおいては無関係です。そこでチームは、フィルターとして機能する小さなモジュールである「エクストラクター(抽出器)」を設計しました。これは、ロボットの現在の姿勢と実行しようとしているタスクを考慮した上で、カメラ画像をスキャンし、最も有用な視覚的手掛かりのみを選択します。もしロボットが縁石を飛び越えようとしているなら、エッジの部分に焦点を合わせます。もしボールを捕まえようとしているなら、その軌道に焦点を合わせます。

選択された視覚情報は、ロボットの内部設定のごくわずかな部分のみを変更するテクニックを通じて、ロボットの運動システムへと注入されます。研究者たちは元のモーション・トラッカーを凍結させて保持することで、その自然で人間らしい歩容を守り、新たに導入された視覚データを運ぶ小さな経路のみを調整しました。このアプローチにより、強化学習と呼ばれる手法を用いて、特定のタスクに向けてロボットを訓練することができました。強化学習とは、成功した行動に対して報酬を受け取ることで、試行錯誤を通じて学ぶ方法です。彼らはこのシステムを四つの極めて異なる課題でテストしました。一つ目は、段差のある地形を歩いたり走ったりして、転倒を避けるためにリアルタイムで足の位置を調整しなければならない課題です。二つ目は、隙間を跳び越え、狭い面に着地するというパークールの課題です。三つ目は大きな物体を扱うものであり、スーツケースやゴミ箱を運びながらバランスとグリップを調整する必要があります。最後の課題はドッジボールで、ロボットは静止した状態で、自分に向かって飛んでくるボールを注視し、転倒することなく体を動かして避ける必要があります。

結果は、この手法が驚くほど上手くいったことを示しました。実世界でのテストにおいて、ロボットはこれらのタスクを高精度で遂行し、しばしば、現実のロボットが得られないはずの完全で特権的な環境情報を与えられているシステムと同等のパフォーマンスを発揮しました。例えば、パークールの課題では、盲目の同型ロボットが衝突して転倒してしまうような障害物に対しても、ロボットは見事にナビゲートすることに成功しました。ドッジボールのシナリオでは、ロボットは標準的な直立ポーズから制御された形で反応的に逸脱する必要がありましたが、バランスを保ちつつボールを避けることを学習しました。また、照明が明るい日光から薄暗い屋内条件に変わったり、オブジェクトの色が変わったりした場合でも、システムは堅牢に機能することも分かりました。これは、ロボットが特定の色彩やテクスチャを記憶したのではなく、物の形状や位置を理解することを学んだことを示唆しています。

ロボットが本当に見ているものに対して反応していることを証明するため、研究者はこれを「見ることができないバージョン」と比較しました。基礎となる運動トレーニングは同じであっても、盲目のロボットは縁石を横切ることや障害物を避けることに失敗し、コースを外れたり物に衝突したりすることが頻繁にありました。一方、視覚を持つバージョンは、自身の動きに対して精密かつ局所的な修正を行いました。縁石に着地するために足の位置を調整し、重いものを運ぶために重心を移し、そしてボウルを避けるために体を動かしたのでした。これらは大規模で事前計画された操縦ではなく、ロボットが動いている最中に行われる、小さく即時的な調整でした。さらにチームは、この視覚的適応が単純な高レベル・プランナーと組み合わせることができることも実証しました。キューブの特定の色の面が上に来るように方向を変えるタスクにおいて、非常に基本的なプランナーが手順としての動きを選択すると、ロボットの視覚システムが、キューブを探し、掴み、たとえキューブが予想と少し異なる位置にあっても、成功のためにグリップを調整するという困難な作業を担当したのです。

本研究は、ロボットがいかにして世界と相互作用するかを教える方法における重大な転換を浮き彫りにしています。新しいタスクごとにロボットを一から訓練したり、複雑で独立したプランニング・システムに頼ったりするのではなく、すでに動き方を知っているロボットに対し、見る能力とその反応力を与えることが可能です。研究者たちは、核となる運動スキルを損なわずに、視覚と行動を結ぶ小さな接続部のみを訓練することで、自然な動きを持ちつつ、現実世界の予測不能な事態に対処できるロボットを作り出せると示しました。このシステムは完璧ではなく、高速で動く物体や珍しい視覚的妨害によって混乱することもありますが、強力な一歩となります。これは、ロボットがすべてを最初から教えられる必要はなく、何を見るべきかを学ぶだけで、既存のスキルを新しい状況に適応させられることを示しています。このアプローチは、私たちが人間に対して期待するような流暢さと適応力を持って私たちの世界を動き回れるヒューマノイドを作成するための、実践的な道筋を提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →