← 最新の論文
🤖 machine learning

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

REFACTOR-VLAは、行動断片を行動等価性カーネルと潜在世界モデルを通じてクラスタリングすることで、再利用可能で型付けされた運動プログラムを学習する覚醒/睡眠フレームワークであり、ライブラリ条件付きデコーダと、モデルの容量よりもクラスタリングの質を優先する学習目的関数を通じて、LIBEROの長期間タスクにおいて最先端の性能を達成している。

原著者: Riyaaz Shaik, Chandru Venkataraman

公開日 2026-09-02
📖 1 分で読めます☕ さくっと読める

原著者: Riyaaz Shaik, Chandru Venkataraman

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは、世界の捉え方や移動の能力は向上していますが、人間が容易にこなすような複雑で多段階の作業には依然として苦戦しています。人がサンドイッチを作る際、パンを掴む、バターを塗る、あるいはトマトをスライスするといった、一つ一つの筋肉の微細な動きについて考えることはありません。その代わりに、彼らは「掴む」「塗る」「切る」といった、慣れ親しんだ動作のメンタル・ライブラリ(心の図書室)に頼り、それらを異なる順序で組み合わせることができます。現在のロボット用人工知能モデルの多くは、このような行動を整理する能力に欠けています。それらは、動作を再利用可能な明確なスキルへとグループ化することなく、生の、瞬間瞬間のコマンドを生成する傾向があります。このことが、長期的なタスクに向けた計画立案や、学習した内容の説明を困難にしています。現在、研究者たちは、機械が自らのスキル・ライブラリを構築することを教え、複雑な仕事を、再利用可能で組み合わせ可能な小さな管理可能な断片へと分解できるようにしようと試みています。

Appleの研究チームは、ラベル付けなしでロボットに自律的にスキルを発見させることを目的とした、「REFACTOR-VLA」と呼ばれる新しいシステムを開発しました。このシステムは、人間が新しい動きを練習した後に、脳が記憶を整理するために休息をとるのとよく似た、2つの交互のフェーズで機能します。第一のフェーズでは、ロボットはある一連の動きを実行した場合に次に何が起こるかを予測することを学びます。これにより、自身の行動が環境をどのように変化させるかを理解するという、世界のメンタルモデルを構築します。第二のフェーズでは、システムは収集した膨大な運動データを確認し、パターンを見つけ出そうとします。そして、シンプルながらも難しい問いを投げかけます。「2つの異なる一連の動きは、同じ結果をもたらすか?」という問いです。もしロボットがコップを拾うために腕を円形に動かしたとしても、あるいは直線的に動かしたとしても、システムはその両方の経路が同じ目標を達成することを認識する必要があります。

これに応えるため、研究者たちは、動作の外見だけでなく、その結果を測定する特別なツールを作成しました。ロボットが動いている生のビデオを見る代わりに、システムは学習したメンタルモデル内でその動作をシミュレートし、ロボットがどこに到達し、どのような報酬を得るかを確認します。もし2つの異なる動きの経路が、同じ最終状態と報酬をもたらすのであれば、システムはそれらを等価であるとみなします。そして、これらの類似した経路を、単一の再利用可能なスキルへとグループ化します。グループが形成されると、システムはそのスキルの共通のパターンを記述する、シンプルで構造化されたプログラムを書こうと試みます。このプログラムは、その後ライブラリに追加されます。ロボットは後にこのライブラリを使用して新しいタスクを計画することができ、すべての微細な動きをゼロから計算する代わりに、これらのパッケージ化されたスキルを呼び出すことができます。

研究者たちは、シミュレーション環境内で物体を動かす標準的な一連のロボットタスクを用いて、このアプローチをテストしました。彼らは、これらのシステムがどのように学習するかについて、驚くべき発見をしました。人工知能における一般的な信念は、モデルをより大きく、より複雑にすれば常にパフォーマンスが向上するというものですが、研究者が世界モデルのパラメータ数を約1億8800万から4億3000万に増やしたところ、システムはすべてのテストスイートにおいて性能が低下しました。より大きなモデルはスキルを正しく整理することに失敗しており、単にコンピューティング・パワーを増強することが解決策ではないことを示唆しています。

むしろ、成功の鍵は、モデルのトレーニング方法にありました。研究者たちは、初期のトレーニングフェーズ中に特定の種類の学習目的を追加することで、結果が劇的に改善されることを見出しました。この目的は、システムが異なるタスクをより明確に区別するのを助け、類似した動きをより効果的にグループ化することを可能にしました。この変更により、システムは4つの主要なテストスイートすべてにおいて既存の最強の手法を上回り、平均スコアを大幅に向上させました。システムは、特定のタスクに対して3つの明確で再利用可能なスキルからなるライブラリを正常に構築し、このライブラリを使用するロボットは、これまで見たすべてのデモンストレーションを、これらの新しいスキルを用いて書き換えることができました。

この研究はまた、システムのスキル発見能力が、分析するデータの種類に大きく依存していることも明らかにしました。システムは、「物体を拾ってバスケットに入れる」といった言語ベースの指示に基づくライブラリは正常に作成できましたが、生の運動コマンド自体の中に再利用可能なパターンを見つけることはできませんでした。これは、システムが、動き方の低レベルな物理的詳細よりも、タスクの高レベルな目標を理解することに長けていることを示唆しています。研究者たちは、多くの異なるトレーニング実行にわたって結果の一貫性を測定し、システムが同様のスキル・グルーピングを確実に発見しており、異なるバージョンのモデル間で高い一致度があることを見出しました。

この研究は、ロボットがどのように経験を整理して学ぶかは、その「脳」の純粋な大きさよりも重要であることを証明しています。行動の結果に焦点を当て、それらをグループ化する構造化された手法を用いることで、システムは複雑で長期的なタスクに取り組むのに役立つスキルのライブラリを構築できます。これらの知見は、「大きいことは常に良い」という考えに異を唱え、ロボットが人間と同じように、再利用可能なアクションという概念で思考することを学ぶ未来へと向かう道筋を示しています。研究者たちは、他の人々がこれらの結果を検証し、この新しいアプローチをさらに発展させられるよう、コードとデータを公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →