← 最新の論文
💬 NLP

R3R^3: Training Robots to Reason in Natural Language via Reinforcement Learning

本論文は、既存の視覚言語モデルを、低レベルの操作方策のための自由形式の自然言語ガイダンスを生成可能なロボット推論器へと強化するポストトレーニング・フレームワークであるR3R^3を導入しており、これは、エキスパートの軌跡を用いた中間学習とルーブリックに基づく強化学習の組み合わせを通じて、長期的なタスクにおける探索と汎化性能を大幅に向上させるものである。

原著者: Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

公開日 2026-08-27
📖 1 分で読めます☕ さくっと読める

原著者: Lehong Wu, Yuxiao Qu, Zheyuan Hu, Ivan Zhang, Limin Wei, Zackory Erickson, Aviral Kumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは長らく反復の達人であり、同じ動作を数千回、完璧な精度で実行することができます。しかし、新しい状況に直面したり、ミスをしたりすると、しばしば躓いてしまいます。彼らには、立ち止まって何が間違っていたのかを考え抜く能力が欠けているのです。この限界は、世界を「見る」ことと、世界を「理解する」ことの間の溝に起因しています。現代の人工知能は、視覚と言語の両面で進歩を遂げ、機械が物体を認識し、音声コマンドに従うことを可能にしました。しかし、これらの能力を物理的な行動へと結びつけ、柔軟な問題解決を可能にする方法を見出すことは、依然として大きな課題です。最近の研究を突き動かしている核心的な問いは、ロボットに動く前に言葉で「考える」能力を与えることが、計画を立て、進捗を追跡し、エラーから回復することを必要とする複雑で長期的なタスクをナビゲートする助けになるのかどうか、という点です。

カーネギーメロン大学の研究チームは、ロボットにこのような思考法を教える新しい手法を開発しました。彼らは、高レベルの人工知能が自然言語による推論(本質的には、ロボットが次に行うべきことについての逐一の解説)を生成させ、その後に、実際にロボットの腕を動かす低レベルのコントローラーにコマンドを発行するように訓練するシステムを作成しました。研究者たちは、これらの「思考」を生成するようにシステムを訓練することで、ブロックを特定の形に並べたり、食料品を袋に詰めたりといった困難な操作タスクを解決する能力が大幅に向上することを発見しました。重要な発見は、これらの思考をリアルタイムで生成するという行為が、単なる訓練ツールとして使用する場合ではなく、ロボットが自身の行動をより効果的に操舵するための一種のメンタル・コンピュテーション(精神的な計算)として機能するという点です。

研究者たちは、ロボットの脳を二部構成のシステムとして扱うことで、この問題に取り組みました。一方のパーツは「推論器(reasoner)」であり、これは場面と目標を見る大規模言語モデルです。もう一方は「実行器(doer)」であり、物理的な動きを実行する事前学習済みのポリシーです。実験において、推論器は現在の世界の状況、これまでに起こった履歴、そして最終目標を観察する任務を負い、具体的な指示を実行器に出す前に、自身の計画に関する短い説明を書き出すよう求められました。例えば、目標がブロックを一直線に並べることであった場合、推論器は「緑色のブロックはすでに配置されている」「星型のブロックが位置から外れている」といったことをまず指摘し、次に「線を完成させるために星型のブロックを移動させる」と決定します。この推論を書き出すプロセスは、ロボットがステップを踏むたびに行われます。

このシステムを教えるために、研究者たちは二段階の訓練プロセスを用いました。まず、エキスパートが自身の思考プロセスを言葉にしながらタスクを解決している例をシステムに示しました。彼らが「中間訓練(mid-training)」と呼ぶこのステップは、部分的な進捗を追跡したり、計画が失敗したことに気づいたりといった、物理的タスクに必要な推論のスタイルをモデルに学習させるのに役立ちました。しかし、単にこれらの例を模倣するだけでは不十分でした。そこで研究者たちは、試行錯誤に基づいてフィードバックを得る手法である強化学習を用いた第二段階を用いました。この段階では、ロボットにタスクを与え、自身の推論と指示を生成させました。ロボットには、最終的な結果だけでなく、生成された指示がエキスパートの指示の意図と一致しているかどうかに対して報酬が与えられました。これにより、システムは、すべての動きに対してエキスパートの思考の例を集めるという高コストな作業を行うことなく、最終的な指示のみが既知である膨大なデータを用いて、自身の推論スキルを洗練させることができました。

実験の結果は、二つの異なる環境で測定されました。一つ目は、色とりどりのブロックで満たされたシミュレーション上のテーブルで、ロボットはそれらを線やV字型などの形に並べる必要がありました。二つ目は、二本腕のロボットが食料品を袋に詰める、より複雑なシミュレーションです。どちらの場合も、この推論メソッド(研究者がR3と命名)で訓練されたシステムは、思考を生成せずに指示に従うようにのみ訓練されたシステムを上回りました。ブロック配置タスクにおいて、推論機能を備えたロボットは、未知の新しい形状に対しても顕著な汎化能力を示し、他の手法が失敗する場面でも成功しました。食料品梱包のシミュレーションでは、思考によって行動を推論できるロボットは、困難な未知のタスクにおいて約47.9パーセントの成功率を達成しましたが、思考せずに単に指示に従うだけのシステムは約38.0パーセントでした。

決定的なことに、研究者たちは、この改善が訓練中にロボットがより良い視覚パターンを学習したことによるものなのか、それとも思考するという行為そのものによるものなのかを調査しました。その結果、訓練によってシーンを理解する能力は向上したものの、真の恩恵は意思決定の瞬間に起きている推論プロセスから来ていることが分かりました。ロボットに思考の生成を強制的に停止させ、ただ行動させたところ、そのパフォーマンスは大幅に低下しました。逆に、より長く詳細な思考を生成するために時間をかけることを許可すると、特に困難なタスクにおいて成功率が上昇しました。このことは、言語による推論が、人間が複雑なパズルを解く前に立ち止まって考え込むように、ロボットが難しい問題に対して追加の精神的努力を注ぐためのメカニズムとして機能していることを示唆しています。

また、この研究は、推論システムが学習した具体的な行動についても明らかにしました。ロボットは、一つの行動を選択する前に複数の可能な行動を比較し始め、物体の位置に確信が持てないときは場面を再検証し、以前のステップが失敗したと気づいたときには計画を調整し始めました。また、自身の相互作用の履歴を追跡し、間違いを繰り返さないように既に行ったことを記憶することも学びました。これらの行動は明示的にプログラミングされたものではなく、システムが行動を導くために言語を使用することを学ぶ過程で自然に現れたものです。研究者たちは、第二段階の訓練において、エキスパートの思考に関する明示的な例を与えなくても、最終的な指示から正しい推論を推論するシステムの能力に依存することで、この手法が機能したことを指摘しました。

実験はシミュレーション環境で行われましたが、その知見は、より適応性の高いロボットを作るための明確な道筋を示しています。研究者たちは、この手法を実世界のロボットに応用することで、ノイズの多いセンサーへの対処や衝突からの回復といった、物理的タスクの予測不可能性に対処できる可能性があると示唆しています。また、将来の研究として、推論部分と行動部分を切り離すのではなく、これらを統合して訓練することで、より協調的な振る舞いを生み出せる可能性についても言及しています。現時点において、この研究は、ロボットに自分が行っていることについて「独り言」を言わせる能力を与えることが、単なる理論的な演習ではなく、複雑で長期的な問題を解決する能力を高めるための実用的な方法であることを証明しています。システムは完璧である必要はありません。単にステップを考え抜くことができれば、それだけで、単に反応するだけの機械よりもはるかに有能な存在となるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →