RHO: Your Coding Agent is Secretly a Roboticist
本論文は、ツールを活用したコーディングエージェントが環境からのフィードバックを用いて解釈可能なマルチファイル構成のニューロシンボリック・ポリシー・リポジトリを探索する、ロボティクス・ハーネス最適化(RHO)という新しい学習パラダイムを導入しており、これによりリアルタイムのロボティクス・タスクにおいて既存のマルチターン・エージェント・システムを上回る最先端の性能と優れた効率性を達成している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにコップを持ち上げ、テーブルの上に置く方法を教えようとしている場面を想像してください。
旧来の方法:その場しのぎのプログラマー
以前は、この作業を行うための最善策は、非常に賢いAI(大規模言語モデル)が、取り乱したプログラマーのように振る舞うことでした。ロボットがコップを落としたり、テーブルに届かなかったりするたびに、AIは一旦停止して考え、ミスを修正するための新しいコードを書き、そして再試行します。これは、シェフがスープを味見し、塩が必要だと気づいたとき、調理を止めて新しいレシピを書き、最初から作り直すようなものです。これでも機能はしますが、遅くて雑であり、ロボットは常に指示を書き直すために一時停止してしまうため、現実世界で役に立つほど速く動くことができません。
新しい方法:RHO(「試合前」のコーチ)
この論文では、RHO(Robotics Harness Optimization)を紹介しています。RHOは、ロボットが動いている最中にAIにコードを書かせるのではなく、トレーニング中に、厳しく、かつ内省的なコーチとして振る舞います。
RHOの仕組みを、簡単な比喩を使って説明します。
1. 「リポジトリ」(単なるメモではなく、道具箱全体)
ほとんどのAIシステムは、一つの文章や小さな関数を微調整することでロボットを修正しようとします(例:レシピの材料を一つだけ変えるようなもの)。しかし、RHOは異なります。RHOは、ロボットの脳をファイル全体のライブラリ(「リポジトリ」)として扱います。
- 比喩: ロボットの脳は、単なる指示が書かれた付箋ではなく、マニュアル、道具一式、安全チェックリスト、そしてナビゲーションマップを備えた、完全なワークショップ(作業場)なのです。RHOは単に付箋を書き換えるのではなく、ワークショップ全体を再編成し、道具を入れ替え、マニュアルをすべて書き換えます。
2. 「ツールを活用できるエージェント」(実際にモノを作れる弟子)
RHOは、単なるテキスト生成器ではない、特別なAIエージェントを使用します。それは**「手を持つコーディング・エージェント」**です。
- 比喩: このエージェントは、単にロボットの直し方を言葉で語るだけでなく、ロボットのコードファイルを開き、テストを実行し、ロボットの「ビデオフィード」を見て何が失敗したかを確認し、エラーログをチェックした上で、実際にコードを書き換えることができます。これは、マニュアルを読み、レンチを掴んでエンジンを修理し、その後すぐに試乗テストまでこなす弟子のようです。
3. 「進化的な探索」(適者生存)
RHOは、たった一つの修正を試みるだけではありません。進化のプロセスを実行します。
- 比喩: トーナメントを想像してください。AIは、ロボットの「脳」の異なるバージョン(異なるコード・リポジトリ)を100個作成します。そして、それらをすべてシミュレーションの中に送り込み、タスクを実行させます。
- 無残に失敗するものもあります。
- まあまあの結果を出したものもあります。
- いくつかは素晴らしい成果を出します。
AIは、これら「勝者」たちの優れた特徴を混ぜ合わせ、新しい世代の100体のロボットを作り出します。これを何百回も繰り返します。
重要なのは、**「パレート・フロント」**を維持することです。これは、あらゆる面で最高であるロボットを保持するのではなく、「この特定のタスクにおいて」最高であるロボットを保持することを意味します。これにより、特定の仕事で失敗する汎用的な存在ではなく、専門家としてのロボットが保証されます。
4. 結果:「即戦力の」ロボット
トレーニングの終了時、RHOは単一の、完璧な「リポジトリ」(完全なコードファイル一式)を生み出します。
- 魔法のような効果: このロボットを実世界に配備(デプロイ)するとき、もはやAIが考える必要はありません。 コードを書き直すために停止することもなく、ただ事前に書き込まれた、高度に最適化されたコードを実行するだけです。
- 比喩: これは、テスト中にすべての数学の公式を調べている学生と、すでに公式を暗記し、何千もの問題を練習してきた学生の違いのようなものです。RHOのロボットは、「宿題(トレーニング)」の段階で既に厳しい努力を終えており、テスト(デプロイ)に即座に合格できる準備ができている学生なのです。
彼らは実際に何を達成したのか?
論文によれば、この手法は現在の最先端技術よりも大幅に優れています。
- 速度と信頼性: 標準的なロボットのベンチマーク(ブロックを積み上げる、物体を移動させるなど)において、RHOは一度の高速な実行で70%の成功率を達成しました。以前の最良の手法(AIが絶えず停止してコードを書き直す必要があったもの)は、**68%**であり、速度も大幅に遅いものでした。
- 混沌への対応: 研究者がルールを変更した場合(オブジェクトの位置を変えたり、タスクの説明を変えたりした場合)、他のAIモデル(OpenVLAなど)は完全に失敗(成功率0%)しました。しかし、RHOは依然として**45%**の確率で成功しました。
- 効率性: より複雑な実世界のシミュレーションにおいて、RHOはロボットの「思考」時間を20%削減し、呼び出すツールの数を27%減らしながら、成功率を倍増させました。
まとめ
RHOは、重い作業をデプロイ時(ロボットが働いている時)からトレーニング時(ロボットが学習している時)へと移行させることで、ゲームのルールを変えました。賢く、ツールを使いこなすAIを用いることで、堅牢で、人間が読解可能(解釈可能)な、そして即座に実行可能な完全なマルチファイル・コードライブラリを進化させます。これにより、実行中にスーパーコンピュータを使って指示を書き直すことなく、即座に動作することが可能になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。