OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRLは、軽量なプロキシとKubernetesオーケストレーターを介して推論と学習を分離することにより、多様な環境におけるハーネスネイティブなAIエージェントのエンドツーエンドの学習を可能にし、複雑なツールおよびGUIベンチマークにおいて最先端の性能を達成すると同時に、ハーネスの選択と強化学習がいかにエージェントの振る舞いを形成するかについての洞察を提供するオープンソースのフレームワークです。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
コンピュータが単に質問に答えるだけでなく、あなたの代わりに「行動」する世界を想像してみてください。コードを書き、航空券を予約し、デジタルファイルを整理することもできます。これを実現するために、科学者たちは「AIエージェント」を構築してきました。これらは、思考し、計画を立て、ツールを使いこなすことができるスマートなプログラムです。しかし、ここが難しいところです。これらのエージェントは真空状態で動いているわけではありません。彼らには「ハーネス(装着具)」、つまり複雑な制御室や専用のコックピットが必要です。このハーネスは、エージェントのメモリを管理し、インターネットに接続し、計算機やウェブブラウザのようなツールを使えるようにします。ハーネスをパイロットの座席、エージェントをパイロットだと考えてください。ビデオゲームの中でパイロットを訓練しただけで、本物の747を飛ばせると期待することはできません。実機の飛行機には、ビデオゲームでは決して示されなかった特定のボタン、緊急プロトコル、そしてコックピットのレイアウトが存在するからです。
長い間、大きな問題がありました。「ビデオゲーム」(単純な訓練環境)が「実機の飛行機」(実世界で使用される複雑なハーネス)と一致していなかったのです。研究者たちはエージェントを簡単に訓練できましたが、いざ複雑で混沌とした実世界のハーネスの中に投入すると、エージェントは混乱したり失敗したりすることがよくありました。この論文「OpenForge RL」は、まさにその不一致に取り組むものです。これは、エージェントを最終的に操縦することになる「実機のコックピット」の中で直接訓練する新しい方法を導入しており、訓練施設全体をクラッシュさせることなく、同時に数千種類の異なる「飛行機」で練習できるシステムを提供します。
問題点:ビデオゲームでの訓練 vs 実機の操縦
ロボットに車の修理を教えようとしていると想像してください。もし、エンジンがただの赤いボタンで、タイヤが青い四角形であるような単純なビデオゲームの中で訓練した場合、ロボットは「赤を押す」「青を掴む」ということを学習します。しかし、そのロボットを本物のエンジン、本物のタイヤ、そして無数の道具がある本物のガレージに置くと、ロボットは固まってしまいます。現実の複雑さをどう扱えばよいのか分からなくなるのです。
これは、AIエージェントにおいて起こっていたことです。現代のエージェントは強力ですが、思考やツールを管理するために、洗練された「ハーネス」(Claude CodeやCodexなど)に依存しています。これらのハーネスは実機のコックピットのようなものです。状態を持つメモリ(5ステップ前に何が起きたかを覚えている)、マルチプロセス・ワークフロー(複数のことを同時に実行する)、そして複雑なツール接続を備えています。しかし、研究者がAIを訓練する標準的な方法(強化学習)は、通常、単純でフラットな環境を前提としています。彼らは、エージェントを簡略化されたバージョンのハーネスで訓練しようとしますが、これは「訓練と展開のミスマッチ」を生み出します。それは、パイロットにシミュレーターでブレーキの仕組みを教えず、ブレーキが故障した実機の飛行機を着陸させようとするようなものです。
解決策:OpenForge RL(クラウド上のガレージ)
この論文の著者たちは、大規模なクラウドベースのガレージとして機能するフレームワーク、OpenForge RLを構築しました。実世界の複雑なハーネスを単純な訓練用の箱に押し込もうとするのではなく、OpenForge RLはその逆を行います。訓練用の箱を実世界のハーネスへと送り出すのです。
その仕組みを、遊び心のある比喩を使って説明します:
- リモートポッド(クラウド上のガレージ): クラウド上に、自律走行する小さなガレージの艦隊があると想像してください。各ガレージは、特定の「ハーネス」(特定の車種のようなもの)を保持するコンテナです。OpenForge RLは、「Kubernetesオーケストレーター」(非常に効率的なガレージマネージャーのようなもの)を使用して、これら数千の遠隔ガレージを瞬時に立ち上げます。
- プロキシ(二重合わせ鏡): 各ガレージ内では、AIエージェントがタスクを解決しようと試みます。「軽量プロキシ」は二重合わせ鏡のように機能します。これは、エージェントが実世界のハーネスや実世界の環境(実際のコンピュータやウェブブラウザなど)と対話することを可能にしながら、裏側ですべての動き、思考、ツールのクリックを密かに記録します。
- トレーニングループ: プロキシは、記録されたこれらの「フライトログ」を、標準的なツール(veRLなど)を使用するメインの訓練用脳へと送り返します。脳はこれらの実世界のログから学習し、エージェントの脳を更新し、新しいバージョンのエージェントを再び遠隔ガキージへと送り出し、再挑戦させます。
ここでの魔法は、訓練が実世界のハーネス内、実世界の環境内で行われる一方で、それらすべての異なる環境を管理するという重労働はクラウドによって処理される点にあります。これにより、研究者は新しいツールごとに訓練コードを書き直すことなく、「ZeroClaw」、「OpenClaw」、「Codex」、あるいは視覚的GUIエージェント(マウスとキーボードを使用するエージェント)に対して同時に訓練を行うことができます。
得られた知見:実戦的な訓練がより優れた結果を生む
チームは、2種類のエージェントを用いてこのシステムをテストしました。Clawエージェント(テキストとツールを使用してメールの検索やファイルの管理などを行うもの)と、GUIエージェント(画面を見て、ウェブブラウザやコンピュータ内のボタンをクリックするもの)です。
彼らは、数百万ものデータを使用する巨大なモデルとは異なり、わずか数百から数千のタスクのみを使用してこれらのエージェントを訓練しました。結果は目覚ましいものでした:
- Clawエージェントの場合: 彼らのモデルである OpenForge-Claw は、ClawEvalベンチマークで 31.7 (pass@3)、QwenClawBenchで 33.7 を記録しました。これは、同程度のサイズ(約300億パラメータ)の他のオープンソースモデルよりも大幅に優れた数値です。実際、数倍の大きさを持つモデルよりも高い性能を発揮しました。
- GUIエージェントの場合: 彼らのモデルである OpenForge-GUI は、OSWorld-Verifiedで 37.7、Online-Mind2Webで 63.0、WebVoyagerで 72.3 に達しました。これは大きな成果です。なぜなら、GUIのタスクは極めて困難であり、エージェントは画面を「見て」、どこをクリックすべきかを判断しなければならないからです。OpenForge-GUIは、はるかに大規模で、膨大なデータで訓練されたモデルに匹каる、あるいはそれを上回る成績を収めました。
「ハーネス」の教訓:すべてのコックピットが平等なわけではない
最も興味深い発見の一つは、単に訓練がうまくいったことではなく、異なるハーネスがどのように学習に影響を与えたかという点でした。著者らは、4つの異なるハーネスでエージェントをテストしました:ReACT(単純なループ)、ZeroClaw(軽量)、OpenClaw、そして Codex(非常に複雑)。
彼らは、一部のハーネスは他のものよりも学習がはるかに難しいという事実を発見しました。
- より単純で整合性の取れたハーネス(ZeroClawなど)は、エージェントの学習を速め、より高いパフォーマンスを実現させました。
- より複雑なハーネス(Codexなど)は、習得が困難でした。エージェントはより苦戦し、強化学習(RL)による恩恵を受けたとしても、単純なハーネスと比較してその向上幅は小さかったのです。
このことは、パイロットの訓練と同じくらい、「コックピット」のデザインも重要であることを示唆しています。優れた設計のハーネスは、エージェントをより賢く、より信頼できるものにします。
強化学習(RL)が実際にエージェントに教えたこと
著者らは、基本訓練(SFT)に強化学習(RL)を加えることで、エージェントが実際に何を学んだのかも詳しく調査しました。彼らは、RLが単にエージェントを一般的な意味で「賢く」したのではなく、特に信頼性を向上させたことを発見しました。
- 自己検証(Self-Verification): エージェントは自分の仕事をチェックし始めました。例えば、ファイルを作成した後、それが正しいかどうかを確認するために、そのファイルを読み返す可能性が高まりました。
- ツールの網羅性(Tool Coverage): エージェントは、よく知っている1つや2つのツールだけに固執するのではなく、より多様なツールを使うようになりました。
- エラー回復(Error Recovery): これが最も難しい部分でした。RLは、エージェントが小さなミスから回復するのを助けましたが、エラー回復能力は依然として弱いままでした。訓練後であっても、エージェントが大きなミスを犯した場合、多くの場合、修正できずに諦めてしまうことがありました。著者らは、この特定のスキルをマスターするには、特別なデータや異なる訓練方法が必要である可能性を示唆しています。
結論
OpenForge RLは、AIエージェントを訓練するために現実の世界を単純化する必要はないということを証明しました。訓練と環境を切り離すクラウドベースのシステムを使用することで、エージェントを、実際に使用することになる複雑で混沌とした実世界のハーネスの中で直接訓練することができます。
この論文は、このアプローチによって、研究者がより有能で、かつ特定の業務においてより信頼できるエージェントを構築できることを示唆しています。エージェントは依然として複雑なエラー回復には苦労していますが、「ビデオゲーム」ではなく「実機のコックピット」で訓練できる能力は、大きな前進です。これは、将来、AIエージェントが単なるシミュレーションの中だけでなく、私たちが日常的に使用しているデジタルツールの中で、真に私たちの隣で働けるようになることを意味しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。