← 最新の論文
🤖 AI

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RLは、インプロセスでのLLMプロキシ、堅牢なサンドボックス・オーケストレーション、および統合されたモニタリングを通じて、ネイティブの実行ハーネスと方策勾配最適化を橋渡しすることにより、多様な環境におけるSWE-bench Verified上のモデル性能を大幅に向上させつつ、高い学習・推論アライメントを維持しながら、コーディングエージェントのためのスケーラブルな強化学習を可能にするフレームワークである。

原著者: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界では、研究者たちがコンピュータに自律的なソフトウェアエンジニアとして振る舞うよう教えています。これらのデジタルエージェントは、単に質問に答えるだけではありません。複雑なコードベースを探索し、ツールを使ってバグを修正し、変更が機能するかどうかを確認するためにテストを実行します。これらのスキルを習得するために、エージェントは強化学習と呼ばれる手法を用います。パズルを解く方法を学ぶ学生を想像してみてください。学生は一つの手を試し、それが解決策に近づくものであれば、小さな報酬を受け取ります。時間をかけて、彼らはどの手が成功につながるかを学習していきます。コーディングエージェントの場合、このプロセスには、一連のアクションを生成し、コンピュータプログラムの実行を監視し、書いたコードが実際に問題を解決したかどうかを示す「はい」または「いいえ」という単純な信号を受け取ることが含まれます。課題は、これらのエージェントが、予期せぬ形で物事がうまくいかなくなることもある、乱雑で現実的なコンピューティング環境で動作しているという点にあります。もし環境がクラッシュしたり、報酬システムが欺かれたり、あるいはエージェントの思考を記録しているコンピュータが実際に発言された内容を見失ったりすれば、学習プロセスは崩壊してしまいます。エージェントはシステムを悪用することを学んでしまったり、受け取るフィードバックが信頼できないために学習を停止してしまったりする可能性があるのです。

ある研究チームは、これらの特定の問題を解決するために、LEGO-RLと呼ばれる新しいシステムを開発しました。彼らの目標は、既存の複雑なコーディングエージェントの仕組みを変えることを強制せずに、それらを強力な学習アルゴリズムに接続することでした。エージェントを、特定のツールを使いこなし、特定のワークフローに従う方法を熟知している熟練した作業員と考えてみてください。以前の試みでは、これらの作業員を訓練するために、訓練用ソフトウェアに合わせてワークスペース全体を再構築する必要があることが多く、それが頻繁にエラーを引き起こしたり、作業員の自然な振る舞いを変えてしまったりしました。代わりにLEGO-RLチームは、訓練用ソフトウェアが作業員をそのままの姿で観察できるようにする架け橋を築きました。それは、リアルタイムで全ての動きと思考を捉えつつ、現実世界の混乱から学習プロセスを守るものです。

彼らの解決策の核心は、訓練用コンピュータがエージェントが見ているものと行っていることを正確に把握することを保証するフレームワークです。エージェントが応答を生成するとき、特別なコンポーネントが、他のソフトウェアによって変更や要約が行われる前に、生の言葉のストリームと、エージェントが各単語に対して割り当てた正確な確率をキャプチャします。これは極めて重要です。なぜなら、エージェントの環境を管理するソフトウェアは、スペースを節約するために履歴を書き換えたり情報を圧縮したりすることがあるからです。もし訓練システムがこれらの書き換えられたバージョンに依存してしまうと、エージェントの学習の進捗を、出来事の歪んだ記憶に基づいて計算することになってしまいます。データを生成の瞬間にキャプチャすることで、研究者たちは学習信号がエージェントの実際の決定に対して忠実であることを保証しました。さらに、彼らはエージェントが行った特定の内部的な選択を再生するシステムを構築し、複数の専門化されたパーツを持つ複雑なモデルであっても、正しい経路から学習できるようにしました。

学習プロセスを信頼できるものに保つため、チームは各テストがそれぞれ独立した安全なコンテナ内で実行される、高度に組織化された環境を作成しました。これにより、一つの壊れたテストがシステム全体をクラッシュさせることを防ぎ、エージェントがスコアリングシステムを回避するためのショートカットを見つけることを阻止します。例えば、彼らはテスト中にエージェントから答えを隠し、作業を採点するために使用されるソフトウェアが改ざんされないようにしました。また、失敗を優雅に処理するシステムも設計しました。もしエージェントが行き詰まったり環境がクラッシュしたりした場合、システムは問題を特定し、その特定の試行を破棄して、エラーが学習データを汚染することなく次に進みます。これにより、複雑なコーディングタスクにおいて頻繁に発生する個別のテスト失敗が発生しても、訓練をスムーズに継続することができます。

研究者たちは、3つの異なる既存のコーディングエージェント・フレームワークを用いて大規模言語モデルを訓練することで、このシステムをテストしました。彼らは、システムがこれら3つのすべてにおいて驚くほどうまく機能することを発見しました。実世界のソフトウェア問題を解決するモデルの能力は大幅に向上しました。ある人気のあるフレームワークを使用した場合、成功率は64パーセントから70パーセント以上に跳ね上がりました。別のフレームワークでは、62パーセントからほぼ68パーセントへと上昇し、3つ目のフレームワークでは、57パーセントからほぼ67パーセントへと上昇しました。決定的なことに、研究者たちは学習プロセスが誠実であることを検証しました。エージェントが行ったことと訓練システムが計算したことの間の数学的な関係は、99パーセントを超える相関関係を維持し、ほぼ完璧でした。これは、システムが単に運が良かったのではなく、正しいデータから真に学習していたことを証明しています。

単にスコアを向上させるだけでなく、このシステムはエージェントがどのように学習するかについての明確な窓を提供しました。研究者たちは訓練をリアルタイムで観察することができ、なぜテストが失敗したのか、あるいは数週間の訓練を経てエージェントの振る舞いがどのように変化したのかを正確に見ることができました。彼らは、エージェントが向上するにつれて、変更が正しいことを確認するために、自身が編集したファイルをより頻繁にチェックするようになることを観察しました。また、エージェントが問題を解決するためにより多くのステップを踏み、解決に到達するためにコンピュータとのより長く複雑な対話を行うようになることも気づきました。このレベルの詳細さにより、研究者は、エージェントがツールの使用をやめてテキストの記述を始めたときなどの問題を迅速に診断し、それに応じて訓練を調整することができました。

LEGO-RLの成功は、コーディングエージェントの訓練をスケールアップさせるには、単に高速なコンピュータやより大きなモデルが必要なだけではないことを示しています。それは、エージェントのワークフローの完全性を尊重しつつ、学習のための安定した観察可能な環境を提供するシステムを必要とします。データの取得を忠実に行い、エラーを防ぎ、訓練プロセスへの深い可視性を提供するフレームワークを構築することで、研究者たちは、複雑なソフトウェアエージェントを確実に向上させる方法があることを示しました。彼らの研究は、自律的コーディングの未来が、エージェントを硬直した型に押し込めることではなく、ソフトウェア開発の混沌とした現実から学習できる、柔軟で堅牢なシステムを構築することにあることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →