← 最新の論文
🤖 machine learning

GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero

本論文は、数学やコーディングなど多様な分野にわたる強力な汎化性能を達成するために、少量のオープンエンドな対話相互作用からモデルをゼロから訓練する非常に効率的な強化学習手法 GRLO を導入し、従来のドメイン内 RLVR 手法と比較してデータ量と計算リソースの要件を大幅に削減するものである。

原著者: Shangjian Yin, Yu Fu, Yue Dong, Zhouxing Shi

公開日 2026-05-18
📖 1 分で読めます☕ さくっと読める

原著者: Shangjian Yin, Yu Fu, Yue Dong, Zhouxing Shi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢く、読書量も豊富な学生(大規模言語モデル)がいると想像してください。彼らは「事前学習」の段階で数百万冊の本を読み終えています。知識は豊富ですが、指示に従ったり、パズルを解いたり、コードを書いたりする点では少し不器用です。彼らを一流の専門家に変えるためには、通常、「事後学習」のコースを提供する必要があります。

従来、このコースを実行するには 2 つの方法がありました。

  1. 専門チューター(RLVR): 数学やコーディングのみを教えるチューターを雇います。彼らは厳格な正解キー(「検証器」)を用いて、すべてのステップを採点します。学生が数学の問題を正解すればゴールドの星が与えられ、間違えれば赤い×が付けられます。これは数学においては驚くほど効果的ですが、学生はテスト対策の練習しか行わなかったため、通常の会話や創造的な物語の書き方を忘れることがよくあります。
  2. 総合チャットコーチ(RLHF): 学生に、一般的に丁寧で、有益で、魅力的な会話ができるよう教えるコーチを雇います。厳格な正解キーの代わりに、人間からのフィードバック(「この回答は良かった」など)を使用します。

問題点:
「専門チューター」のアプローチは高額で、膨大な計算資源を必要とします。また、学生を数学の天才にする一方で、チャット能力を低下させてしまいます。「総合チャットコーチ」は安価ですが、数学やコーディングのような高度な推論タスクにおいて学生を向上させることが証明されていません。

新しいアイデア:GRLO(「オープンエンド・ジム」)
この論文の著者は、GRLOという新しい学習手法を提案しています。学生を数学専用のブートキャンプや一般的なチャットクラスに送るのではなく、オープンエンドな課題を備えたジムへ送ります。

ランニングマシン(数学)やサンドバッグ(チャット)だけのジムではなく、ここでは学生に 5,000 件の多様で難易度が高く、オープンエンドな質問が与えられます。

  • 「月の南極の歴史を分析せよ。」
  • 「特定の哲学が現代政治とどのように結びついているかを説明せよ。」
  • 「珍獣を飼育するためのガイドを作成せよ。」

これらの質問には、コンピュータでチェックできる単一の「正解」はありません。代わりに、学生は、彼らの長く詳細な回答がどの程度構造化され、論理的で、役立っているかという点に基づいてフィードバックを受けます。

大きな驚き(「ゼロ」の魔法)
論文は、驚くべき事実を報告しています。この「オープンエンド・ジム」での練習を通じてのみ、学生は数学、コーディング、そしてチャットの能力が著しく向上しました。

  • 結果: 基盤モデル(Qwen3-4B)を、わずか 5,000 のプロンプトという少量のデータで22.7 時間だけ学習させました。
  • 比較: このわずかな学習により、モデルの平均性能は24.1 から 63.1へと向上しました。
  • 効率性: これは、同様の結果を得るために通常必要とされる大規模な「専門チューター(RLVR)」手法に比べて、データ量が46 分の 1、計算資源が68 分の 1で済みました。
  • 転移: このモデルはチャット能力だけでなく、推論能力そのものを向上させました。この特定の学習段階で数学の問題やコーディングタスクを 1 つも見ていないにもかかわらず、数学の問題を解き、コードを書く能力が向上したのです。

次に何が起こるか:
著者らは、オープンエンド・ジムの後に、わずかな量の「専門チューター」学習(数学のみ)を追加する試みを行いました。それはわずかに役立ちましたが、最も難易度の高いコンペティションレベルの数学問題に限られていました。主な向上は、完全にオープンエンドな学習から得られました。

結論
この論文は、賢く推論可能な AI を得るために、大規模で高価な数学特化型の学習パイプラインを構築する必要はないと示唆しています。強力な基盤モデルを選び、深く考え、思考を整理する必要がある多様な少量のオープンエンドな会話で学習させれば、それは自然と他のすべての能力、つまり困難な推論タスクを含めて向上します。これは、「アスリートを多様で適応力のあるオールラウンダーとして訓練すれば、特定のスポーツの練習を一度もさせなくても、走ること、跳ぶこと、投げることは自然と上手くなる」と言うようなものです。

要約: 少量の賢明でオープンエンドな会話学習は、モデルの推論やコーディングの潜在的な能力を解き放ち、従来の方法に比べて莫大な時間と費用を節約します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →