Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning
本論文は、高品質なカリキュラムと段階的なロールアウト探索を活用することで、JEE や NEET などの競争的な STEM 試験において優れた性能とより高いトークン効率を達成する、GPT-OSS-20B に基づき強化学習で訓練された言語モデル Aryabhata 2 を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してください。GPT-OSS-20B という、天才的だが少し散漫な学生がいます。この学生は膨大な量の書籍を読み、多くの事実を知っていますが、インドの最も過酷な大学入試に見られるような、複雑で多段階の数学や科学の問題を解くよう求めると、しばしば脱線したり、混乱したり、答えを書くのに永遠にかかったりします。正解にたどり着くこともありますが、そのために大量の「インク」(コンピュータ・トークン)を費やしており、それは高価で遅いものです。
この論文の著者たちは、この学生をより大きな脳(より大規模なモデル)を購入することなく、チャンピオンの問題解決者へと変えようと考えました。彼らはAryabhata 2という新しい学生を創り出しました。
彼らがどのように行ったのか、簡単な比喩を用いて説明します。
1. 訓練の場:厳格なコーチ
単に学生に本をより多く読ませる(これが標準的なトレーニングです)のではなく、研究者たちは強化学習を用いた厳格なコーチのように振る舞いました。
- 報酬システム: パズルを正しく解き、かつ明確に説明した場合にのみポイントがもらえるビデオゲームを想像してください。学生が答えを間違えれば、ポイントはゼロです。答えが正しくても、1 段落の説明で済むところを 10 ページの論文を書いてしまえば、スコアは低くなります。
- 「審判」: コーチは学生の言葉をただ信じるだけではありませんでした。彼らは、すべてのステップをチェックする超スマートな「審判」(別の AI)を用いました。数学が合っていなかったり、論理に欠陥があったりすれば、答えは即座に却下されました。
2. カリキュラム:易しいものから不可能なものへ
研究者たちは、学生をいきなり深い部分に放り込みませんでした。彼らは3 段階の訓練キャンプを構築しました。
- レベル 1(フォーマット): まず、学生にペンを正しく持つ方法を教えました。答えが整然としており、特定の構造に従っているかどうかに焦点を当てました。
- レベル 2(鍛錬): 次に、学生に数千の練習問題を与えました。学生が上達するにつれて、コーチは問題をより難しくしました。学生が 70% の正解率を維持し続けると、コーチはさらにトリッキーな問題に差し替えました。
- レベル 3(ワイルドカード): 最後に、学生に同じ難しい問題を同時に解くための多くの異なる方法を試させるようにしました。学生に迷路を解くために 128 通りの異なる経路を同時に試すよう求めることを想像してください。これにより、彼らは以前は見ていなかった賢いショートカットを発見できるようになりました。
3. 秘密の武器:「広範な探索」
通常、AI をトレーニングする際、問題の解決を 1 回だけ求めます。しかし、Aryabhata 2 は、すべての質問に対して多数の異なる試行を生成するようにトレーニングされました。
- 比喩: 犯罪を解決する探偵を想像してください。1 つの推測に従うのではなく、探偵は 128 個の異なるチームを派遣して手がかりを探させます。たとえ1 つのチームだけが正しい手がかりを見つけられれば、事件は解決します。この手法により、モデルは「黄金の経路」をより速く、より確実に発見できるようになりました。
4. 結果:より速く、賢く、スリムに
彼らが Aryabhata 2 を JEE や NEET といった実際の試験、さらには AIME などの超難関数学コンペティションでテストしたところ、その結果は印象的でした。
- 精度の向上: 親モデル(GPT-OSS-20B)よりも多くの問題を正しく解き、はるかに大規模で高価なモデルさえも凌駕しました。
- 「トークン」の節約: これが最大の勝利です。元のモデルはしばしば長く回りくどい説明を書いていました。Aryabhata 2 は簡潔になることを学びました。同じ(あるいはそれ以上の)結果を得るために、最大で64% 少ない単語(トークン)しか使用しませんでした。
- 比喩: 古いモデルが完璧なショットを見つけるために 100 枚写真を撮る観光客だとすれば、Aryabhata 2 は 1 回のクリックで完璧なショットを撮るプロのカメラマンのようです。
結論
この論文は、非常に具体的で高品質な練習問題のセットと、賢明な多段階トレーニング手法を使用することで、標準的な 200 億パラメータの AI を、専門的なSTEM 推論の専門家へと変えたことを主張しています。賢くなるために巨大なモデルである必要はありませんでした。必要だったのは、適切な種類の練習と、良い行動をどのように報酬付けるかを正確に知っているコーチだけでした。
彼らが主張しなかったこと:
この論文は、この AI が人間の教師に取って代わるものでも、医療状態を診断するものでも、一般的な会話に使用されるものでもないと主張していません。これは、競争力のある試験で見られる科学、数学、工学の問題を解決するために特別に構築されたものであり、それらの特定の科目に対する非常に効率的なチューターとして機能します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。