GFlowRL: Scaling Distribution-Matching RL to Large Language Models
GFlowRLは、インバッチのモンテカルロ推定と特化したスタビライザーを用いることで学習された分配関数の必要性を排除し、数学、コード、および敵対的ベンチマークにおいて、235Bパラメータに及ぶ高密度および疎なアーキテクチャの両方で最先端の性能を達成する、大規模言語モデル向けの拡張可能で安定したGFlowNetスタイルの強化学習アルゴリズムを導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、世界で最も難しいパズル(複雑な数学の問題から、決してクラッシュしないコンピュータコードの作成まで)を解くための、天才的で学習速度の速い生徒を教えていると想像してください。人工知能の世界では、この生徒は「大規模言語モデル(LLM)」と呼ばれます。そして、私たちが彼らを教えるために使う手法が「強化学習」です。これは、AIが正しいことをしたときにポイント(報酬)を得るビデオゲームのようなものだと考えてください。長い間、標準的な戦略は、強欲なゲーマーのように振る舞うことでした。「今、最も多くのポイントが得られる単一の手法を見つけ出し、それを何度も繰り返す」という戦略です。これはうまく機能しますが、欠点があります。それは、特定の数学の問題を解くための特定の方法を暗記してしまい、たとえ他の方法が同じくらい優れていても、他の方法を試そうとしない学生のようなものです。彼らは一つの思考法に「固執」してしまい、新しく困難な状況に対処するために必要な創造性や多様性を逃してしまうのです。
これを解決するために、科学者たちは最近、「Generative Flow Networks(GFlowNets)」と呼ばれる異なるアプローチを試みました。単に最高の一手を探すのではなく、この手法は、AIに対して「すべての優れた手を探索し、それらがどれほど上手くいったかに基づいて使われるチャンスを与える」よう教えます。これは、「迷路の中を通るすべての有効な経路を試せ。最短に見える道だけでなく」と生徒に伝えるようなものです。目標は、多様で柔軟な思考を持つ存在を作り出すことです。しかし、これを巨大で超スマートなAIモデルへとスケールアップさせることは、悪夢でした。科学者がこれを実現するために構築したツールは非常に複雑で不安定であり、モデルが巨大化したりタスクが複雑になったりすると、AIをクラッシュさせたり、何も学習できない状態に陥れたりすることがよくありました。
「GFlowRL」と題されたこの論文は、まさにその悩みに取り組んでいます。著者たちは、以前の「多様な思考」のレシピの中で最も複雑な部分こそが、実は問題の本質であったことを発見しました。彼らは、AIの学習のバランスを取るのを助けるはずだった特定の数学的ツールが、助けとなるガイドというよりも、むしろノイズの多い壊れたラジオのように機能していたことを突き止めました。その壊れたツールを捨て去り、よりシンプルな「その場での計算」に置き換えることで、彼らはGFлоRLと呼ばれる新しい手法を作り上げました。この新しいアプローチは安定しており、高速で、驚くほど効果的です。これにより、大規模なAIモデルが、クラッシュすることなく、多様な問題解決戦略を学ぶことが可能になりました。実際、彼らの新しい手法は、従来の記録保持者を上回り、競技プログラミングにおいて現在利用可能な最高峰のAIシステムに匹敵するスキルレベルに到達しました。しかも、学習プロセスをスムーズかつ安定したまま維持しながらです。
問題点:すべてを壊してしまう「魔法の計算機」
この画期的な成果を理解するためには、まず従来の方法を見る必要があります。研究者たちが多様性を活用するためにGFlowNetsを用いてAIを教えようとしたとき、彼らは報酬のバランスを取るための特別な「計算機」(技術的には「分配関数」と呼ばれます)に頼っていました。あなたが1,000人の生徒がいるクラスの成績をつけている教師だと想像してください。独創的でユニークな解決策を見つけた生徒にクレジットを与えたい一方で、成績が高すぎてシステム全体が崩壊しないようにする必要もあります。
旧来の手法では、この計算機の役割を果たすために、全く新しい小さなAIモデルを構築しようとしました。問題は、この小さな計算機がゼロから学習しなければならない一方で、巨大な生徒(メインのAI)はすでに天才として振る舞っているということでした。それは、CEOが意思決定を行っている一方で、その予算管理を幼児に任せるようなものです。計算機(幼児)は混乱してデタラメな数字を叫び、システム全体をパニックに陥らせました。研究者たちは、この「計算機」が実際には役に立つどころか害を及ぼしていることを発見しました。それはあまりにも不安定であったため、AIの学習プロセスをエラーで爆発させ、多くの場合、計算機をランダムなノイズに置き換えた場合と変わらない、何も学習できない状態を引き起こしていました。
解決策:計算機を捨て、グループを活用する
GFlowRLの著者たちは、シンプルで大胆な問いを投げかけました。「本当にこの壊れた計算機が必要なのだろうか?」
彼らは、AIがすでに計算機が行うべき仕事を既に行っていることに気づきました。AIが練習するとき、単に一つの答えを試すのではなく、一度に一連の回答(フォーカスグループのようなもの)を試します。研究者たちは、AIがすでに生成した回答のグループを見れば、必要なバランスを把握できることに気づいたのです。繊細で壊れやすい別の機械を構築して数学を行う代わりに、目の前にあるデータを利用するだけでよいと考えました。
例えるなら、チームがいくら稼いだかを教えてもらうために、神経質な会計士を別途雇うのではなく、チームが提出してきた領収書をそのまま確認するようなものです。情報は同じですが、即時的で現実的であり、壊れる可能性のある高価な新しい機械を必要としません。
このシンプルな切り替え——複雑で学習が必要な計算機を、グループからの迅速な「その場での推定値」に置き換えること——が、すべてを変えました。
- 安定性: 制御不能なエラーの爆発が消え去りました。学習は、現在使用されている標準的な手法と同じくらいスムーズになりました。
- 簡潔さ: 二つ目の追加モデルを訓練する必要がなくなりました。これにより、膨大な計算資源と時間を節約できました。
- パフォーマンス: 驚くべきことに、AIは単にクラッシュしなくなっただけではありません。むしろ、より優れたものになりました。
結果:クラッシュからチャンピオンへ
チームはこの新しい手法であるGFlowRLを、AIにとって最も困難な課題でテストしました。
- 数学: 彼らは難しい数学コンテストを用いてモデルを訓練しました。この新手法は、多様性を促そうとした従来のどの手法よりも多くの問題を解くことに成功しました。
- コーディング: Codeforcesのような競技プログラミングサイトでテストを行いました。GFlowRLで訓練された140億パラメータのモデルは、2048のレーティングに達しました。これを比較すると、これは極めて高いスキルレベルであり、これまでのオープンソースの記録を塗り替え、現在利用可能な最高峰のクローズドソースAI(o3-mini)にわずか25ポイント差まで迫るものです。
- 安全性(レッドチーミング): 彼らはまた、AIの安全ルールを破ろうとする「レッドチーミング(敵対的検証)」についてもテストしました。従来のメソッドが完全に失敗していた、このノイズが多く混沌とした環境において、GFlowRLは成功し、攻撃の成功率において最高値を記録しました。これは、フィードバックが混乱している状況下でも、複雑で多様な戦略を学習できることを証明しています。
おそらく最も印象的な部分は、そのスケーラビリティ(拡張性)の高さです。この手法を、数百億のパラメータを持つ「Mixture of Experts (MoE)」モデルのような巨大なAIシステムに適用しようとした際、従来の手法は即座にクラッシュしました。しかし、GFlowRLは、2350億のパラメータを持つモデルであっても、完璧に動作し続けました。
なぜこれが重要なのか
ここでの大きな教訓は、単により優れたAIトレーナーを作ったことではありません。「最善」の方法とは、必ずしも最も複雑な方法ではないということに気づいた点にあります。古いレシピから不要で不安定な部分を取り除くことで、よりシンプルで、かつ強力な道を見出したのです。
GFlowRLは、AIを真にスマートで多様なものにするために、より複雑なメカニズムの層を重ねる必要はないことを示唆しています。時には、超知能的な生徒を教えるための最善の方法は、レッスンプランを過剰に設計(オーバーエンジニアリング)することをやめ、彼らがすでに生成しているアイデアのグループから学ばせることなのです。AIの推論能力をスケールアップさせる鍵は、より多くのツールを追加することではなく、どのツールを捨てるべきかを正確に知ることにあることが判明しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。