Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning
本論文は、強化学習による微調整を通じて LLM 探索演算子を継続的に洗練させることにより、アルゴリズム発見のための LLM 基盤進化探索を強化し、組合せ最適化タスクにおいて優れた解の同定を加速する新たな枠組みを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
完璧なケーキを焼くための、新しく超効率的なレシピを発明しようとしていると想像してください。あなたはレシピを書き起こすことができる非常に才能のあるシェフ(大規模言語モデル、または LLM)を持っています。
旧来の方法:「静的なシェフ」
以前の手法(「FunSearch」など)では、シェフにレシピを書いてもらいます。それを焼いて味見し、良し悪しを判断します。まあまあならそのまま残し、素晴らしいものなら、その素晴らしいレシピを見て、それを基に少しだけ良いレシピを書き起こすようシェフに依頼します。これを数千回繰り返します。
問題は何でしょうか?シェフは実際にはプロセスから学習しません。彼らは毎回試行の後にすべてを忘れる天才のようなものです。彼らは元のトレーニングに基づいて推測し続け、単なる幸運によってより良いレシピにたどり着こうとします。彼らは良いケーキを作る要因についての内部知識を更新しません。
新しい方法:「EvoTune」(学習するシェフ)
この論文の著者たちは、EvoTuneと呼ばれる新しい手法を提案しています。これは同じ才能あるシェフを雇うようなものですが、今回は特別なトレーニングループを与えます。
- 味見テスト(進化的探索): 以前と同様に、シェフは多くのレシピを書きます。それらを焼いて味見し、スコア付けします。最高のものを選び、悪いものは捨てます。
- 教訓(強化学習): これが魔法のステップです。悪いレシピを捨てるだけでなく、シェフに「勝者」と「敗者」を見せ、「違いを見てください!勝者はこれをし、敗者はあれをしました」と伝えます。
- 更新: その後、これらの教訓に基づいてシェフに簡単な「復習コース」(ファインチューニング)を与えます。シェフの脳は、なぜ勝者のレシピが機能したのかを理解するように実際に変化します。
- 繰り返し: これで、次にシェフにレシピの次のバッチを書くよう頼むとき、彼らはもう単に推測しているだけではありません。新しく更新された知識を使って、より早く良い場所を目指します。
なぜこれが優れているのか?
巨大な森で隠された宝を探すことを考えてみてください。
- 旧来の方法: 地図はあるが記憶がない斥候を送ります。彼らは歩き回り、場所を見つけ、宝があるか確認し、その後すべてを忘れます。次の場所を見つけるために、またランダムに歩き回らなければなりません。
- EvoTune: 斥候は場所を見つけ、「ああ、ここは木が密集しているから、宝は近くにあるはずだ」と気づき、内部の地図を更新します。次に外に出るとき、彼らはランダムに歩き回るのではなく、有望な地域に向かってまっすぐ歩きます。
何を実験したのか?
研究者たちは、コンピュータが物事を整理する最良の方法を見つける必要がある 3 つの難しい「パズル」ゲームでこれをテストしました。
- ビンパッキング: さまざまなサイズの箱を、可能な限り少ない数のトラックに詰め込むこと。
- 巡回セールスマン: 経路を重複させずに都市のリストを訪問する最短ルートを見つけること。
- フラットパック: 複雑なテトリスのように、奇妙な形をしたブロックを重ならないようにグリッドに収めること。
結果
彼らは、「学習するシェフ」(EvoTune)が、「静的なシェフ」(旧来の手法)よりもはるかに速く優れた解決策を見つけ出したことを発見しました。
- より良いスコア: EvoTune によって見つけられたレシピ(アルゴリズム)はより効率的でした。
- より多様性: 学習するシェフは、ただ一つの良いレシピを見つけそこで止まったのではなく、多様で高品質な解決策の幅広いバリエーションを見つけました。
- 現実世界での勝利: 一つの特定の課題(データセンター内のサーバー配置に関するグーグルのハッシュコード大会)において、EvoTune は大会で人間チームによって見つけられた最良の解決策よりも実際に優れた解決策を見つけました。
秘密のソース
この論文はまた、シェフの創造性を維持するために使用した特定のトリックについても言及しています。モデルに教えすぎると、時に「行き詰まり」、同じことを繰り返し書くだけになってしまいます。これを防ぐために、彼らは「勝者から学びつつ、新しいアイデアを探求し続ける」ようシェフに強制する特別な数学的規則(「Forward KL」と呼ばれる)を使用しました。
要約すると
EvoTune は、探索(多くのことを試すこと)と学習(機能したことに基づいて AI の脳を更新すること)を組み合わせたシステムです。これは、静的なツールを、問題を解決しようとするほどに賢くなる自己改善型のパートナーへと変えます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。