ELMER: Evolutionary Language Model that Explores and Refines
本論文は、強さによって自然言語による方策の変異を制御するために、Direct Preference Optimizationを用いてファインチューニングされたQwen3-8Bを活用する進化型言語モデルであるELMERを紹介しており、言語ベースの表現がプログラム進化において従来の構文編集メトリクスよりも優れた行動キャリブレーションと探索効率を提供することを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットにビデオゲームを教えようとしている場面を想像してみてください。ただし、ジョイスティックを与える代わりに、ロボットがミスをするたびに新しい一連のルールを書き直さなければならないとしたらどうでしょう。これが「プログラム進化(program evolution)」の世界です。この分野では、科学者たちはコンピュータを使って、ソフトウェアに微細な変化を加え、テストし、勝者を残すことで、より優れたソフトウェアを「育てる」手法を用います。長い間、このプロセスは暗闇の中でダーツを投げているようなものでした。科学者は、新しいバージョンのコードが以前より良くなったか悪くなったかを判断することはできましたが、それを「どの程度」変化させるかを制御する方法はありませんでした。コード内のたった一単語をわずかに修正しただけで、穏やかに歩いていたロボットが、突如として混沌とした衝突の塊へと変貌してしまうこともあれば、大規模な書き換えを行ったとしても、ロボットの挙動が全く変わらないこともありました。研究者たちが問い続けてきた大きな疑問は、「何を変えるべきか」だけでなく、「ロボットの挙動をどの程度変化させるべきか」を理解し、目標に向かって精密に操縦できるシステムを構築できるか、という点でした。
ここで、論文「ELMER: Evolutionary Language Model that Explores and Refines(探索と洗練を行う進化型言語モデル)」が登場します。研究者のマシュー・シパー、アーメド・カリファ、ジュリアン・トゲリアスは、大規模言語モデル(人間の言語を理解する超スマートなAI)を「突然変異オペレーター」として機能させる、巧妙な新システムを構築しました。このAIは、コンピュータコードを盲目的に編集するのではなく、株の売買戦略(レシピのようなもの)の自然言語による記述を編集します。このAIは、3つの特定の役割を理解するように訓練されています。それは、レシピをコードに翻訳すること、コードをレシピへと逆翻訳すること、そして最も重要なこととして、「強度(strength)」コマンドに基づいてレシピを突然変異させることです。もしAIに「低強度」の変化を指示すれば、AIはレシピをわずかに微調整します。もし「高強度」と指示すれば、AIは全体を書き換えます。
チームはこれを金融取引でテストし、過去の市場データを使用して、新しい戦略がいかに優れたパフォーマンスを発揮するかを確認しました。彼らは、AIにロボットの実際の行動がどれほど変化したか(「行動変位(behavioral displacement)」)に注意を払うよう訓練することで、「強度」コマンドを機能させられることを発見しました。小さな変化を求めれば、AIは通常、小さな変化を生み出し、大きな変化を求めれば、大きな変化を生み出しました。これは、プログラム進化の混沌としたプロセスを、自動車の操縦のようなものに変えるという点で非常に重要なことです。この論文は、自然言語による記述を用いることが、生のコードを直接編集するよりも、AIに賢く、制御された動きをさせるのに役立つことを示しています。彼らのテストにおいて、この言語ベースのシステムは、試行したすべての手法の中で最高のパフォーマンスを示す取引戦略を見つけ出し、しかもより効率的に、より少ない試行回数で優れた結果に到達しました。このシステムは完璧ではなく、依然としてある程度のランダム性を伴いますが、その結果は、AIにその変化について人間の言葉で「語る」ことを教えることが、膨大なコンピュータプログラムの可能性の空間の中で、より優れた誘導方法を与えてくれることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。