Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering
本論文は、機械学習エンジニアリングにおける再帰的な自己改善のためのオープンなフルスタックシステムであるOpenMLEを紹介し、実行に基づいた学習と長期的探索を活用することで、MLEベンチマークにおいて主要なモデルを大幅に上回る性能を示しつつ、未知のタスクへの高い転移性を実証した35Bのメタ進化エージェントであるFrontis-MA1を提示する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
未来の道具を作る人々自身が、その道具によって作られている世界を想像してみてください。これは「AI for AI(AIのためのAI)」という、コンピュータサイエンスにおける非常に魅力的な領域です。ここでは、人工知能は単にゲームをプレイしたり詩を書いたりするだけでなく、他のAIを設計し、構築し、改良していきます。ここでの大きな夢は、「再帰的自己改善」という、スマートなシステムがよりスマートなシステムを作ることに長け、それが次世代のシステムをさらに優れたものにするという、知能の暴走的なループを生み出すというSF的なコンセプトです。しかし、そこに到達するためには、これらのアイデアをテストするための安全で現実的な遊び場が必要です。そこで登場するのが「機械学習エンジニアリング(MLE)」です。MLEを、現実世界のAIモデルを構築するという、泥臭く実践的な仕事だと考えてください。データの収集、トレーニング、バグの修正、そして動作するまで微調整を行う作業です。これは、理論的な設計図と、実際に動く車の違いのようなものです。もし、AIにこのエンジニアリングの仕事を自分自身でより良くこなせるよう教えることができれば、私たちはその自己改善する未来のコードを解読できるかもしれません。
本論文は、AIが自分を教えた人間よりも優れたエンジニアになることを真に学べるかどうかを検証するために、新しいオープンな遊び場であるOpenMLEと、スター候補生のFrontis-MA1-35Bを紹介します。研究者たちは単一の賢いロボットを作ったのではありません。彼らは一つの「工場」を作り上げたのです。まず、彼らはOpenMLE-Gymという、AIが問題を解決し、成功したか失敗したかについて即座に正直なフィードバックを得られる、約6,000種類の異なる「ワークアウト」タスク(株価予測や画像分類など)を備えた巨大なデジタルジムを作成しました。次に、彼らはAIであるFrontis-MA1に、4つの具体的な「筋肉の動き」を教えました。それは、Draft(新しいコードを書く)、Improve(それをより良くする)、Debug(エラーを修正する)、そしてCrossover(2つの優れたアイデアを組み合わせる)です。
魔法は、AIにこれらの動きを練習させる時に起こります。Frontis-MA1はただ推測するのではなく、ジムの中でコードを実行し、その結果を見て、自らの間違いから学びます。研究者たちは、このトレーニングをOpenMLE-Evoと呼ばれるスマートな探索戦略と組み合わせたとき、AIが単に少し良くなっただけでなく、劇的に向上したことを見出しました。MLE-Bench Liteという厳しいテストにおいて、ベースモデル(トレーニング前のAI)はタスクの約39%でしか「メダル(トップクラスのスコア)」を獲得できませんでした。しかし、トレーニングと探索のループを経た後、Frontis-MA1-35Bは**60.61%**へと跳ね上がりました。さらに「Max」モードで探索のダイヤルを最大限に回すと、**71.21%**に達しました。
これは単なる小さな勝利ではありません。本論文は、このシステムが、これらの特定のエンジニアリング・タスクにおいて、世界で最も有名で強力なAIモデル(GPT-5.5やCodexなど)を実際に上回ったことを示唆しています。しかも、Frontis-MA1は350億パラメータという比較的小規模なバックボーンに基づいているにもかかわらず、Kimi K3の性能に迫りました。鍵となる発見は、AIが過去の経験を利用して将来の探索を導く方法を学んだことです。AIはただランダムに試行錯誤したのではありません。どの「枝」の解決策が機能し、どれが失敗したのか、そして勝者をどのように組み合わせるべきかを記憶していたのです。著者らは、この「学習する方法を学ぶ(learning to learn)」アプローチにより、AIが単なる解決策を見つけるだけでなく、そのずっと後まで改善を続け、単純な修正を金メダル級のパフォーマンスへと変えられることを示しています。本論文は、AIが完全な無限の自己改善を達成したとまでは主張していませんが、AIが単に指示に従う段階から、自らのエンジニアリングスキルを真に進化させることができる段階へと移行しているという強力な証拠を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。