AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
本論文は、再帰的な自己改善のための学習アルゴリズムを設計および書き換えるLLMエージェントの能力を評価する、10個の固定された研究リポジトリからなる新しいベンチマークであるAI4AI-Benchを紹介しており、最も高度なシステムでさえ、既存のアルゴリズムと理論的最適値との間の潜在的な性能向上幅の4分の1にすら現在到達していないことを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
人工知能の夢には、単に多くの事実を暗記するだけでなく、自らが学習に用いるルールそのものを書き換えることで、自らをより賢くする方法を教え込むことができる機械というビジョンが含まれている。「再帰的自己改善」として知られるこの概念は、あるAIシステムがより優れたバージョンの自分自身を設計し、それがさらに優れたバージョンを設計するという、急速な進歩の連鎖を示唆している。このサイクルが機能するためには、機械は、経験に基づいて内部の接続をどのように調整するかを指示する一連の手順である「学習アルゴリズム」を改良できなければならない。機械は指示に従うことや、その指示内にある小さな設定を微調整することには非常に長くなってきたが、指示そのものを再設計できるかどうかは、依然として未解決の問いである。これは、ラジオの音量を調節する方法を知っている運転手と、エンジンの再構築方法を知っている整備士の違いである。
ある研究チームは、現在の人工知能システムがそのような深い「機械的な作業」を実行できるかどうかを確認するための新しいテストを構築した。彼らは「AI4もAI-Bench」と呼ばれるチャレンジを作成し、高度なAIエージェントのグループに対して、10種類の異なる現実世界の研究プロジェクトを提示した。各プロジェクトには、コンピュータに数学の問題を解かせたり、画像を生成させたり、あるいは人間の好みを理解させたりといった、特定の種類の学習タスクが含まれている。研究者たちは、各AIエージェントに対し、これらプロジェクトのコードを読み、その内部で使用されている学習手法を改善するために4時間の計算時間を与えた。エージェントはコードをどのように変更しても自由であったが、その4時間の間は、自身の変更による最終的な結果を見ることはできなかった。その代わりに、エージェントは自分のアイデアが優れているかどうかを推測するために、迅速で大まかな推定値に頼らなければならなかった。時間が終了すると、エージェントが修正したコードは回収され、プロジェクトは、最終結果を判定するための固定された隠されたルールを用いて、最大12時間にわたってゼロから実行された。このセットアップは、小さなアイデアを素早くテストできる一方で、新しい学習手法が大規模なスケールで実際に機能するかどうかを確認するのに数日待たなければならない人間の科学者の実体験を模している。
実験の結果は示唆に富むものであった。29種類の異なるAIシステムと努力レベルの組み合わせにおいて、平均的なパフォーマンスは極めて低かった。元の修正されていないコードが0.1、理論上の最高スコアが1.0である尺度において、平均結果はわずか0.166であった。最も強力なシステムでさえ、わずか0.250に達したに過ぎない。これは、最も有能なエージェントであっても、既存の手法と最高の成果との間の距離の5分の1にも満たない距離しか縮められなかったことを意味している。研究者たちは、このギャップの原因は努力や計算能力の不足ではなく、「方向性の欠如」にあることを突き止めた。チームがエージェントが行ったコード変更を分析したところ、提出された変更の大部分は、核心となる学習ルールに一切触れていないことが判明した。代わりに、ほとんどのエージェントは、学習の長さや、進捗を保存する頻度、あるいはプロセスを調整するために使用される特定の数値などを単に調整していた。これらは「実行(run)」に対する変更であり、「学習の仕組み」に対する変更ではない。
エージェントのうち、何らかの変更を行ったもののうち、わずか46パーセントという少数のエージェントだけが、実際に学習アルゴリズムに踏み込み、目的関数、教師信号、または更新ルールを変更していた。これらのエージェントは大幅に優れた性能を示し、他のエージェントの平均スコアが0.126であったのに対し、0.226を記録した。このことは、真の改善への道は、機械が学習する根本的な方法を変更することにあるが、現在のシステムの多くはそのステップを躊躇していることを示唆している。また、本研究は、エージェントに許容される「推論の努力量」を増やしても、エージェントが全般的に賢くなるわけではないが、彼らをより「大胆」にさせることは示した。エージェントに考え、計画するための時間をより多く与えると、学習ルールを変更しようとする試みの割合は8パーセントから64パーセントへと跳ね上がった。この、核心となるアルゴリズムにリスクを冒す意欲の向上が、生成されたアイデアの質における突然の飛躍ではなく、改善を牽引した要因であった。
最終的に、論文は、今日のAIエージェントは、既存の能力を超えて設計しているのではなく、依然として「有能なデフォルト状態」を回復している段階にあると結論づけている。彼らは学習の周囲にあるプロセスを最適化することには長けているが、学習プロセスそのものを再設計することには苦慮している。研究者たちは、AIシステムが進歩するにつれて他の人々がこのテストを繰り返せるよう、コードの変更内容を含むすべてのデータを公開した。このベンチマークは、特定の種類の進歩を測るための物差しとして機能する。すなわち、機械が自身の学習方法を見つめ、欠陥を診断し、自らの改善を駆動するメカニズムを書き換えることができるかどうか、という指標である。現時点での答えは、彼らは試みることはできるものの、自らの知能を真に累積的に高めるために必要な深い変更を行うことは、滅多に成功しない、というものである。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。