← 最新の論文
🤖 machine learning

Evolving Executable Pipeline Programs for AutoML with Language Models

LACEは、大規模言語モデルによって導かれる進化ループを用いて実行可能なPythonパイプラインプログラムを生成および進化させる新しいAutoMLフレームワークであり、68のOpenMLタスクにおいて競争力のある精度を達成しつつ、従来のシステムと比較して優れた透明性、編集可能性、および探索空間の柔軟性を提供します。

原著者: Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のデータサイエンスの世界において、機械はますます、現実世界の乱雑な情報を理解することを求められています。例えば、ローン申請者が返済するかどうかの予測、スプレッドシートに記載された症状からの疾患の診断、あるいは過去の傾向に基づいた売上の予測などです。これを行うために、研究者たちは「パイプライン」を構築します。これは、データのクリーニングを行い、数学的モデルを選択し、そのモデルが優れた性能を発揮するまで調整するための、ステップ・バイ・ステップの指示書です。長年、この仕事のための最も強力なツールは、決まった食材を持つマスターシェフのように機能する自動化システムでした。これらのシステムは、既知の前処理ステップと学習アルゴリズムを組み合わせたり、最適な味わいを見つけるためにその分量を調整したりすることができます。しかし、それらは与えられたパントリー(食品庫)の範囲内に厳格に制限されており、与えられたリストに含まれない新しい食材や新しい調理技法を編み出すことはできません。この制限により、もし最善の解決策が、システムがこれまで見たことのない構造を必要とする場合、その解決策は発見されないままとなります。

ライデン大学の研究チームは現在、異なるアプローチを導入しています。それは、これらのデータパイプラインの作成を、メニューからの選択としてではなく、新しいレシピを一から書き上げるプロセスとして扱うものです。彼らはLACEと呼ばれるシステムを開発しました。これは、膨大な量のテキストとコードで訓練された人工知能である大規模言語モデルを使用して、進化エンジンとして機能します。固定されたツールのリストから選ぶ代わりに、LACEはAIに対して、データの処理方法と予測を行う方法を定義する、完全で実行可能なコンピュータプログラムを書くよう求めます。システムはこれらのプログラムをテストし、その間違いから学び、改善されたバージョンを書くようAIに依頼し、非常に効果的な解決策が見つかるまでこのサイクルを繰り返します。その結果、既存のツールを微調整するだけでなく、全く新しい構造を構成し、人間の専門家が直接読み、理解し、修正できるコードを生み出すシステムとなります。

研究者たちは、数百のエントリを持つ小規模なデータセットから、500万行近くに及ぶ大規模なコレクションに至るまで、68種類の異なるデータ分類タスクを用いてこの手法をテストしました。彼らはLACEを、いくつかの確立された自動化システムおよび一連の固定された学習済みモデルと比較しました。その結果、特定の言語モデルによって駆動されるLACEは、既存の最強の自動化システムと同等の性能を示し、古い手法よりも大幅に優れた性能を発揮しました。決定的なことに、一部の新しい学習済みモデルは、それが扱える特定のタスクにおいてはわずかに精度が高いものの、テストセット内のより大規模または複雑なデータセットに対しては機能しませんでした。対照的に、LACEは与えられたすべてのタスクに対して、動作する解決策を生成することに成功しました。

この成果を特に注目すべきものにしているのは、その出力の性質です。従来の自動化システムは、多くの場合「ブラックボックス」、つまりうまく機能するものの、ソフトウェアフレームワークに関する深い技術知識なしには人間が検査したり変更したりすることが困難な、複雑に適合されたオブジェクトを返します。LACEが返すのは、通常のPythonコードです。これにより、データサイティストは最終的なプログラムを見て、データがどのようにクリーニングされ、どのモデルが選択され、それらがどのように組み合わされたのかを正確に把握でき、さらにそのコードを編集して改善したり、新しい目的に適応させたりすることができます。研究者たちは、AIが単に既存のパターンをコピーしたのではなく、多様な解決策を進化させており、異なるタイプのモデルを斬新な方法で組み合わせたり、予測をブレンドするためのカスタムロジックを記述したりしていることを発見しました。多くの場合、AIは複数のモデルの出力を混合するために独自のコードを書いており、これは固定されたシステムでは容易に複製できない柔軟性のレベルです。

この研究は、AI研究における一般的な懸念、すなわち、AIがトレーニング中に答えを見ていたために、テストの問題を単に暗記しているのではないかという懸念にも対処しました。これを防ぐため、研究者たちはデータセットの名前や詳細な情報をAIから隠し、データのサイズとタイプに関する一般的な説明のみを与えました。このような具体的な知識がない状態でも、システムは高性能な解決策を見つけ出したため、AIが答えを想起しているのではなく、効果的なパイプラインを構築する方法を真に学習していることが示唆されました。研究者たちはさらに、AIが自身の設定を調整するために隠れた内部検索を使用しないといった厳格なルールに従っていることを検証し、改善が進化的な探索プロセス自体から来ていることを保証しました。

最も驚くべき発見の一つは、システムの改善速度でした。AIによって生成された最初のプログラムは、しばしば欠陥があったり不完全であったりしましたが、システムが反復を重ねるにつれて、エラーを修正し、ロジックを洗練させることを学びました。プロセスが終了する頃には、最終的なプログラムは有効であるだけでなく、初期の試行よりも大幅に精度が高くなっていました。研究者たちは、システムが特定のタイプのモデル(例えば、決定木ベースのアンサンブルなど)を好む傾向があることを観察しましたが、単一のパターンに固執することはありませんでした。システムは幅広い構造的な組み合わせを探索しました。この多様性は、システムが人間が試そうと思わないような、あるいは硬直したシステムが決して検討しないような解決策を発見する能力を持っていることを示唆しています。

この研究は、自動化された機械学習を、コードの記述と進化のプロセスとして扱うことが、新たな境地を切り開くものであることを示しています。それは、固定されたライブラリの制約を超え、問題に合わせてその構造を適応させることを可能にします。これらの実験を実行するための計算コストは高く、数千の候補プログラムを生成してテストするために多大な時間を要しましたが、結果は、透明性が高く、編集可能で、非常に効果的なコードを生み出す能力が価値のあるトレードオフであることを示唆しています。研究者たちは、最適なデータパイプラインの探索が、あらかじめ選択されたコンポーネントの制限ではなく、コード自体の創造性によって定義されるようになる、このアプローチが有望な道筋を提供すると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →