InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance
InsightSRは、大規模言語モデルを活用して意味論的および構造的なガイダンスを通じて探索空間を反復的に洗練させることにより、深い式木の構築を意味論的に情報化された特徴量上の浅い木の組み立てへと変容させ、最先端の精度と汎化性能を実現する、PySRの遺伝的プログラミングエンジンを強化した新しい記号回帰フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
科学は常に、単純で強力な概念に依拠してきました。それは、自然界の複雑な振る舞いは簡潔な数学的法則によって記述できるという考えです。物理学者が落下するリンゴや惑星の軌道を見るとき、彼らは単に運動を見ているのではありません。彼らはそれを支配している隠れた方程式を探しているのです。この根底にある公式を探索することを、記号回帰(シンボリック・リグレッション)と呼びます。数百万の内部パラメータを調整してデータに適合させる標準的なコンピュータモデルとは異なり、記号回帰は、加法、乗法、三角関数といった馴染みのある数学的構成要素を用いて、実際の数式そのものを書き出そうと試みます。その目的は、正確であるだけでなく、人間が読み、理解できるほど単純なルールを見つけることです。しかし、これらのルールを見つけ出すことは極めて困難です。可能な数学的組み合わせの数は非常に速いスピードで増大するため、広大で混沌とした可能性の海となります。ほとんどのコンピュータ探索はこの海の中で迷走し、データには完璧に適合するものの物理的には全く意味をなさない公式を生成したり、あるいは探索空間が広大すぎて完全に探索しきれず、真の法則を見つけることに失敗したりします。
ある研究チームが、進化アルゴリズムの生の探索能力と、大規模言語モデルの推論能力を組み合わせることで、この混沌をナビゲートする新しいアプローチを開発しました。「InsightSR」と名付けられた彼らのシステムは、コンピュータに最終的な答えを直接推測させるのではありません。代わりに、言語モデルをガイドとして使い、探索そのものの形を変えるのです。探検家チームが、密に生い茂った未踏の森の中を通る特定の経路を見つけようとしている場面を想像してください。従来の方法では、探検家たちは正しい道を見つけることを願いながら、ランダムに彷徨っていました。この新しい方法では、大規模言語モデルが地形を熟知した熟練のガイドとして機能します。モデルは彼らに代わりに道を歩むわけではありませんが、どの方向への移動が物理的に不可能であるかを伝え、旅に役立つ可能性のある道具を提案します。
このシステムは、ガイダンスを2つの補完的なストリームに分割することで機能します。第一のストリームは、方程式の「骨格」に焦点を当てます。言語モデルは、変数が時間、距離、質量といった物理単位のいずれを表しているかを確認し、次元的に一貫していなければならない基本的な構造を提案します。これは、時間の測定値に距離を足すといった、物理法則に違反するような数学的組み合わせを排除することを意味します。物理的に妥当な出発点から探索を開始することで、システムは数十億もの不可能な公式に時間を浪費することを回避します。第二のストリームは、材料そのものに焦点を当てます。言語モデルは、過去の試行から得たパターンに基づき、変数を二乗したり正弦(サイン)をとったりするなど、生のデータを変換する新しい方法を提案します。これらの新しい特徴量は、探索エンジンが利用できる材料のプールに追加されます。時間の経過とともに、材料のプールはより豊かになり、生のデータの深く絡まった複雑な木構造を構築するのではなく、単純で浅い組み合わせを用いて複雑な関係性を構築できるようになります。
このプロセスは一度限りの推測ではなく、継続的な洗練のループです。コンピュータが候補となる方程式のセットを生成した後、言語モデルがそれらを評価します。モデルは、それらがどれだけ数値に適合しているかだけでなく、新しい特徴量がどれほど有用であったか、そして構造が理にかなっているかをもチェックします。このフィードバックは動的な知識ベースに保存され、次の探索ラウンドに情報を提供します。システムは自身の成功と失敗から学び、次第に最も有望な解へと探索を絞り込んでいきます。これにより、探索がより集中し、効率的になる自己修正サイクルが生まれます。
研究者たちは、3つの異なる課題を用いてこの手法をテストしました。第一に、古典力学から量子論に至るまで、100の有名な物理方程式のベンチマークを用いました。このテストにおいて、システムは元の公式を95%の確率で正確に復元することに成功し、これは従来の手法に比べて大幅な改善です。また、化学、生物学、材料科学にわたるより広範な科学的問題においても極めて優れた性能を示し、複雑な変換を伴うタスクにおいて80%以上の精度を達成しました。最後に、チームは振動子や細菌の成長パターンといった実世界のデータを用いてシステムをテストしました。これらのシナリオにおいて、システムは正確な公式を見つけただけでなく、未知のデータに対しても性能を維持し、高い汎化能力を持っていることを証明しました。
これらの結果は、大規模言語モデルを伝統的な探索エンジンの周囲にガイド層として組み込むことで、広大な探索空間と物理的一貫性の必要性という二つの課題を克服できることを示唆しています。このシステムは進化的な探索を置き換えるものではなく、それを洗練させ、盲目的なランダム探索を目的を持った導かれた発見へと変えるものです。生の変数による深く複雑な木構造を構築する負担を、豊かに事前強化された特徴量の集合から単純な組み合わせを組み立てる作業へとシフトさせることで、この手法は科学的法則の発見をより効率的かつ信頼性の高いものにします。このアプローチは、人間のような推論と機械ベースの探索の組み合わせが、私たちの世界を支配する隠れた数学的法則を明らかにできることを示しており、自動化された科学的発見への実用的な道筋を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。