粒子が衝突し、一瞬のうちに崩壊していく亜原子の世界において、理論物理学者は自らの発見の数学を記述するために、特化した言語に頼っている。「Form」として知られるこの言語は、汎用的なプログラミングツールではなく、驚異的な複雑さを持つ代数式を扱うために設計された、極めて特殊なシステムである。科学者が量子場理論を用いて粒子の挙動を計算する際、得られる数式には数百万、あるいは数十億もの項が含まれることがある。汎用的なコンピュータプログラムは、このような膨大な計算に直面するとしばしばクラッシュしてしまうが、Formは中間ステップをコンピュータのメモリ内ではなくハードドライブに保存することで、これらを管理できるように構築されている。数十年にわたり、このツールは宇宙の秘密を解き明かすために不可欠な存在であり続けてきたが、習得は困難である。その構文は独特であり、その規則は容赦がなく、そして今までは、人間がそのコードを書くのを助けることができる人工知能が存在しなかった。
この技術的な空白は、カールスルーエ工科大学の研究者たちに独自の課題を突きつけた。彼らは根本的な問いを投げかけた。インターネット上の膨大なデータで学習された現代の人工知能は、そのデータの中にほとんど存在しない言語のコードを書くことを学習できるのだろうか? 彼らが見出した答えは、明確な「ノー」であった。数百億のパラメータを持つ、最先端の最も強力なAIモデルをテストしたところ、これら人工知能の巨人は完全に失敗した。マニュアルやガイドを見ることができない限り、彼らは有効なFormコードを一行も生成できなかった。AIにとって、この言語は事実上目に見えないものであり、モデルの規模の大きさよりも、特定の学習データの欠如が重要となる「ゼロリソース・ドメイン」であった。
これを解決するために、研究者たちは異なるアプローチをとった。巨大なモデルに規則を推測させるのではなく、特化した小規模なAIを構築し、厳格な自己修正メソッドを用いて学習させたのである。彼らは、強力なAIが単純な英語の指示に基づいて候補となるプログラムを生成するパイプラインを作成したが、これらのプログラムは即座に信頼されることはなかった。代わりに、それらは実際のFormソフトウェアに入力され、正しく動作するかどうかが確認された。もしコードがエラーを生成したり、誤った結果を出力したりした場合は、破棄された。構文、実行、そして論理的一貫性のすべてのチェックを通過したプログラムのみが保持された。このプロセスにより、初歩的なチュートリアルから複雑な物理計算に至るまで、4,600例を超える検証済みのライブラリが生成された。
この高品質で検証済みのデータを用いて、チームは80億パラメータを持つコンパクトなAIモデルを微調整(ファインチューニング)した。その結果、世界で最も大きく高価なモデルを凌駕するスペシャリストが誕生した。664個の特定の計算タスクにおいて、この小型で特化したモデルは、その97.7%を正しく解いた。対照的に、最大級のフロンティアモデルは、構文ガイドを与えられたとしても、同じタスクに対して構文的に有効でエラーなく実行可能なコードを生成できたのは、わずか約75%であった。目標は示されているが手法は指定されていないオープンエンドのタスクでは、その差はさらに顕著になり、特化したモデルは83%の割合で実行可能なコードを生成できたのに対し、巨大なモデルの最高峰は65%にとどまった。
おそらく最も驚くべきことに、研究者たちは、この特化した学習がAIから他の能力を「忘れさせる」ことはないことを見出した。このモデルは一般的な推論能力やコーディング能力を維持しており、標準的な数学や論理のテストにおける性能低下はごくわずかであった。これは、AIに新しいニッチなスキルを教えることが、その一般的な知能を犠牲にすることを必要としないことを示唆している。この研究は、高度に専門化された科学言語において、成功の鍵はモデルの純粋な大きさではなく、それが学習するデータの質と検証にあることを証明している。ソフトウェア自体を教師として用い、あらゆるレッスンを検証させることで、研究者たちは、物理学者が自然の基本法則を探求するために必要な複雑なコードを書くのを支援できるツールを作り上げた。これにより、高エネルギー物理学において長らくボトルネックとなっていた言語への参入障壁を下げたのである。
技術要約:検証駆動型ファインチューニングによるLLMベースのFormコード生成
問題提起
Formは、多ループ・ファインマン図から生じる数十億項もの代数式を扱うことができる、高精度な素粒子物理学計算に不可欠なドメイン特化型の記号操作言語である。その不可欠性にもかかわらず、FormにはAI支援ツールが欠如している。本論文は、Formが大規模言語モデル(LLM)の学習データにおいて「ゼロリソース」の言語であり、インターネット規模のコーパスには殆ど出現しないことを立証している。その結果、最先端のモデル(最大756Bパラメータ)であっても、ドキュメントなしでの指示追従およびチュートリアル形式のFormタスクにおいて実行パス率は0%となり、現在のLLMにとってFormは真の「ゼロショット」言語となっている。課題は、より小さなモデルを専門化させて正しいFormコードを生成させることが可能か、そしてそれが巨大な最先端モデルとどのように比較されるかを判断することである。
手法
著者は、検証駆動型のデータ生成パイプラインとパラメータ効率の高いファインチューニングを中心とした、3部構成の手法を提案している。
検証駆動型データ生成:
- パイプライン: 自然言語の指示から候補となるプログラムを生成するために、最先端LLM(DeepSeek-V4 Flash)を使用する4段階のパイプラインを用いる。
- オラクル: 実際のFormバイナリ(FORM 5.0)が実行オラクルとして機能する。
- 検証ステージ: 候補は以下のプロセスを経る:(1) 出力の唯一性を保証するための決定論的な単語チェック、(2) Formバイナリによる構文検証、(3) 非自明な出力の確認、(4) ハルシネーションを防ぐためにForm特有のファクトシートを備えた独立したLLM(GLM-5.2)による意味的一貫性の監査。
- コーパス: このプロセスにより、決定論的な計算、オープンエンドなプログラム、チュートリアルコード、および知識Q&Aペアを含む、学習セットとテストセットの重複がない4,633個の検証済み学習例が得られた。
パラメータ効率の高いファインチューニング:
- モデル: QLoRA(Quantized Low-Rank Adaptation)を用いて、80億パラメータのQwen3-8Bモデルをファインチューニングする。
- 構成: 4ビットNF4量子化、LoRAランク16、アルファ32を用いてモデルを訓練する。
- バリアント: データの影響を分離するために、2つのバリアントを訓練する:
v3b(決定論的タスクのみ)およびv3c(オープンエンド、チュートリアル、知識データを含むフルミックス)。ハイブリッド思考モードは、直接的なコード生成を優先するために無効化されている。
評価フレームワーク:
- ベンチマーク: 4つのベンチマークを使用する:B1(664-決定論的)、B2(Instruct-100、オープンエンド)、B3(Tutorial-44)、B4(Open-32、複雑なマルチステップ)。
- 指標: 評価には、構文パス率、厳密なForm検証済み出力マッチング(Formバイナリを使用して生成された出力と参照解を比較)、およびオープンエンドタスクに対するアンカー付きLLM判定が含まれる。
- ベースライン: 8Bから756Bパラメータに及ぶ7つのベースラインモデルと比較する。極めて重要な点として、最先端のベースラインはドキュメントのコンテキスト(6,000文字の構文ガイド)を付与した状態で評価されるが、ファインチューニングされたモデルはゼロショットで評価される。
主な結果
- ゼロショット・ベースライン: ドキュメントがない場合、評価されたすべてのモデル(756Bパラメータを含む)は、Instruct-100およびTutorial-44ベンチマークにおいて、構文的に有効なFormプログラムを一つも生成できなかった。
- 決定論的タスクにおける性能: ファインチューニングされた8Bモデル(
FORM-8B)は、664-Deterministicベンチマークにおいて97.7%の正確な出力一致を達成し、756BのGLM-5.2(75.5%)および304BのDeepSeek-V4 Flash(62.3%)を決定的に上回った。
- オープンエンドタスクにおける性能: Instruct-100ベンチマークにおいて、
FORM-8Bは83.0%の実行率と18.0%の厳密な出力一致率を達成した。これは、実行率65.0%、厳密一致率5.6%を記録した最良の最先端モデル(GLM-5.3)を大幅に上回っている。
- 厳密な検証: 厳密なForm検証済み出力マッチングの下でも、この優位性は維持される。Instruct-100における89個の出力決定タスクにおいて、
FORM-8Bは18.0%を解決したのに対し、最良の最先端モデルは5.6%であった。McNemar検定により、これらの差は統計的に有意であることが確認された(p≤0.007)。
- 一般的能力の保持: ファインチューニングによる一般的な推論能力への劣化は最小限である:MMLUは2.6ポイント、GSM8Kは1.5、HumanEvalは0.6低下した。
- アブレーション研究の結果: 決定論的データのみでの訓練(
v3b)は、高い決定論的性能を示す一方で、オープンエンド能力の崩壊(29.0%)を招いた。多様で検証済みのデータの包含(v3c)が、オープンエンドの成功の主要な要因であった。
意義および主張
本論文は、ゼロリソースのドメイン特化型言語(DSL)においては、検証済みのタスク特化型学習データは、生のパラメータ数よりも価値があると主張している。本研究は、コンパクトでファインチューニングされたモデルが、対象となる言語が事前学習コーパスに存在しない場合、最先端規模のモデルを大幅な差で凌駕できることを示している。
本研究は、ニッチな科学言語にAI支援コーディングをもたらすためのテンプレートを提供している:
- 決定論的な実行オラクル(Formバイナリ)を特定する。
- このオラクルを通じて学習データを生成・検証し、人間のアノテーションなしで構文的および意味的な妥当性を確保する。
- パラメータ効率の高い手法(QLoRA)を用いて小さなモデルをファインチューニングする。
著者は、これらの結果がForm言語および構築されたベンチマークに特有のものであることを強調している。また、オープンエンドのテストセットの小ささ(一部の指標における信頼区間の広がりにつながる)、物理学者による人間による評価の欠如、および著者作成のベンチマークによるバイアスの可能性といった限界についても述べている。しかし、モデルの重みと完全なベンチマークスイート(840タスク)を公開することで、Formコード生成評価の公的な標準を確立することを目指している。
毎週最高の phenomenology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録