← 最新の論文
⚛️ phenomenology

LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning

本論文は、最先端の大型言語モデルがゼロショットでのFORMタスクに失敗することを示すことで、記号操作言語FORMに対するAIサポートの欠如に対処し、次いで、FORMバイナリをオラクルとして用いた検証駆動型のファインチューニング・パイプラインを導入することで、一般的な推論能力を維持しつつ、コードの実行および正確性においてより大規模な最先端モデルを凌駕する、コンパクトな8Bパラメータのモデルを構築する。

原著者: Bakar Chargeishvili

公開日 2026-09-22
📖 1 分で読めます🧠 じっくり読む

原著者: Bakar Chargeishvili

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

粒子が衝突し、一瞬のうちに崩壊していく亜原子の世界において、理論物理学者は自らの発見の数学を記述するために、特化した言語に頼っている。「Form」として知られるこの言語は、汎用的なプログラミングツールではなく、驚異的な複雑さを持つ代数式を扱うために設計された、極めて特殊なシステムである。科学者が量子場理論を用いて粒子の挙動を計算する際、得られる数式には数百万、あるいは数十億もの項が含まれることがある。汎用的なコンピュータプログラムは、このような膨大な計算に直面するとしばしばクラッシュしてしまうが、Formは中間ステップをコンピュータのメモリ内ではなくハードドライブに保存することで、これらを管理できるように構築されている。数十年にわたり、このツールは宇宙の秘密を解き明かすために不可欠な存在であり続けてきたが、習得は困難である。その構文は独特であり、その規則は容赦がなく、そして今までは、人間がそのコードを書くのを助けることができる人工知能が存在しなかった。

この技術的な空白は、カールスルーエ工科大学の研究者たちに独自の課題を突きつけた。彼らは根本的な問いを投げかけた。インターネット上の膨大なデータで学習された現代の人工知能は、そのデータの中にほとんど存在しない言語のコードを書くことを学習できるのだろうか? 彼らが見出した答えは、明確な「ノー」であった。数百億のパラメータを持つ、最先端の最も強力なAIモデルをテストしたところ、これら人工知能の巨人は完全に失敗した。マニュアルやガイドを見ることができない限り、彼らは有効なFormコードを一行も生成できなかった。AIにとって、この言語は事実上目に見えないものであり、モデルの規模の大きさよりも、特定の学習データの欠如が重要となる「ゼロリソース・ドメイン」であった。

これを解決するために、研究者たちは異なるアプローチをとった。巨大なモデルに規則を推測させるのではなく、特化した小規模なAIを構築し、厳格な自己修正メソッドを用いて学習させたのである。彼らは、強力なAIが単純な英語の指示に基づいて候補となるプログラムを生成するパイプラインを作成したが、これらのプログラムは即座に信頼されることはなかった。代わりに、それらは実際のFormソフトウェアに入力され、正しく動作するかどうかが確認された。もしコードがエラーを生成したり、誤った結果を出力したりした場合は、破棄された。構文、実行、そして論理的一貫性のすべてのチェックを通過したプログラムのみが保持された。このプロセスにより、初歩的なチュートリアルから複雑な物理計算に至るまで、4,600例を超える検証済みのライブラリが生成された。

この高品質で検証済みのデータを用いて、チームは80億パラメータを持つコンパクトなAIモデルを微調整(ファインチューニング)した。その結果、世界で最も大きく高価なモデルを凌駕するスペシャリストが誕生した。664個の特定の計算タスクにおいて、この小型で特化したモデルは、その97.7%を正しく解いた。対照的に、最大級のフロンティアモデルは、構文ガイドを与えられたとしても、同じタスクに対して構文的に有効でエラーなく実行可能なコードを生成できたのは、わずか約75%であった。目標は示されているが手法は指定されていないオープンエンドのタスクでは、その差はさらに顕著になり、特化したモデルは83%の割合で実行可能なコードを生成できたのに対し、巨大なモデルの最高峰は65%にとどまった。

おそらく最も驚くべきことに、研究者たちは、この特化した学習がAIから他の能力を「忘れさせる」ことはないことを見出した。このモデルは一般的な推論能力やコーディング能力を維持しており、標準的な数学や論理のテストにおける性能低下はごくわずかであった。これは、AIに新しいニッチなスキルを教えることが、その一般的な知能を犠牲にすることを必要としないことを示唆している。この研究は、高度に専門化された科学言語において、成功の鍵はモデルの純粋な大きさではなく、それが学習するデータの質と検証にあることを証明している。ソフトウェア自体を教師として用い、あらゆるレッスンを検証させることで、研究者たちは、物理学者が自然の基本法則を探求するために必要な複雑なコードを書くのを支援できるツールを作り上げた。これにより、高エネルギー物理学において長らくボトルネックとなっていた言語への参入障壁を下げたのである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →