← 最新论文
⚛️ phenomenology

LLM-Based FORM Code Generation with Verification-Driven Fine-Tuning

本文通过证明前沿大语言模型在零样本 FORM 任务中表现失败,指出目前缺乏对 FORM 符号处理语言的 AI 支持,随后引入了一种以 FORM 二进制文件作为真值(oracle)的验证驱动微调流水线,用于训练一个紧凑的 8B 参数模型,该模型在代码执行和正确性方面优于规模大得多的前沿模型,同时保留了通用的推理能力。

原作者: Bakar Chargeishvili

发布于 2026-09-22
📖 1 分钟阅读🧠 深度阅读

原作者: Bakar Chargeishvili

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在亚原子世界中,粒子在极短的时间内发生碰撞与衰变,理论物理学家依赖一种专门的语言来描述他们发现的数学规律。这种被称为 Form 的语言并非通用的编程工具,而是一个高度专门化的系统,旨在处理极其复杂的代数表达式。当科学家利用量子场论计算粒子的行为时,所得出的公式可能包含数百万甚至数十亿项。通用计算机程序在面对如此庞大的计算时往往会崩溃,但 Form 通过将中间步骤存储在硬盘而非计算机内存中来应对这一问题。几十年来,这一工具对于揭示宇宙奥秘至关重要,然而它依然难以学习。其语法独特,规则严苛,且直到现在,还没有人工智能能够协助人类为其编写代码。

这一技术空白为卡尔斯鲁厄理工学院的研究人员提出了一个独特的挑战。他们提出了一个根本性的问题:一个接受了海量互联网数据训练的现代人工智能,能否学会编写一种在数据中几乎不存在的语言的代码?他们得到的答案是否定的。当他们测试目前最强大、最先进的 AI 模型时——其中一些模型拥有数千亿个参数——这些人工智能巨头完全失败了。在没有手册或指南参考的情况下,它们无法生成哪怕一行有效的 Form 代码。对于人工智能而言,这种语言实际上是隐形的,是一个零资源领域,模型的规模大小在这里并不重要,重要的是缺乏特定训练。

为了解决这个问题,研究人员采取了不同的方法。他们没有依赖大型模型去猜测规则,而是构建了一个专门的小型 AI,并使用一种严格的自纠错方法对其进行教学。他们创建了一个流水线:由一个强大的 AI 根据简单的英文指令生成候选程序,但这些程序不会立即被信任。相反,它们会被输入到实际的 Form 软件中以检查是否能正确运行。如果代码产生错误或结果不正确,则会被丢弃。只有通过了所有检查(语法、执行和逻辑一致性)的程序才会被保留。这一过程生成了一个包含超过 4,600 个示例的经过验证的库,涵盖了从简单教程到复杂物理计算的各个方面。

利用这些高质量、经过验证的数据,团队对一个拥有 80 亿参数的紧凑型 AI 模型进行了微调。结果显示,这个专家级模型表现优于世界上最大、最昂贵的模型。在一组包含 664 个特定计算任务的任务集中,这个小型专门化模型正确解决了其中的 97.7%。相比之下,即使在提供了语法指南的情况下,那些最大的前沿模型也仅能在约 75% 的相同任务中生成语法有效且能无误运行的代码。在目标明确但未指定方法的开放式任务中,这种优势更加显著:专门化模型成功生成可运行代码的比例为 83%,而最强大的巨型模型仅为 65%。

或许最令人惊讶的是,研究人员发现这种专门化训练并没有让 AI “忘记”如何做其他事情。该模型保留了其通用的推理和编程能力,在标准的数学和逻辑测试中仅表现出极微小的性能下降。这表明,教给人工智能一项新的、小众的技能,并不需要牺牲其通用智能。这项研究表明,对于高度专业化的科学语言,成功的关键不在于模型的规模,而在于其学习数据的质量和验证。通过使用软件本身作为老师来验证每一课,研究人员创造了一个工具,现在可以协助物理学家编写探索自然基本法则所需的复杂代码,从而降低了这一长期以来在高能物理领域造成瓶颈的语言的学习门槛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →