← 最新论文
⚛️ phenomenology

BootLoops: an LLM-driven toolkit for exact quantitative science

BootLoops 是一个由大语言模型驱动的工具包,它统一了来自物理学、数学和计算机科学的高级精确计算方法,使智能体模型能够在不同科学领域中执行严谨的定量分析——例如计算费曼积分、贝叶斯证据和构型枚举——并保证精度。

原作者: Matthew D. Schwartz

发布于 2026-10-05
📖 1 分钟阅读🧠 深度阅读

原作者: Matthew D. Schwartz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在科学计算的大部分历史中,人类编写程序,明确知晓其功能,然后由计算机执行。随后,范式发生了转变:人类指定架构,计算机拟合数据中的神经网络,人类再解释结果。现在,一场新的变革正在发生。大型语言模型作为一个半自主智能体,可以设计并编写程序、运行程序,并自行审查和解释答案。这类系统的潜力似乎是无限的,但一个关键问题仍然存在:人类如何才能最有效地利用这些智能体?答案在于连接遥远的领域。用于粒子物理的方法可能会解决生态学问题,或者来自数值分析的工具可能会澄清公共卫生领域的监管阈值,但很少有人能同时精通这两个领域以建立这种联系。而大型语言模型阅读了所有文献,它两者皆通。

本文介绍了 BootLoops,这是一个旨在利用这种广博知识的工具包。它是一系列专门的计算机程序,语言模型可以操作并扩展这些程序,以进行精确的定量科学研究。该工具包汇集了来自对撞机物理学、实验数学和计算机代数的各种方法,用以解决那些通常使用近似值或隐藏着舍入误差的浮点数进行计算的问题。BootLoops 不再进行猜测或估计,而是允许模型将答案计算为精确的有理数,证明解的存在性或不存在性,并进行带有保证误差范围的计算。其目标不是取代人类科学家,而是为他们提供一种手段,利用一个领域的工具来解决另一个领域的问题,将人类难以建立的联系转化为常规操作。

这项工作的核心在于一个处于循环中的大型语言模型,它通过发布命令来执行程序并读取输出。当面临困难的计算时,模型会规划步骤,选择工具包中最合适的工具并运行它们。如果缺少某种工具,模型会编写一个新的例程,对其进行测试,并将其添加到集合中。这些程序计算每一个数字和符号;模型从不猜测数字。该工具包在不同的问题之间保持持久性,并随着新方法的加入而不断成长。它包含将复杂积分简化为有限基底的程序、求解微分方程的程序,以及将精确常数拟合到高精度数字中的程序。其中一些程序是来自物理学和数学的公开代码,另一些则是专门为本项目从头编写的。为了处理文中描述的计算,总共编写了大约一百个新程序。

BootLoops 的第一个重大应用是计算费曼积分(Feynman integrals),这些积分描述了粒子的散射与相互作用。几十年来,物理学家通过直接积分或逐点估计来计算这些积分。BootLoops 采取了不同的方法,使用一种称为“引导”(bootstrap)的方法。模型首先识别出由问题定义的几何形状,这个形状可能是一个简单的球面、一条椭圆曲线,或是一个被称为卡拉比-亚au流形(Calabi-Yau manifold)的复杂形状。这种几何形状决定了能够描述答案的函数类型。随后,模型构建一个带有未知系数的一般公式,并利用高精度数值样本来拟合这些系数。结果是一个闭合形式的答案,即一个精确的数学表达式,而非仅仅是一组数字。作者计算了三十个此类积分,涵盖了从简单的单圈图到复杂的四圈结构。其中十五个在文献中已有记载,另外十五个则是全新的、此前未见计算结果的积分。每个结果都通过独立于三十位或更多位精度的数值评估进行了校验,确保了答案的正确性,而不依赖于模型的直觉。

第二个应用展示了这些物理学工具如何解决生物学和统计学问题。在进化生物学等领域,科学家通过比较不同的物种谱系树,以观察哪一种最能解释 DNA 数据。这需要计算“贝叶斯证据”(Bayesian evidence),即一个代表特定树结构下数据概率的数值。传统上,这使用蒙特卡洛方法进行估计,这种方法速度较慢且带有自身的估计误差。BootLoops 识别出这些生物学证据积分的数学原理与费曼积分的数学原理是完全一致的。通过应用相同的约化和拟合技术,该工具包将这些证据计算为精确的有理数。对于简单情况,答案是一个精确的分数;对于更复杂的情况,它提供一个包含真实值的保证区间。这使得科学家能够以绝对的确定性来比较谱系树,而这在以往利用浮点数进行估计时是不可能实现的。同样的方法也被应用于统计学中的混合模型、种群遗传学和单细胞生物学,在这些领域,它为通常依赖噪声模拟的问题提供了精确答案。

第三种能力是进行带有完备性证明的穷举搜索。在许多科学问题中,答案取决于检查所有可能的案例,或者证明不存在某种类型的案例。BootLoops 可以枚举有限空间内的每一种配置,例如弦理论中磁通量的可能排列方式,或是数据分组以获得质量评级的最优方式。它在进行时带有严谨的证明,确保没有遗漏任何情况。如果搜索找到了解,它会返回完整的列表;如果找不到解,它会提供一个证明不存在该对象的定理。例如,该工具包被用于分析沃森积分(Watson integral),这是一个关于随机游走的著名数学问题。通过穷举所有可能的闭合形式解的类别,模型证明了对于一般情况,不存在这样的闭合形式解,这一结果在过去数十年间一直是一个悬而未决的问题。这使原本可能是启发式或不完整的搜索转化为了数学上的确定性。

最后,该工具包解决了标准计算中的舍入误差问题。当计算机使用浮点运算时,微小的误差会累积并导致错误答案,尤其是在长链计算中。BootLoops 使用“区间算术”(ball arithmetic),其中每个数字都被视为一个带有保证误差半径的中点。随着计算的进行,这个半径会扩大或缩小,从而确保真实值始终包含在范围内。如果误差变得过大而不再具有参考价值,系统会拒绝给出答案,而不是给出一个错误的答案。这种方法被用于审计已发表的数据,例如空气质量的监管阈值和医疗评分。在一个案例中,工具包使用精确算术重演了美国臭氧标准的计算过程,发现发表的结果取决于数字截断的方式,而这一细节被浮点运算所掩盖。在另一个案例中,它验证了联邦医疗保险星级评分(Medicare star ratings)的精确值,证明了发表的切分点确实是最优的。

论文总结道,代理型人工智能的真正力量在于其结合不同领域知识的能力。BootLoops 是尝试将这些方法汇聚成一个单一且可扩展工具包的首次尝试,且该工具包可由语言模型操作。它并不旨在单向推动人类知识的边界,而是旨在填补现有领域之间的空白。该工具包是开源的,并旨在持续成长,期望科学家们在发现新方法时能将其加入其中。作者强调,虽然模型编写代码并运行工具,但结果并非基于模型的判断,而是基于程序的确定性执行。这项工作证明了,通过整合对撞机物理学的约化算法、统计学的证据积分以及数值分析的严密界限,我们可以以前所未有的精度和确定性来解决长期存在的问题。该工具包及其文档已开放供所有人使用和扩展,这标志着人类科学知识凸包被充分探索的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →