LLM-Based Scientific Equation Discovery via Physics-Informed Token-Regularized Policy Optimization
本文介绍了 PiT-PO,这是一个强化学习框架,它通过强制执行层级物理有效性和标记级结构简洁性,将大语言模型转化为符号回归的自适应生成器,从而实现了最先进的方程发现,并使小规模模型能够超越闭源巨头。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在试图破解谜题的侦探,但你寻找的不是指纹或足迹,而是正在搜寻支配世界运作方式的秘密数学配方。这个领域被称为符号回归(Symbolic Regression)。虽然当今大多数计算机程序都像是一个只给出答案却无法解释“为什么”的黑箱,但符号回归试图从一堆数据中寻找实际的方程——即隐藏在其中的“自然法则”。这就像是在听一首歌,并试图从头开始写出它的乐谱,而不是仅仅跟着哼唱。
长期以来,科学家们一直使用传统方法来寻找这些配方,但这些方法速度缓慢,且常常迷失在各种可能数学公式的浩瀚荒野之中。最近,一种被称为**大语言模型(LLM)**的新型“超级大脑”进入了这场游戏。这些模型与那些能写故事或与你聊天的 AI 是同类型的,但它们也阅读过数百万本科学教科书。因此,它们极其擅长猜测一个科学方程“可能”长什么样。然而,问题在于:这些 AI 模型通常像是一个背下了教科书却从未参加过考试的学生。它们可以吐出一个看起来很正确且完美契合数据的公式,但这个公式可能会违反物理定律,或者变得不必要的复杂,就像一份仅仅因为厨师随兴而为就要求加入一杯盐的食谱一样。
这正是这项新研究的切入点。由 Boxiao Wang 和 Kai Li 领导的研究团队想要解决这个“死记硬背者”的问题。他们创建了一个名为 PiT-PO(物理启发式标记正则化策略优化,Physics-informed Token-Regularized Policy Optimization)的系统。PiT-PO 不仅仅是向 AI 索要一个猜测并听天由命,它将 AI 变成了一个能够实时从错误中学习的学生。这就像是在 AI 身边站着一位严厉而博学的物理老师,在旁边低声提醒:“不,那个项在物理学上讲不通,”或者“你用的配料太多了,简化它!”
该团队构建了一个巧妙的反馈循环。当 AI 生成一个候选方程时,PiT-PO 会根据两条严格的规则对其进行检查。首先,它会检查物理有效性(Physical Validity):这个方程是否遵守物理定律?例如,如果方程预测流体在没有任何能量的情况下向上流动,系统就会给予惩罚。其次,它会检查冗余性(Redundancy):方程是否充斥着不必要的成分?研究人员使用了一种被称为“支持排除定理(Support Exclusion Theorem)”的数学技巧来识别那些仅仅是噪声的项,并对包含这些项的 AI 进行惩罚。
结果令人印象深刻。在测试中,PiT-PO 不仅找到了符合数据的方程,还找到了底层的正确规律,即使是在数据非常杂乱的情况下也是如此。在其中一个涉及丘陵上方空气混沌流动(被称为“周期性丘陵上的流体”)的具体测试中,该 AI 发现了一种建模湍流的新方法,其结果比传统方法更接近现实。或许最令人兴奋的是,该系统的表现如此出色,以至于即使是一个小型、开源的 AI 模型(可以在标准计算机上运行的模型),也能够超越那些庞大且昂贵的“闭源”巨头。
通过教会 AI 从自身的搜索过程中学习,并严格执行物理规则,PiT-PO 将一个静态的猜测机器转变为一个适应性强的科学发现者。它表明,我们不需要等待超级计算机来解锁宇宙的奥秘;只要经过正确的训练,更小、更易获取的 AI 工具也能帮助我们揭示驱动从流体力学到生物生长的各种基本方程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。