InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance
InsightSR 是一种新颖的符号回归框架,它通过利用大语言模型通过语义和结构指导来迭代优化搜索空间,将深层表达式树的构建转化为在语义知情特征上的浅层树组装,从而增强了 PySR 遗传编程引擎,并实现了最先进的准确性和泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
科学一直以来都依赖于一个简单而强大的理念:自然界的复杂行为可以用简洁的数学定律来描述。当物理学家观察一个落下的苹果或行星轨道时,他们看到的不仅仅是运动;他们是在寻找支配这种运动的隐藏方程。这种对底层公式的搜寻被称为符号回归(symbolic regression)。与通过调整数百万个内部旋钮来拟合数据的标准计算机模型不同,符号回归试图直接写出实际的方程,使用加法、乘法和三角函数等熟悉的数学构建模块。其目标是找到一个不仅准确,而且简单到足以让阅读和理解的人类理解的规则。然而,寻找这些规则极其困难。可能的数学组合数量增长得如此之快,以至于它变成了一个庞大且混沌的可能性海洋。大多数计算机搜索都会迷失在这片海洋中,生成的公式虽然完美拟合了数据,但在物理学上毫无意义,或者它们根本无法找到真正的定律,因为搜索空间过于巨大,无法被完全探索。
一组研究人员开发了一种新方法来应对这种混沌,将进化算法的原始搜索能力与大语言模型的推理能力相结合。他们的系统名为 InsightSR,它并不要求计算机直接猜测最终答案。相反,它使用语言模型作为引导,来重塑搜索过程本身。想象一下,一支探险队试图在茂密且未知的森林中寻找一条特定的路径。在旧方法中,探险者会随机游走,希望偶然撞见正确的路径。而在这种新方法中,语言模型扮演着一位了解大致地形的资深向导。它并不替他们走完路径,但它会告诉他们哪些方向在物理上是不可能的,并建议哪些工具可能对旅程有所帮助。
该系统通过两个互补的流向来进行引导。第一个流向关注方程的“骨架”。语言模型观察数据的物理单位——例如一个变量代表的是时间、距离还是质量——并提出必须符合量纲一致性的基本结构。这意味着它排除了任何违反物理定律的数学组合,比如将时间测量值与距离相加。通过用这些在物理上合理的起点来播种搜索,该系统避免了在数十亿个不可能的公式上浪费时间。第二个流向则关注“成分”本身。语言模型根据它在之前尝试中看到的模式,建议新的方式来转换原始数据,例如将一个变量平方或取其正弦值。这些新的特征被添加到搜索引擎可用的成分池中。随着时间的推移,成分池变得更加丰富,使得系统能够利用简单、浅层的组合来构建复杂的关系,而不是试图构建由原始数据组成的深层、纠缠的树状结构。
这个过程不是一次性的猜测,而是一个持续精炼的循环。在计算机生成一组候选方程后,语言模型会对其进行评估。它不仅检查这些方程对数字的拟合程度,还检查新特征是否有用,以及结构是否合理。这种反馈被存储在一个动态知识库中,为下一轮搜索提供信息。系统从自身的成功和失败中学习,逐渐将搜索范围缩小到最有希望的解。这创造了一个自我修正的循环,使搜索过程随着每一次迭代变得更加聚焦且高效。
研究人员在三个不同的挑战集上测试了这种方法。首先,他们使用了一个包含 100 个著名物理方程(涵盖从经典力学到量子理论)的基准测试。在此测试中,系统成功找回原始精确公式的概率高达 95%,较以往的方法有了显著提升。它在涵盖化学、生物学和材料科学的更广泛科学问题上也表现出色,在涉及复杂变换的任务中达到了 80% 以上的准确率。最后,团队在现实世界的数据上测试了该系统,例如振荡器的振动和细菌的生长模式。在这些场景中,系统不仅找到了准确的公式,而且在处理从未见过的数据时仍能保持性能,展示了强大的泛化能力。
结果表明,通过将语言模型作为引导层嵌入到传统的搜索引擎周围,可以克服庞大搜索空间和物理一致性这两个挑战。该系统并非取代进化搜索,而是对其进行精炼,将盲目的、随机的探索转变为有目的的、受引导的发现。通过将负担从构建原始变量的深层、复杂树状结构,转向从一个丰富的、预先增强的特征集中组装简单的组合,该方法使科学定律的发现变得更加高效且可靠。这种方法为自动化科学发现提供了一条切实可行的路径,表明人类般的推理与基于机器的搜索相结合,可以揭示支配我们世界的隐藏数学规律。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。