← 最新论文
💻 computer science

Learned variable-support priors accelerate symbolic regression of physical laws

本文介绍了 DenoisedSR,这是一种与求解器无关的前端,它通过学习可变支持先验,在无关变量到达后端求解器之前对其进行过滤,从而显著加速并提高用于发现物理定律的符号回归的准确性。

原作者: Chenxi He, Jingqiu Chen

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenxi He, Jingqiu Chen

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名试图破解谜题的侦探:控制这组数据的隐藏规则是什么?

在物理学世界中,这个规则通常是一个数学公式(例如 $F=ma$)。自动寻找这类公式的过程被称为符号回归(Symbolic Regression)。问题的难点在于,这些公式的“搜索空间”就像一个拥有数十亿本书的图书馆,但其中只有极少数包含正确答案。大多数书都是毫无意义的废话,而且随着我们不断加入更多的“干扰变量”(无关线索),这个图书馆正变得越来越庞大。

以下是该论文如何利用简单的类比来解释其解决方案——DenoisedSR

1. 问题所在:在干草堆中寻针

想象你正在干草堆中寻找一根特定的针。但这不仅仅是一个普通的干草堆;有人还扔进去了 20 件看起来几乎和针一模一样的垃圾(稻草、塑料、旧袜子)。

  • 传统求解器: 这些就像是一个盲目的机器人,它会捡起每一件垃圾,尝试用它们盖房子,偶尔才会找到那根针。这种方式效率低下,且容易被垃圾干扰而产生混乱。
  • 论文的方法: 他们并没有试图制造一个更好的机器人去搜寻整个干草堆,而是制造了一个超级智能的金属探测器(即“前端”),在机器人开始工作之前运行。

2. 解决方案:“金属探测器”(DenoisedSR)

作者创建了一个名为 DenoisedSR 的系统。你可以把它想象成一名训练有素的助手,他观察着线索堆(数据)并说道:

“嘿,我有 96% 的把握确定,在这 20 件物品中,只有这 3 或 4 件才是真正重要的。忽略其他的吧。”

这个助手并不试图亲自解开谜题。它只是缩小了搜索范围。它告诉主侦探:“别在其他 16 件物品上浪费时间了;把注意力集中在这几件上面。”

3. 它是如何工作的(“双头”侦探)

该系统使用两种不同的思维方式来进行这种预测:

  • 统计学家: 观察数字。 “当答案上升时,这个变量是否也随之上升?它们是否同步变化?”
  • 图谱侦探: 观察名称及其关系。 “在物理学中,我们知道‘质量’和‘重力’通常是联系在一起的。如果我看到了‘质量’,我也应该把‘重力’保留下来。”

通过结合这两者,系统创建了一个**“支持先验”(Support Prior)**。这是一个“疑似嫌疑人”名单,其准确度极高,几乎从不会错过真正的罪魁祸首(真实的变量)。

4. 结果:更快、更聪明

当他们将这份“短名单”交给主搜索引擎(“后端”)时,结果非常显著:

  • 速度: 搜索速度提升了高达 6 倍。这就像是在你开始寻找之前,就已经把干草堆的大小缩减了 85%。
  • 准确性: 找到精确正确公式的成功率从 42% 跳升至 60%
  • 可靠性: 即使在数据充满噪声(比如在风暴中听取耳语)的情况下,“金属探测器”依然能找到正确的线索。

5. 这不仅仅是“挑选更少的项目”

怀疑论者可能会说:“也许它之所以奏效,仅仅是因为你查看的项目变少了。”
为了证明这一点,作者进行了一项对照测试。他们给搜索引擎提供了一份随机生成的、数量相同的项目列表,但并没有使用“金属探测器”进行筛选。

  • 结果: 随机列表反而让搜索引擎的表现变差了
  • 结论: 奇迹不在于拥有更少的项目,而在于拥有正确的项目。“金属探测器”提供了真正的引导,而不仅仅是缩小了规模。

6. “黑盒” vs. “白盒”

一些现代 AI 试图一次性猜出整个答案(就像一个直接吐出公式的“黑盒”)。这些 AI 往往能找对食材,但会把它们混淆(例如,把“力等于质量乘以速度”说成“质量乘以速度等于重力”)。

  • DenoisedSR 的策略: 它承认,“我擅长寻找食材,但不擅长烹饪最终的菜肴。”因此,它将这份精选的食材清单交给一位传统的、可验证的“大厨”(后端求解器)来烹饪最终的食谱。这确保了最终答案在数学上是正确的,并且是人类可读的。

总结

这篇论文介绍了一种作为科学发现智能过滤器的工具。它并不取代搜索引擎,它只是清除了杂乱。通过高精度地预测哪些变量是相关的,它使得现有工具能够更快、更频繁、且更少出错地发现物理定律,即使在数据混乱或充满红鲱鱼(误导信息)的情况下也是如此。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →