技术摘要:通过算子诱导与正则化符号森林进行概率性符号回归以实现方程发现
1. 问题陈述
符号回归(Symbolic Regression, SR)旨在直接从数据中发现控制输入-输出关系的解释性解析表达式,这是科学机器学习中的核心任务。尽管现有的 SR 方法(例如遗传编程、深度符号回归和压缩感知方法)已展现出潜力,但它们面临着显著的统计与计算挑战:
- 对启发式算法的依赖: 许多方法依赖于随机搜索启发式算法,这些算法在平衡预测精度与表达式复杂度方面表现挣扎,尤其是在噪声大、样本量小的科学数据集上。
- 不确定性表征: 当前的方法在表征符号不确定性方面能力有限,通常仅返回单个“最佳”表达式,而无法量化其他结构性解释的可信度。
- 理论空白: 在关于符号回归的后验收敛速率方面缺乏理论处理,特别是在模型误设(misspecification)或非识别性(non-identifiability,即不同的代数表达式产生相同的预测结果)的情况下。
本文通过提出一个统一的概率框架,将符号表达式视为符号树的集成(ensemble),从而实现充分的不确定性传播和严谨的理论保证,旨在填补上述空白。
2. 方法论:BayeSymX 框架
作者引入了 BayeSymX(用于表达式发现的贝叶斯符号回归森林),该框架将未知的回归曲面 f 建模为符号树(即“符号森林”)的仿射组合。
2.1 模型结构
模型假设观测值为 yi=f(xi)+ϵi,其中:
yi=β0+j=1∑Kg(xi;Tj)βj+ϵi
这里,g(x;Tj) 表示第 j 棵符号树 Tj 的求值过程,β 是外部回归系数。这些树是从一组初级特征和数学算子(一元和二元)中递归构建的。
2.2 先验设定
该框架采用了层次化贝叶斯设定,旨在正则化复杂度并学习数据自适应的偏好:
- 树拓扑先验: 采用深度相关的分裂概率 pm=α0(1+m)−δ0 来惩罚深层树,从而强制执行一种形式的奥卡姆剃刀原则,倾向于更简单的表示。
- 算子与特征先验: 与固定权重的做法不同,BayeSymX 对树特定的算子和特征分配权重使用狄利克雷(Dirichlet)先验。这使得模型能够以数据自适应的方式学习哪些算子和特征对特定树是相关的。
- 回归系数: 对外部系数 β 和噪声方差 σ2 采用共轭正态-逆伽马(Normal-Inverse-Gamma, NIG)先验,确保全参数的不确定性传播。
2.3 后验推断
- 边缘化: 利用 NIG 共轭性对连续参数 (β,σ2) 进行解析边缘化,从而得到离散符号森林空间的联合边缘后验(JMP)。
- 采样: 使用“在部分折叠 Gibbs 采样器中的 Metropolis”(Metropolis-within-partially-collapsed Gibbs sampler)来探索符号表达式空间。该采样器利用七种局部树移动操作(生长、剪枝、子树替换、删除、插入、改变特征、改变算子)来遍历离散空间。
- 模型选择(奥卡姆窗口): BayeSymX 并不选择单一的最佳树,而是利用**奥卡姆窗口(Occam's window)**方法。它保留一组高后验概率的森林(Jr),以捕捉多个可能符号模型之间的不确定性。
- 精炼: 后验 MCMC 精炼步骤使用贝叶斯信息准则(BIC)来剪枝冗余树,并对最终表达式进行代数简化。
3. 核心贡献
3.1 理论保证
本文为符号回归建立了新的后验收敛结果,此前该领域缺乏严谨的理论处理:
- 近似可实现性: 在温和的正规性假设下,作者证明了后验分布会围绕真实的生成函数 f0 收敛,其速率受经验近似误差与新推导的符号复杂度尺度(CK,S,n)之间权衡的支配。
- 近参数速率: 在存在精确有限符号表示的情况下,该框架实现了 O(n−1/2(lognloglogn)1/2) 的近参数收敛速率。
- 误设与 Oracle 不等式: 在符号误设(即 f0 不在模型类中)的情况下,本文建立了一个锐利的 Oracle 收敛结果。后验分布围绕最优总体近似误差收敛,而无需像经典误设理论那样需要存在有限个 KL 极小值集或特殊的测试条件。
- 处理非识别性: 这些保证是在预测函数层面制定的,承认了多种不同的符号结构可能代表相同的函数。
3.2 方法论创新
- 算子诱导森林: 使用森林(集成)而非单棵树,既允许加性科学结构,又保持了可解释性。
- 数据自适应学习: 算子/特征权重的狄利克雷先验使模型能够自适应地学习结构偏好,避免了以往贝叶斯 SR 方法(如 BSR)中固定的权重约束。
- 不确定性感知汇总: 奥卡姆窗口策略提供了一种原则性的方法,用于报告多个相互竞争的科学假设,而非单一的点估计。
4. 实证结果
作者在两个不同的基准测试上将 BayeSymX 与最先进的竞争对手(包括 gplearn, operon, PySR, DSR, QLattice, SISSO++, BMS, 和 BSR)进行了对比评估:
4.1 费曼方程 (SRBench)
- 设置: 在不同噪声水平和结构复杂度下,恢复来自《费曼物理讲义》中的 5 个物理定律。
- 发现: BayeSymX 在预测精度(最低测试 RMSE)、符号简洁性(紧凑的表达式)和精确结构恢复方面始终保持卓越的平衡。竞争方法要么无法恢复正确的结构,要么为了达到相似的精度而产生了过于复杂的表达式。BayeSymable 在噪声增加时表现出鲁棒性,而其他方法性能显著下降。
4.2 氧化物钙钛矿催化剂发现
- 设置: 发现连接催化剂组成与氧析出反应(OER)活性的“材料基因”(描述符)。
- 发现: BayeSymX 识别出了紧凑且具有科学解释性的描述符表达式(26–40 个节点),这些表达式恢复了已知的结构-活性关系(例如涉及容忍度因子 μ、电负性 χA,χB)。相比之下,高精度的竞争对手(如 operon)产生了臃肿的表达式(90–104 个节点),而紧凑型方法(如 PySR)则显示出较低的预测性能。BayeSymX 占据了精度-复杂度权衡的帕累托前沿(Pareto frontier)。
5. 重要性与主张
本文声称 BayeSymX 代表了概率性符号回归的一次重大进步,原因如下:
- 统一结构与不确定性: 提供了一个框架,能够同时学习符号结构、通过正则化控制复杂度,并量化跨多个可能模型的不确定性。
- 理论严谨性: 提供了首个处理精确可实现性和误设情况下的符号回归后验收敛保证,建立了近参数速率和锐利的 Oracle 不等式。
- 科学实用性: 证明了在典型的材料发现和物理学等噪声大、样本量小的场景中,概率性方法在恢复可解释科学定律方面可以优于启发式和基于深度学习的方法。
作者总结道,该框架特别适用于科学发现场景,在这些场景中,领域知识引导特征选择,但潜在的函数形式仍然未知,且需要对结构不确定性进行鲁棒处理。