想象一下你是一名正在试图利用一组线索(数据)来破解谜团的侦探。你的目标是找到一个完美的“规则”或“公式”,来解释这些线索是如何结合在一起的。这正是**符号回归(Symbolic Regression, SR)**所做的事情:它在庞大的数学函数库中进行搜索,以寻找最能描述你的数据的那个函数。
然而,在现实世界中,线索很少是完美的。它们可能被抹脏了,或者是在手抖时测量出来的,亦或是本质上具有随机性。这就是**不确定性量化(Uncertainty Quantification, UQ)**发挥作用的地方。你可以把 UQ 想象成侦探的“信心计”。一个拥有 UQ 的优秀侦探不会仅仅说:“规则是 y=2x”,而是会说:“规则很可能是 y=2x,但我只有 95% 的把握,真实的答案可能在 1.8x 到 2.2x 之间的任何地方。”
这篇论文是对研究人员目前如何尝试构建这些“信心计”的一次综合调查(一次大型综述)。作者认为,虽然符号回归在寻找规则方面变得越来越出色,但在告诉我们应该在多大程度上信任这些规则方面,它仍然表现得很糟糕。
以下是使用简单类比对该论文主要思想的拆解:
1. 两种类型的“怀疑”
论文解释了侦探感到不确定的两个主要原因:
- “混乱的线索”(偶然不确定性/Aleatoric Uncertainty): 想象你在测量一个弹跳球的高度。无论你测量多少次,它每次弹跳的表现都会不同。这是你无法通过增加数据来消除的噪声。UQ 能帮你意识到:“嘿,这个球本身就是混乱的;我无法预测精确的弹跳,只能预测平均值。”
- “缺失的知识”(认知不确定性/Epistemic Uncertainty): 想象你正在试图猜出一个秘密代码,但你只有三个线索。你不知道规则是因为你见过的例子还不够多。这是一种知识的匮乏。如果你获得更多线索,这种怀疑就会减少。UQ 能帮你意识到:“我之所以在瞎猜,是因为我见到的数据还不够多。”
2. 三种衡量信心的方法
论文将现有的方法归纳为三种计算该“信心计”的“学派”:
A. 频率派方法(“重复实验”俱乐部)
- 类比: 想象你烤了一个蛋糕,味道非常完美。为了知道它到底是“真的完美”还是仅仅因为运气好,你烤了 100 次。如果其中 95 次味道都很好,那么你就有了信心。
- 运作方式: 这些方法假设存在一个“真实”的规则,但我们的数据是有噪声的。它们利用数学(如费舍尔信息量/Fisher Information)来观察最优答案所在位置的“山丘”形状。
- 尖锐的山峰: 如果山丘是一个尖锐的突起,你就知道顶端在哪里(高信心)。
- 平坦的高原: 如果山丘是一个平坦的桌面,你站在任何地方都依然是“正确”的(低信心)。
- 工具: 它们使用置信区间(Confidence Intervals)(规则数值的一个范围)和预测区间(Prediction Intervals)(对未来预测的一个范围)。它们还使用符合性预测(Conformal Prediction),这就像是一个安全网,它能保证你的预测在一定百分比的时间内是正确的,而无需假设数据遵循特定的模式。
B. 贝叶斯方法(“更新信念”俱乐部)
- 类比: 想象你最初对规则有一个直觉(先验信念)。随着你获得新的线索,你会更新你的直觉。你不仅仅是在寻找 一个 最好的规则,而是在脑海中保留一整片可能的规则“云”,每条规则都有其存在的概率。
- 运作方式: 这些方法并不只是寻找单一答案,而是试图描绘出整个可能性的“云图”。
- 置信区间(Credible Intervals): 这是置信区间的贝叶斯版本。它表示:“有 90% 的概率,真实的规则在这个框内。”
- 挑战: 计算这个“云图”非常困难。论文讨论了诸如 MCMC(马尔可夫链蒙特卡洛法)——它像是一个醉汉的随机游走,最终能绘制出整个领地;以及 SMC(序列蒙特卡洛法)——它利用一群粒子更高效地探索领地。
- 创新: 一些研究人员正尝试不仅使用这些方法来寻找规则中的数字,还要寻找规则本身的形状(例如:是一条直线?还是曲线?还是树状结构?)。
C. 模型选择(“挑选最佳侦探”俱乐部)
- 类比: 你对这个谜团有 10 种不同的理论。有些很简单(只有一个嫌疑人),有些很复杂(涉及 50 个人的阴谋)。你如何挑选出正确的理论,而不至于陷入一个过度拟合数据的“阴谋论”中?
- 运作方式: 本节探讨了诸如 MDL(最小描述长度) 之类的方法。把它想象成一场“压缩”游戏。最好的规则是那些能用最少的词汇(比特)来解释数据的规则。如果一个规则过于复杂,就像试图把一本书压缩成一句话——它会失去意义。这些方法会对过于复杂的规则进行惩罚,以确保侦探不会被随机噪声所迷惑。
3. 综述的发现
作者查看了许多研究论文,并发现了几个关键点:
- 这是一个新领域: 只有极少数论文(主要来自过去几年)真正正在做这件事。大多数符号回归研究只关注如何找到“最佳”答案,而忽略了我们应该对它有多少怀疑。
- 贝叶斯方法很受欢迎: 因为符号回归非常灵活,很难使用(假设规则简单且稳定的)“频率派”数学。因此,大多数新技术都在使用贝译斯方法来处理复杂性。
- “结构”问题: 计算公式中数字的不确定性很容易(比如 2x 中的“2”)。但计算公式形状的不确定性要难得多得多(是 x2 还是 x3?)。论文强调,虽然一些研究人员正在尝试解决这个问题,但这仍然是一个重大挑战。
- “噪声”问题: 有时数据本身是混乱的(例如 x 轴也有误差,而不仅仅是 y 轴)。大多数标准方法忽略了这一点,但一些先进的论文开始着手解决这个问题。
核心结论
论文总结道,符号回归目前对自身的不确定性是“盲目”的。 这就像一个 GPS 告诉你向左转,但它没告诉你这条路是否实际上已经封路,或者地图是否已经过时。
作者呼吁科学界不要仅仅寻找“最佳”数学规则,而要开始构建能够告诉我们我们可以信任该规则到什么程度的工具。他们认为,如果没有这个“信心计”,我们就无法安全地将这些强大的 AI 工具用于那些出错代价高昂的现实世界决策中。
技术摘要:符号回归中不确定性量化的全面且易懂的综述
问题陈述
符号回归(Symbolic Regression, SR)是一类旨在发现能够准确捕捉数据集中潜在关系的数学函数的搜索算法。尽管近期取得了进展,但由于缺乏对**不确定性量化(Uncertainty Quantification, UQ)**的支持,SR 在实际决策过程中的应用受到了限制。在回归分析中,UQ 对于评估模型可靠性、通过解释数据噪声(偶然不确定性/Aleatoric Uncertainty)来防止过拟合以及为决策提供见解至关重要。
SR 面临两种主要的不确定性来源:
- 偶然不确定性(Aleatoric Uncertainty): 数据生成过程中固有的随机性或测量不精确性。这是不可约减的,但可以通过量化来估计由噪声引起的误差下界。
- 认知不确定性(Epistemic Uncertainty): 对真实模型知识的缺乏。这包括:
- 模型不确定性: 模型空间 H 中不存在真实模型 h∗ 的风险。
- 近似不确定性: 关于特定假设 h 是否为 H 中最佳假设的不确定性,这通常可分解为参数不确定性(调节参数 θ 的不确定性)和结构不确定性。
虽然传统的 SR 文献侧重于高效遍历多峰搜索空间,但往往没有明确处理不确定性问题。本综述旨在引入核心 UQ 概念并回顾现有文献,以提高对可靠 UQ 方法的认识并促进其发展。
方法论与理论基础
本文围绕三个研究方向构建综述结构:频率派(Frequentist)、贝叶斯派(Bayesian)和模型选择(Model Selection)。它利用似然函数和费雪信息(Fisher Information)建立了理论基础。
1. 统计基础
- 似然与费雪信息: 综述定义了似然函数 LN(θ) 及其对数变换。它利用对数似然的黑塞矩阵(Hessian matrix)来估计参数确定性。负黑塞矩阵对应于观测费雪信息,其中较小的信息值表示平坦的似然曲面(高不确定性),而尖锐的峰值则表示精确的估计。
- 频率派方法: 将参数视为固定但未知的量。通过参数的**置信区间(CI)和输出的预测区间(PI)来实现 UQ。文中详细说明了使用逆黑塞矩阵计算标准误差的方法,并讨论了符合预测(Conformal Prediction, CP)**作为一种无分布方法的优势,该方法保证了对于可交换数据的覆盖率,这与依赖高斯假设的传统 PI 形成对比。
- 贝叶斯方法: 将参数视为具有分布的随机变量。通过从后验分布 p(h∣D)∝p(h)p(D∣h) 中提取置信区间(CrI)来实现 UQ。文中讨论了 马尔可夫链蒙特卡洛(MCMC) 和 序列蒙特卡洛(SMC) 作为近似难以处理的后验分布的方法。此外,还涵盖了用于处理近似不确定性的贝叶斯模型平均(BMA)。
- 模型选择: 综述回顾了诸如贝叶斯因子(Bayes Factor)、分数贝叶斯因子(FBF)(用于处理不恰当先验)以及**最小描述长度(MDL)**原则等原理,后者通过最小化编码长度来平衡模型复杂度和数据拟合度。
2. SR 特定 UQ 文献综述
作者调查了来自同行评审期刊、会议和预印本的 18 篇相关文章(11 篇贝叶斯,4 篇非贝叶斯,3 篇模型选择)。
SR 中的贝叶斯方法
- 序列蒙特卡洛(SMC): 一系列研究(Bomarito 等,Leser 等)将 SMC 集成到遗传编程(GP)中以进行 SR。他们提出了局部优化和选择的概率重构形式。该方法通过估计**归一化边际对数似然(NMLL)**来比较模型。它使用 SMC 来近似参数上的积分,比拉普拉斯近似(Laplace approximations)能更好地处理多峰后验分布。最近的研究将其扩展到直接对离散模型结构进行边缘化,将符号模型种群视为加权后验。
- 结构先验: Guimera 等和 Bartlett 等引入了关于模型结构的启发式先验。Guimera 等利用来自语料库(维基百科)的算子频率来定义先验;而 Bartlett 等则使用语言模型(n-gram)来建模基于祖先节点的条件概率,旨在捕捉表达式树中的上下文。
- X 轴不确定性: Bartlett 和 Desmond 制定了包含自变量(x)测量误差的似然函数,通过对真实值进行边缘化来推导修正后的似然函数。
- 集成方法: Agapitos 等提出对多样化模型种群进行贝叶斯模型平均,以解释近似不确定性。
- 线性贝叶斯森林: Roy 等提出了 HierBOSSS(线性组合符号树的森林)和 VaSST(使用变分推理处理软符号树)。这些方法利用共轭性处理线性系数,但依赖于均值场近似处理树结构。作者指出其在线性假设方面的局限性以及实验复现中的潜在不一致性。
- 后验 MCMC: Zhao 和 Zhao 将 MCMC 应用于 SR 找到的最终模型,以计算系数和预测的置信区间。
非贝斯方法
- 分位数回归: Hoekstra 和 Hengst 使用分位数损失(pinball loss)替换 SR 适应度函数以估计条件分位数,从而有效地生成预测区间。
- 剖面似然(Profile Likelihood): de Franca 和 Kronberger 使用剖面似然来计算参数和预测的非对称置信区间,捕捉了 δ 方法近似所忽略的参数间依赖关系。
- 自助法(Bootstrapping): Manzi 和 Vasile 应用自助法生成多个样本,拟合 SR 模型,并通过直方图可视化参数分布,以评估结构和参数不确定性。
- 噪声终端符号: Schmidt 和 Lipson 引入了一个随机终端符号,直接在表达式中建模非线性噪声关系,从而优化预测区间的范围。
- SR 中的符合预测: Thuong 等将 CP 应用于最佳模型的后验处理,或将其作为区间宽度纳入适应度函数中,发现后验应用效果更好。
模型选择
- SR 中的 MDL: Iba 等和 Nikolaev 将 MDL 应用于多项式模型(STROGANOFF)和穷举搜索,利用编码长度来惩罚复杂度。Bartlett 等提出了一个详细的 DL 指标,用于枚举表达式,该指标通过离散化考虑了函数复杂度和参数精度。
主要结果与发现
- 时效性: 在调查的 18 篇论文中,只有 3 篇发表于 2020 年之前,表明 UQ 在 SR 中是一个快速兴起的领域。
- 方法多样性: 虽然存在传统的 UQ 方法(如 CI),但将其直接应用于 SR 的情况很少。大多数调查的作品(约 60%)采用了贝叶斯方法,利用采样方法(MCMC, SMC)来本质地提供 UQ。
- SMC 与 Laplace 的对比: 基于 SMC 的 SR 方法(Bomarito 等)表现出比拉普拉斯近似更强的捕捉多峰后验分布的能力,尽管计算成本更高。
- 结构先验: 引入结构先验(例如基于语言模型或算子频率)有助于模型选择并减少过拟合,尽管它们可能会限制对训练语料库中不存在的新颖表达式的探索。
- 现有方法的局限性:
- 许多贝叶斯 SR 方法(如 VaSST)依赖于均值场近似,忽略了节点间的依赖关系,可能导致次优的全局结构。
- 线性贝叶斯森林受限于参数呈线性的模型。
- 某些提出的方法(如 HierBOSSS, VaSST)在实验复现和代码一致性方面面临挑战。
- 频率派方法在 SR 中难以应用,因为灵活的 SR 模型极易过拟合,使其不适合作为某些方差计算所需的无偏估计量。
重要性与主张
本文声称是第一篇明确探讨 SR 中 UQ 问题的综述。其主要意义在于:
- 弥合差距: 它将成熟的统计 UQ 概念(频率派和贝叶斯派)与 SR 的特定挑战(如模型结构的离散性和多峰搜索空间)联系起来。
- 分类体系: 它将碎片化的文献组织为三个连贯的研究方向:频率派、贝叶斯派和模型选择。
- 强调被忽视的领域: 作者得出结论,UQ 在 SR 中仍在很大程度上被低估了,其重要性被系统性地忽视。
- 未来方向: 本文认为,未来的工作必须采用成熟的 UQ 方法应用于 SR,并结合对数据和噪声的仔细分析,以开发可靠的模型用于现实世界的决策。文章强调,虽然 UQ 可以通过采样法“免费”获得,但目前的实现方案在计算成本、结构先验和处理多峰性方面仍存在显著局限。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。