← 最新论文
🤖 machine learning

A Comparative Study of Model Selection Criteria for Symbolic Regression

本文对七个人工合成数据集上的符号回归模型选择标准进行了系统的实证比较,结果表明最小描述长度(MDL)和贝叶斯信息准则(BIC)是识别真实表达式并最小化测试误差的最有效方法。

原作者: Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图解开一个谜团。你有一堆略显杂乱且充满噪声的线索(数据)——也许有些脚印沾满了泥巴,或者某些证人证词中有几个拼写错误。你的目标是重构事件发生的精确序列(即“真实情况”)。

在计算机科学领域,这被称为符号回归。计算机寻找的不是脚印,而是一个能够解释数据的数学公式。计算机生成了成千上万个可能的公式,从像"y = x + 1"这样简单的公式,到极其复杂、纠缠不清、看起来像一碗意大利面的公式。

问题出在哪里?计算机非常擅长死记硬背那些杂乱的线索。它可能会创建一个能够完美拟合那些泥泞脚印的公式,但如果你给它展示一组新的脚印,那个公式就会彻底失败。这被称为过拟合。这就像一个学生死记硬背了练习题的答案,却因为没有理解概念而在真正的考试中惨败。

那么,如何从计算机生成的成千上万个公式中挑选出最好的那个呢?你需要一个“模型选择准则”——一套规则或一位法官,来决定哪个公式是获胜者。

参赛选手

本文的作者组织了一场竞赛,看看哪位“法官”表现最佳。他们创建了七个不同的谜团场景(合成数据集),已知答案,并向其中添加了一些噪声。然后,他们让计算机生成一批候选公式,其中包含一些故意过度复杂(过拟合)的公式。

他们测试了五位不同的法官(准则),看看哪一位能从一堆杂乱的公式中选出正确、简单的公式:

  1. MSE(训练误差):这位法官只关注公式拟合当前杂乱线索的程度。这就像一个只钻研练习题的学生。它倾向于选择最复杂、过拟合的公式。
  2. AIC(赤池信息量准则):一位经典的法官,试图在准确性与简洁性之间取得平衡。它会对公式中的每一个额外部分给予轻微的“惩罚”。
  3. AICc:AIC 的修正版本,旨在数据量不足时表现得更为严格。
  4. BIC(贝叶斯信息量准则):一位比 AIC 更严格的法官。它对复杂性的惩罚更重,尤其是随着数据量的增长。它非常讨厌不必要的部分。
  5. MDL(最小描述长度):这位法官使用了一个巧妙的比喻:“描述公式和数据的最短信息传递方式是什么?”如果公式太复杂,信息就会变得太长。MDL 寻找对真理最高效的“压缩”。
  6. Errin(自举估计):这是计算成本最高的法官。它通过向数据添加随机噪声来模拟实验数百次,以观察公式的波动程度。这就像在平行宇宙中运行实验 200 次以确保万无一失。

结果

这篇论文让这些法官相互较量,发现了一些明确的胜者和败者:

  • 败者:简单的“训练误差”(MSE)表现糟糕。它始终选择最复杂、过拟合的公式,导致无法泛化。
  • 重量级选手MDLBIC是冠军。
    • MDL最为稳定。它几乎总是能找到最简单、最准确的公式。它最擅长忽略“噪声”并找到真正的信号。
    • BIC紧随其后,同样出色地找到了正确、简单的公式。
  • 中间派:AIC 和 AICc 表现尚可,但在对待复杂性方面比 MDL 和 BIC 更宽容。
  • 过度努力者(却感到疲惫)Errin很有趣。有时它表现极佳,但经常选择过大且复杂的公式。此外,它的速度极慢——就像一位法官花了一周时间才裁决一个本可以在一分钟内解决的案件。

核心启示

如果你正在构建一个从数据中寻找数学公式的系统,不要仅仅选择最拟合当前数据的那个公式。那是一个陷阱。

相反,将**MDL(最小描述长度)**作为你的默认选择。这就像拥有一位明智的编辑,他会剔除所有废话,只留下最简洁、准确的故事。如果 MDL 对你的特定问题来说过于严格,BIC是一个极佳的备选方案。

该论文得出结论:虽然没有一位法官能完美适用于每一个场景,但 MDL 和 BIC 是寻找公式的最可靠工具。这些公式不仅准确,而且足够简单,能够被理解并在现实世界中发挥作用。它们在“拟合数据”与“不记忆噪声”之间取得了最佳平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →