Enhancing Generalization in Evolutionary Feature Construction for Symbolic Regression through Vicinal Jensen Gap Minimization
本文提出了一种用于符号回归的进化特征构建框架,该框架通过将动态最小化邻域詹森间隙(vicinal Jensen gap)作为正则项,并结合噪声估计与流形侵入检测,从而增强泛化能力,以有效控制在不同数据集上的过拟合问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:教机器人学会“不作弊”地学习
想象一下,你正在试图教一个机器人(一种被称为遗传编程的算法)如何根据一组线索(数据)来预测天气或股票价格。这个机器人非常聪明且富有创造力;它可以发明自己的复杂公式来解决问题。
然而,这个机器人有一个坏习惯:过拟合(Overfitting)。
把过拟合想象成一个学生,他完美地背下了某次特定练习考试的所有答案,但在真正的考试中却失败了,因为他并没有理解其中的概念,他只是死记硬背了练习题中的噪声和怪癖。在数据的世界里,这意味着机器人学习的是训练数据中的“噪声”(随机误差),而不是真实的模式。
这篇论文介绍了一种新方法,旨在教机器人成为一个“优秀的学习者”,而不仅仅是一个“背诵者”。他们将这种方法称为近邻詹森间隙最小化(Vicinal Jensen Gap Minimization)。
问题所在:为什么“死记硬背”很糟糕
过去,科学家们试图通过强制机器人保持公式简短和简单(比如限制文章的字数)来防止其死记硬背。但作者发现,一篇短文可能依然是胡言乱语,而一篇长文也可以是精彩绝伦的。规模并不是唯一重要的因素;平滑度和逻辑性更为重要。
解决方案:“邻居测试”
作者意识到,一个好的模型不应该仅仅在它见过的精确数据点上表现正确;它在这些点的“邻居”身上也应该是正确的。
想象你在森林中行走。如果你在某个特定位置看到一棵树,你会预期附近的树看起来也大体相似。如果你迈出一小步,那棵树突然变成了一根香蕉,这就很奇怪。一个好的模型应该是“平滑”的——输入的微小变化应该导致输出的微小、逻辑性的变化。
为了测试这一点,研究人员使用了两个主要技巧来创建“虚假”的邻居数据:
- “手抖”技巧(噪声扰动): 他们取一个数据点并加入一点随机的“抖动”,就像轻微晃动相机一样。如果机器人的答案随着这种微小的晃动而发生剧烈变化,说明它过于敏感(过拟合)。
- “奶昔”技巧(混合/Mixup): 他们将两个数据点(比如一个红苹果和一个绿苹果)混合在一起,创造出一个“新”的数据点(一个略带橙色的苹果)。他们会检查机器人对这个“橙色苹果”的预测是否基于红苹果和绿苹果的逻辑。
秘诀:将问题一分为二
该论文最大的突破在于一个数学证明,它表明我们可以将机器人的学习目标拆分为两个独立的组成部分:
- “准确度”得分: 机器人对真实数据的预测有多好?(我们希望这个分数高)。
- “平滑度”得分(詹森间隙): 当我们在“虚假”的邻居数据上测试时,机器人的表现有多奇怪?(我们希望这个分数低)。
类比:
想象你在给学生评分。
- 旧方法: 你只看他们的期末考试成绩。如果得了100分,你就让他们通过。(但他们可能是作弊或死记硬背了)。
- 新方法(本论文): 你给他们两个成绩。
- 成绩 A: 他们在真实问题上的表现如何?
- 成绩 B: 他们在经过我们稍微修改数字后的“陷阱”版本问题上的表现如何?
- 如果他们拿到了完美的成绩 A,但成绩 B 很糟糕,你就知道他们在作弊(过拟合)。
- 本论文创建了一个公式,能够完美平衡这两个成绩。
适应环境(噪声估计)
作者注意到,有些数据集是“多噪”的(充满错误),而有些则是“干净”的。
- 类比: 想象你在试图听一场对话。
- 在一个安静的图书馆(低噪声)里,你可以仔细聆听每一个词。
- 在一场摇滚演唱会(高噪声)中,你需要忽略背景噪音,专注于主旋律。
论文创建了一个“噪声检测器”。如果数据很混乱(像摇滚演唱会),机器人会自动对“平滑度”得分变得更加严格,以忽略噪声。如果数据很干净,它则会专注于捕捉细节。这一切都是自动完成的,无需人工干预。
“流形入侵”守护者
有时,当你混合两个数据点(“奶昔”技巧)时,你可能会无意中创造出一个在现实世界中并不存在的虚假数据点。
- 类比: 如果你把“热咖啡”和“冰块”混合,你会得到温水。但如果你把“火焰”和“雪花”混合,你可能会得到一个“燃烧的雪花”,这在现实中是不存在的。
论文增加了一个流形入侵检测器(Manifold Intrusion Detector)。这就像是一个保安,负责检查“虚假”的数据点。如果保安看到了“燃烧的雪花”(一个违反物理定律/逻辑的虚假点),他们就会将其剔除,以免让机器人感到困惑。
实验中发生了什么?
团队在 58 个不同的真实世界数据集(如预测房价、化学浓度等)上测试了这种新方法。
- 结果: 新方法(VJM-GP)在预测新的、未见过的数据方面,比旧方法表现得更好。
- 对比: 它击败了 15 种流行的机器学习算法,包括标准的遗传编程、深度学习模型和决策树。
- 权衡: 新方法需要稍长的时间进行训练(就像为了考试而更努力地学习),但结果更加可靠,且最终生成的公式通常更简单,也更容易被人类理解。
总结
这篇论文教会了机器人停止死记硬背,转而开始理解。通过将学习过程拆分为“准确度”和“平滑度”,并通过根据数据的混乱程度自动调整对机器人的严格程度,作者创建了一个能够构建更好、更可靠模型的系统,这些模型在面对新情况时不会崩溃。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。