← 最新论文
🤖 machine learning

From Hybrid Mechanistic--Data-Driven Modeling Toward Neuro-Symbolic AI: What, Why, and How

本文通过引入一种“从混合到神经符号”(H2N)框架,将现有设计重构为统一的语义接口,从而架起了混合机理-数据驱动建模与神经符号人工智能之间的桥梁,进而能够推导出新指标(结构违规率和置信度离散度),以显式地量化认知不确定性和结构符合度,从而实现改进的模型验证与外推。

原作者: Moein E. Samadi, Andreas Schuppert

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Moein E. Samadi, Andreas Schuppert

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

侦探与水晶球

想象一下你正在尝试预测天气。你有两种方法可以做到这一点。第一种是“老派”做法:你知道物理定律。你知道热空气上升,也知道云是在水分冷却时形成的。这就像是一个机械模型(mechanistic model)——它是基于始终成立的规则构建的,比如重力。第二种是“新派”做法:你观察大量的过往天气照片,并使用一台超级聪明的计算机,根据模式来猜测接下来的情况。这是一个数据驱动模型(data-driven model)。它擅长发现趋势,但并不真正“理解”为什么会下雨。

长期以来,科学家们一直试图将这两种方法融合进一个**混合模型(hybrid model)**中。把它想象成一个既了解物理定律(游戏规则)又使用水晶球(数据)来填补缺失部分的侦探。这在工程和科学领域非常有用,因为它让我们能够构建既智能又可靠的系统。但问题在于:当你把一本规则书和一个水晶球混合在一起时,很难分辨到底是谁在起作用。如果预测错了,是因为规则太严苛了?还是因为水晶球今天“状态不好”?我们需要一种方法来衡量有多少程度的“规则”得到了尊重,以及有多少程度的“猜测”在摇摆。

论文的核心思想:翻译谜团

这篇题为《从混合机械–数据驱动建模走向神经符号人工智能》(From Hybrid Mechanistic–Data-Driven Modeling Toward Neuro-Symbolic AI)的论文,提出了一种看待这些混合模型的巧妙新方法。作者 Moein E. Samadi 和 Andreas Schuppert 建议,我们不要仅仅将这些模型视为计算机代码,而应该开始将它们视为一个**神经符号(Neuro-Symbolic, NeSy)**系统。

为了理解这一点,请想象一个法庭。

  • 逻辑侧(法官): 这代表了宇宙的硬性规则,如物理定律或机器的结构。法官决定什么是可采纳的(允许的)以及什么是违规。
  • 信念侧(陪审团): 这代表了数据驱动的部分。陪审团观察证据,并决定什么是合理的或极有可能发生的。

论文认为,每一个混合模型都可以被转化为这种“法庭”设置。他们将这种转化称为 H2N(混合到神经符号)。在这种新视角下,固定的方程是法官的法律,而学习到的计算机部分则是陪审团的信念。这种分离是非常强大的,因为它让我们能够提出两个此前难以回答的具体问题:

  1. 陪审团是否违反了法官的规则?(这通过所谓的结构违规率/Structural Violation Rate来衡量)。
  2. 陪审团是否感到困惑?(这通过信念离散度/Belief Dispersion来衡量)。

他们的发现:水晶球的信心

作者在一个用于二分类(基本上就是将事物分为两类,比如“垃圾邮件”或“非垃圾邮件”)的特定混合模型上测试了这个想法,其中训练数据包含一些“噪声”(标签错误)。他们不仅仅是靠猜测;他们运行了带有 50 个不同“种子”(起始点)的模拟实验,以观察模型的行为。

以下是他们的发现:

1. “困惑”测量仪有效
他们发现,陪审团信念的“分散程度”与模型准确性的不可预测性之间存在强关联。他们将这种分散程度称为信念离散度(Belief Dispersion, BD)

  • 当模型非常确定时(低 BD),其准确性是稳定且高的。
  • 当模型感到困惑时(高 BD),其准确性会变得波动不定。
  • 在他们的模拟中,随着训练数据中噪声的增加,信念离散度从 0 上升到接近 4。与此同时,测试准确性的标准差(即“摇摆度”)从 0 上升到约 0.073
  • 至关重要的是,这种“摇摆”可以在模型看到测试数据之前就被预测出来。论文指出,通过观察信念离散度,你可以预知你的模型准确性会有多大的波动,而传统方法只能在你测试完之后才告诉你模型失败了。

2. “违规”测量仪
他们还测量了结构违规率(Structural Violation Rate, SVR),用于检查模型是否忽略了硬性规则。

  • 在他们的实验中,只要模型保持在一定的“预算”内(即允许误差的容差为 κ = ⌊0.5 S⌋,其中 S 是样本数量),SVR 就保持在接近 0.000 的水平。
  • 只有当噪声变得极其高(45% 的标签噪声)时,SVR 才跳升至 0.428,这意味着模型频繁地违反了规则。
  • 这表明,只要“困惑度”(BD)不是太高,模型就可以处理大量的噪声而不破坏物理定律。

3. 预见未来(外推/Extrapolation)
最令人兴奋的发现是关于“外推”——即预测模型从未见过的事物。

  • 他们在训练期间对数据的某些部分进行了隐藏(例如隐藏表格中的特定行)。
  • 他们发现,信念离散度可以分为两部分:模型已见的(BD_seen)和模型未见的(BD_unseen)。
  • BD_unseen 部分可以在模型尝试进行任何新预测之前,仅通过观察哪些行被隐藏了就能立即计算出来。
  • 在他们的测试中,当他们隐藏了 4 行数据时,BD_unseen 跳升至 0.68,而这些新、未见行的准确性骤降至 0.56。传统的“测试准确性”指标只能在事后显示这种失败,但 BD 指标在事前就发出了警告。

为什么这很重要

这篇论文并不声称已经解决了所有的人工智能问题。相反,它提供了一个看待混合模型的全新“透镜”或全新的语言。通过将这些复杂的工程设计转化为“法官与陪审团”框架,科学家终于可以测量认知不确定性(epistemic uncertainty)——这是一个高级说法,意指“模型对自己规则的了解程度”。

作者认为,这种方法允许我们将“逻辑”(不可改变的规则)与“信念”(数据驱动的猜测)区分开来。这意味着如果一个模型失败了,我们可以判断是因为规则太严苛,还是因为模型只是在进行疯狂的猜测。它将黑盒变成了一个透明的系统,让我们能够清晰地看到不确定性究竟存在于何处,从而帮助工程师为现实世界构建更安全、更可靠的 AI 系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →