← 最新论文
🤖 machine learning

EM-NeSy: Expectation Maximization for Neurosymbolic Learning

本文介绍了 EM-NeSy,这是一种新颖的神经符号学习框架,它利用期望最大化(Expectation-Maximization)算法来实现可扩展且高效的训练,且无需要求符号组件是可微的,从而支持精确推理与近似推理。

原作者: Annegret Seibt, Luc De Raedt, Giuseppe Marra

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Annegret Seibt, Luc De Raedt, Giuseppe Marra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教机器人思考与推理

想象一下,你正在尝试同时教机器人两件事:

  1. 感知(Perception): 如何观察一张模糊的照片并猜出其中的物体是什么(比如识别手写数字)。这是通过神经网络(即“神经”部分)完成的。
  2. 推理(Reasoning): 如何根据一套规则检查这些物体是否符合逻辑(比如检查数独谜题是否有效)。这是通过符号逻辑(即“符号”部分)完成的。

目前的方法试图通过一根“导线”将这两个部分连接起来,让机器人从错误中学习,从而同时教授这两个部分。然而,这根导线存在一个问题:如果逻辑部分过于复杂,或者使用了某种与数学不兼容的方法(例如随机采样),这根“导线”就会断裂。机器人无法学习,因为它无法计算出修正错误的精确方向。

EM-NESY 是一种全新的教学方式,它完全移除了这根“导线”。它不再强迫这两个部分在学习过程中不断进行实时交流,而是让它们轮流工作。


类比:艺术评论家与学徒

为了理解 EM-NESY 是如何工作的,请想象一位学徒艺术家(神经网络)和一位严厉的艺术评论家(符号逻辑)。

旧方法(端到端学习)

在旧方法中,学徒画出一幅画,评论家会立即大喊:“错了!”然后评论家试图解释究竟是哪一笔画错了,以及该如何修正。

  • 问题在于: 如果评论家的规则太复杂(比如复杂的数独谜题),或者评论家使用了一种难以一步步解释的方法(比如随机猜测),评论家就会卡住。他们无法给出关于如何修正笔触的具体指令。学徒感到困惑,无法进步。

新方法 (EM-NESY)

EM-NESY 将工作流程改变为两个截然不同的步骤,就像一个排练过程:

第一步:评论家的评审(“期望”步骤)
学徒根据当前的技能水平画出一幅画。评论家观察这幅画以及正确答案(标签)。
评论家并不试图解释如何修正笔触,而是简单地写下一份修正清单

  • 例子: “你认为这个数字是 3,但根据数独规则,它有 70% 的概率是 5,有 30% 的概率是 6。”
  • 关键点: 评论家可以使用任何他们想要的方法。他们可以使用复杂的数学、随机猜测或严格的逻辑。他们不需要能一步步解释其推理过程,只需要产出最终的概率列表(即“后验概率”)即可。

第二步:学徒的练习(“最大化”步骤)
评论家将修正清单交给学徒。学徒查看自己的原始猜测和评论家的修正意见。

  • 学徒心想:“我猜的是 3。评论家说我应该猜 5 或 6。我需要调整我的大脑,让下次猜 5 或 6 的概率更高。”
  • 学徒更新自己的内部设置(神经参数),以匹配评论家的清单。
  • 关键点: 评论家在此步骤中并不参与。评论家的清单被视为既定事实。学徒只需要学习如何改变自己的绘画风格。

为什么这很重要?

1. 它解锁了“无法学习”的逻辑
有些逻辑问题非常困难,以至于你无法计算出精确的答案,或者寻找答案的方法是“不可微的”(数学上很混乱)。

  • 类比: 想象评论家使用一种通过掷骰子来寻找答案的方法。在旧方法中,你无法教导学徒,因为你无法通过骰子的滚动过程追溯回每一笔画。
  • 有了 EM-NESY: 评论家掷骰子,得到结果,然后将其记录下来。学徒只需从结果中学习。这种混乱的“掷骰子”过程完全从学习过程中隐藏了起来。

2. 它更快且占用更少内存
论文表明,当逻辑足够简单、可以被精确计算时,这种新方法与旧方法一样准确,但速度更快。

  • 类比: 这就像意识到你不需要在每次犯错时都重新计算整个宇宙的历史。你只需要最终的判决。这节省了大量的计算机内存和时间,使机器人能够解决更大的谜题(如拥有 100 位数字的数独网格),而旧系统在处理这些任务时会崩溃。

3. 它适用于任何“评论家”
因为评论家不需要在数学上是“平滑”或可微的,你可以接入任何现有的逻辑引擎,甚至是那些此前难以与神经网络结合使用的引擎。

实验结果显示

作者在三种类型的谜题上进行了测试:

  1. 手写数字加法: 他们展示了 EM-NESY 可以处理巨大的求和运算(100 位数字),而其他方法甚至无法完成这些运算,同时它使用的内存更少。
  2. 视觉数独: 他们展示了即使在使用近似方法(如随机采样)来解决逻辑部分时,它也能从规则严苛的谜题中学习。
  3. 地图路径规划: 他们展示了它可以在网格中学习寻找最短路径,在处理这类逻辑过于复杂而难以求导的任务时,其他方法表现挣扎。

核心结论

该论文提出了 EM-NESY,这是一个将神经符号学习视为一场轮流进行的“靠近还是远离”游戏的框架。

  • 第一回合: 逻辑引擎(评论家)利用其拥有的任何工具,找出正确的答案应该是什么。
  • 第二回合: 神经引擎(学徒)调整自己的大脑以匹配这些答案。

这种简单的切换使得 AI 能够从复杂的、混乱的或近似的逻辑中学习,而无需强迫逻辑在数学上必须是完美或可微的。这使得构建既能“看”又能“思考”的 AI 变得更加灵活且具扩展性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →