Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits
本文介绍了 Baobab,一种神经符号学习框架,它将完整的 OWL 2 DL 本体编译为可微的命题决策图(Sentential Decision Diagrams),从而在部分监督下训练感知网络,有效地克服了推理捷径,并在非 Horn 描述逻辑任务中实现了贝叶斯最优性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的广阔版图中,有两种截然不同的传统长期以来一直在竞争,试图让机器理解世界。一种被称为深度学习的传统,擅长识别原始数据中的模式,例如识别照片中的猫或读取手写数字。它通过调整数百万个内部旋钮直到得到正确答案来进行学习,但它并不理解支配世界的规则。另一种根植于逻辑和知识表示的传统,构建的是能够利用严格规则进行推理的系统,就像一本数字百科全书,知道“贵宾犬”是“狗”的一种类型,而“狗”是“哺乳动物”。这个系统精确且可靠,但往往难以与图像和声音这种杂乱、非结构化的现实世界建立联系。多年来,研究人员一直试图融合这两种方法,创造出既能“看”又能“推理”的“神经符号”系统。挑战在于,用于描述复杂知识的最强大的逻辑语言,极难转化为神经网络用于学习的数学语言。
卡斯塔拉大学科学技术学院(KAUST)的一个研究小组开发了一种名为 Baobab 的新方法,成功为一种特定的、高度复杂的逻辑系统弥合了这一差距。他们创建了一个编译器,该编译器可以接收对一个世界的详细逻辑描述——包括关于事物如何关联、可以存在多少个事物以及类别如何重叠的规则——并将其转化为神经网络可以用来学习的结构。与以往那些要么过度简化逻辑规则,要么完全放弃规则的尝试不同,这种方法保留了原始规则的完整复杂性。研究人员通过要求神经网络观察手写数字图像,并不仅要识别数字,还要根据提供给机器的一套逻辑规则,推断出隐藏的逻辑属性(例如该数字是质数还是偶数),以此测试了他们的系统。即使图像本身没有提供关于这些属性的直接线索,该系统也能高精度地识别出这些隐藏概念。
这一成就的核心在于研究人员处理翻译过程的方式。他们将一个逻辑知识库(本质上是关于概念间如何相互关系的陈述集合)编译成一种特定类型的电路图。该电路图充当一个过滤器,检查神经网络做出的预测是否符合逻辑规则。如果网络预测一个数字既是偶数又是质数(这仅对数字 2 成立),电路会允许它;如果它预测一个数字既是偶数又是奇数,电路则会拒绝这种可能性。通过运行数百万次此类检查,系统可以引导神经网络学习正确的逻辑关系,即使它所看到的图像并未明确标注这些关系。研究人员证明了这种翻译在数学上是完备的,这意味着电路准确地反映了原始逻辑规则,既没有丢失任何信息,也没有引入任何错误。
该研究的一个重要发现涉及这些混合系统中一个常见的问题,即所谓的“推理捷径”。当机器被赋予一项可能存在多个正确答案的任务时,它往往会找到一种解决问题的方法,即只选择其中一个答案并忽略其他答案,从而有效地绕过了逻辑系统。例如,如果一条规则允许场景存在几种不同的配置,标准的神经网络可能会锁定在单一配置上,而无法识别其他有效配置的存在。研究人员发现,当他们的新方法结合一种特定的“种子技术”(即向网络中注入所有可能的有效配置)时,可以克服这种捷径。系统不再坍缩到单个可能错误的答案上,而是学会了在所有正确可能性之上维持一个概率分布,实现了以往此类复杂逻辑方法无法达到的准确度。
团队使用两个不同的数据集展示了其方法的威力。在第一个实验中,他们使用了来自 MNIST 数据集的图像。他们设置了一个逻辑系统,使数字之间形成链式关系,即如果一个数字后跟着另一个数字,则必须满足特定的关系。神经网络被展示了成对的图像,但从未被告知实际的数字。相反,它被给予了一些逻辑线索,例如知道其中一个数字是偶数,另一个是质数。通过逻辑电路,网络学会了以接近完美的准确度推断出数字的确切身份,其准确率从随机猜测的 25% 提升到了 99%。在第二个实验中,他们将同样的方法应用于合成披萨图像数据集。系统学会了根据图像中可见的配料以及定义这些类别的逻辑规则,来识别披萨的隐藏类别(如“素食”或“辣味”),其表现再次优于未使用逻辑电路的系统。
研究人员还展示了他们的方法可以处理生物医学数据库和语义网中所使用的完整且复杂的逻辑语言,这类语言包含诸如“多少个项目可以相互连接”以及“关系方向性”等规则。以往尝试将神经网络与此类复杂程度结合的方法,必须对规则进行大幅简化,从而使其失去原有的意义。然而,Baob easily 处理了完整的复杂性而无需简化。团队使用形式化证明系统验证了其编译器的正确性,这是一种严谨的数学检查,确保从逻辑到电路的转换是无瑕疵的。他们还将系统与现有方法进行了对比,发现旧方法无法处理其实验中使用的很大一部分逻辑规则,因为旧方法局限于更简单、表达能力较低的形式逻辑。
研究的一个关键部分在于解决“多重有效答案”的问题。在许多现实场景中,提供的信息不足以确定唯一的解。例如,如果一条规则规定一个人要么是男性要么是女性,而我们知道他/她与异性结婚,那么这对夫妇的性别仍有两个有效的可能性。标准的神经网络通常在此类情况下失败,它们会武断地选择一种可能性并将其视为唯一真理。研究人员发现,通过使用多种不同的逻辑路径(每条路径对应一个有效可能性),他们的系统可以同时表示所有正确答案。这使得系统能够为每个结果提供校准后的概率,反映数据的真实不确定性,而不是强行给出虚假的确定性。这种能力对于医疗等领域至关重要,因为在这些领域,了解可能的诊断范围与识别单一诊断同样重要。
这项工作也强调了此类系统的实际局限性。虽然该方法功能强大,但随着问题复杂度的增加,逻辑电路的大小会迅速增长。在一次涉及完整披萨类型本体论的测试中,研究人员发现,将整套规则编译成电路所需的内存超过了标准计算机的可用容量,迫使他们在最终训练时使用了一组简化的规则子集。这表明,虽然该方法在理论上是完备且有效的,但要将其扩展到最大规模、最复杂的知识库,仍需要进一步的工程进步。尽管如此,在简化的披萨数据集和数字识别任务上的成功应用,证明了该方法对于现实世界数据是可行且有效的。
这项研究的影响超出了单纯的图像识别。它为人工智能如何将科学数据库中丰富的结构化知识直接整合进学习过程提供了一条路径。这意味着未来的 AI 系统可以在学习图像的同时,始终遵循生物学、化学或物理学的严格且经过验证的规则。通过确保机器的预测始终与既定的科学知识保持一致,这种方法可以带来更可靠、更值得信赖的人工智能,特别是在错误可能导致严重后果的高风险领域。研究人员已向公众开放了其代码和工具,邀请他人在此基础上进行构建,并探索这种逻辑与学习的整合究竟能走多远。
最终,这项研究表明,在不牺牲任何一方优势的前提下,可以弥合模式识别与逻辑推理之间的鸿沟。通过将复杂的逻辑规则转化为神经网络可以处理的格式,研究人员创造了一个不仅能从数据中学习,还能从知识结构本身中学习的系统。能够恢复隐藏概念、避免推理捷径,并处理现代复杂逻辑语言的能力,标志着在构建真正理解观察世界的机器的征程上迈出了重要一步。结果表明,只要拥有正确的工具,人工智能就可以超越简单的模式识别,转而真正对支配它们的各种关系和规则进行推理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。