← 最新论文
💬 NLP

Sound and Complete Neurosymbolic Reasoning with LLM-Grounded Interpretations

本文提出了一种神经符号推理框架,该框架将大语言模型集成到次协调逻辑的解释函数中,从而在利用大语言模型知识的同时,通过有效地将矛盾局部化以防止逻辑爆炸并提高事实性基准,实现了可靠且完备的形式化推理。

原作者: Bradley P. Allen, Prateek Chhikara, Thomas Macaulay Ferguson, Filip Ilievski, Paul Groth

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Bradley P. Allen, Prateek Chhikara, Thomas Macaulay Ferguson, Filip Ilievski, Paul Groth

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗易懂版解释,使用了日常类比。

核心问题:聪明但不可靠

想象你有一位才华横溢、博学多才的助手(大语言模型,简称 LLM),他几乎无所不知。你向他提问,他会给你一个自信满满的答案。但有时,他也会出错。有时,他甚至会给出两个相互矛盾的答案(例如:“这种药物是安全的”和“这种药物是危险的”)。

在传统逻辑的世界里,如果你遇到了矛盾,整个系统就会崩溃。这就像一个计算机程序在说:“如果 A 是真的且 A 是假的,那么天空是绿色的,月亮是奶酪做的。”这被称为逻辑爆炸(logical explosion),它会让整个系统变得毫无用处。

这篇论文的作者提出了一个问题:我们如何利用这个聪明但有时会自相矛盾的助手来帮助我们进行事实推理,而不至于让整个系统崩溃?

解决方案:带有“变体”的“贝尔纳普计算机”

作者构建了一种新型的推理机器,称之为贝尔纳普计算机(Belnap computer)。你可以把它想象成一位非常严厉的法官,他不仅问“这是真的还是假的?”,还会问两个独立的问题:

  1. 你能证明这是真的吗?
  2. 你能证明这是假的吗?

该系统不再强行要求一个“是”或“否”的结论,而是接受任何信息的四种可能状态:

  • 真(True): 你可以证明它是真的,但无法证明它是假的。
  • 假(False): 你可以证明它是假的,但无法证明它是真的。
  • 矛盾/过剩(Glut): 你既能证明它是真的,又能证明它是假的。(助手感到困惑,或者事实本身存在冲突)。
  • 空白/缺失(Gap): 你既不能证明它是真的,也不能证明它是假的。(助手不知道)。

工作原理:“事实核查员”双人组

论文引入了一种称为**双向事实性评估(Bilateral Factuality Evaluation)**的方法。想象你有一组由两名事实核查员组成的团队,针对同一个陈述进行工作:

  • 核查员 A 试图寻找证据来**证实(verify)**该说法。
  • 核查员 B 试图寻找证据来**反驳(refute)**该说法。

他们不只是简单地说“真”或“假”,而是提交一份评分表:

  • 如果 A 说“已证实”且 B 说“无法反驳”,则该说法为
  • 如果 A 说“无法证实”且 B 说“已反驳”,则该说法为
  • 如果两者都说“已证实”和“已反驳”,我们就得到了一个矛盾(Glut)
  • 如果两者都说“无法证实”和“无法反驳”,我们就得到了一个空白(Gap)

论文表明,通过使用这种“双向”方法,系统在识别 AI 何时感到困惑或事实何时混乱方面表现得更加出色,而不是仅仅进行猜测。

魔法技巧:保持逻辑的安全

这篇论文最令人印象深刻的部分在于,他们如何将这种“混乱”的 AI 与严格的数学联系起来。通常情况下,如果你把一个“有噪声”的 AI 接入一个严格的逻辑系统,数学规则就会崩溃。

作者从数学上证明了,他们可以直接将 AI 接入其逻辑系统的“真理定义”中,而不会破坏规则。

  • 类比: 想象一个严格的交通灯系统(逻辑)。通常,灯必须要么是红灯,要么是绿灯。作者展示了我们可以安装一个“智能摄像头”(AI),这个摄像头有时会说“它是红灯且是绿灯”或者“我不知道”。
  • 结果: 即使摄像头很困惑,交通灯系统也不会崩溃。它只会承认这种困惑,同时保证那些信号明确的交叉路口依然正常运行,并将困惑的交叉路口标记出来,留待人类稍后查看。即使存在矛盾,系统依然保持可满足性(satisfiable)(即它能继续正常工作)。

现实测试:药物安全实验室

为了证明其有效性,作者构建了一个原型系统,用于检查药物规则数据库。

  • 他们向系统输入了类似“所有苯二氮卓类药物都是非成瘾性的”这样的规则(这在医学上是错误的)。
  • 系统使用 AI 根据其内部知识对这些规则进行检查。
  • 结果: AI 标记了这些错误的规则。它发现了 92 处矛盾(gluts)。例如,它知道“阿片类药物是非成瘾性的”是一个谎言,因为它既能从数据库中证实该规则(来自数据库),又能通过医学知识反驳该规则。
  • 至关重要的一点是: 系统没有崩溃。它没有说“现在一切都是真的”。相反,它说:“我发现了 92 个具体的错误,但系统的其余部分仍在正常工作。”

权衡:质量 vs. 数量

论文发现了一个权衡关系。当系统使用这种“双向”检查时:

  • 它变得更准确(更高的准确率)。
  • 它回答的问题变少了(较低的覆盖率)。

为什么呢?因为如果 AI 感到困惑或不知道,系统会礼貌地表示“我不确定,我跳过这一项”,而不是盲目猜测。这就像一位医生在症状不明时拒绝做出诊断,而不是为了诊断而猜测,从而避免潜在的伤害。

总结

这篇论文展示了一种方法,可以利用强大的 AI 助手来处理严肃的推理任务,而不至于让它们的错误破坏整个系统。通过要求 AI 同时检查证明与反证,并使用一种能够容忍矛盾的特殊逻辑,他们构建了一个能够:

  1. 识别 AI 何时处于困惑状态。
  2. 识别知识库(如错误的医疗规则)中的特定错误。
  3. 即使存在矛盾也能安全运行,而不是直接崩溃。

它是连接 AI 那种模糊、类人化的知识与形式逻辑那严谨、可靠世界的桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →