← 最新论文
🤖 AI

Position: Certified Correctness in Neural Constraint Reasoning Requires Symbolic Integration

本立场论文认为,为了确保神经约束推理的可证明正确性,特别是针对像数独这样验证高效但求解困难的 NP 完全问题,神经方法必须与符号求解器进行双向集成,而非仅仅依赖纯学习。

原作者: Shufeng Kong, Xiaochuan Zhang, Caihua Liu

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Shufeng Kong, Xiaochuan Zhang, Caihua Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,存在着两种思维方式之间日益扩大的分歧。一方面是那些通过观察海量数据、识别模式并做出合理推测来学习的系统。这些系统具有极高的灵活性,能够处理像照片或语音这样杂乱的现实世界输入。另一方面是遵循严格、不可逾越规则的系统,就像一名检查作业的数学老师。这些基于规则的系统非常僵化,难以处理任何非完美格式的内容,但它们绝不会犯逻辑错误。多年来,研究人员一直希望模式匹配系统最终能学会完美地遵循规则,从而使这种僵化的、遵循规则的方法变得过时。然而,一项新的研究方向表明,对于某些特定类型的问题,这种希望是错位的。当赌注很高且规则是绝对的时候,一个只会进行猜测的系统,无论它多么聪明,最终都会失败。问题不再是我们能否制造出一台“通常正确”的机器,而是我们能否制造出一台“可证明正确”的机器。

这种紧张关系正是研究员舒峰(Shufeng Kong)、张晓川(Xiaochuan Zhang)和刘彩华(Caihua Liu)最近发表的一篇立场论文的核心。他们认为,对于规则严苛且出错代价高昂的问题,人工智能必须停止尝试从零开始学习规则,而是应该将其学习能力与传统的规则检查引擎相结合。为了证明他们的观点,他们采用了流行的数独谜题作为案例。数独是一个完美的测试案例,因为验证一个解是否正确非常容易——你只需要观察行和列看数字是否重复——但从头开始求解却非常困难。研究人员发现,虽然现代人工智能模型可以近乎完美地解决简单的谜题,但当谜题变得稍微不同或更难时,它们就会崩溃。即使给予这些模型额外的思考时间并让其检查自己的工作,它们仍然会产生违反规则的解。相比之下,使用传统规则检查器来验证人工智能答案的系统,能以更少的样本实现完美的准确率。

研究人员证明了仅依赖统计学习对于这类问题来说是一个陷阱。他们展示了当一种神经网络(一种通过数据学习的AI类型)试图解决一个它从未见过的谜题时,它经常会产生一个看起来正确但包含隐藏错误的答案。这些错误不仅仅是微小的失误;它们是解决谜题所需逻辑的根本性违背。团队发现,仅仅给予人工智能更多的计算能力,或者要求它生成许多可能的答案并从中挑选最好的,并不能解决问题。人工智能可能会在平均水平上表现得更好,但它无法保证任何特定的单个答案是正确的。这是一个关键的区别。一个“通常正确”的系统与一个“可证明正确”的系统有着本质的不同。在调度、安全检查或代码生成等领域,一个单一的错误就可能导致灾难性的后果,使得“通常正确”的方法变得不可接受。

为了解决这个问题,作者提出了一种构建这些系统的新方法,称之为“双向集成”。他们建议不要让人工智能尝试做所有事情,而是将工作进行拆分。人工智能充当快速、直觉式的生成器,利用其模式识别能力快速提出候选方案。随后,该候选方案会被传递给一个严格的、遵循规则的验证器。这个验证器扮演着守门人的角色。如果方案通过了检查,则被接受;如果失败,验证器不仅会说“不”,还会明确指出错误所在,例如指出同一行中有两个数字是相同的。人工智能随后利用这一具体的反馈来调整其猜测并再次尝试。如果人工智能在尝试几次后仍无法解决问题,系统会将任务移交给传统的、虽慢但完美的求解器,以保证获得正确答案。这创造了一个安全网,既保留了人工智能的速度,又确保了基于规则系统的可靠性永远不会受到损害。

研究人员在包括生成计算机代码和解决复杂的车辆路径规划问题在内的几个困难领域测试了这种方法。在每种情况下,混合系统都优于单独运行的人工智能。例如,在生成代码时,人工智能本身可能会产生一个看起来不错但无法运行的程序。通过增加一个步骤,即在接受之前由编译器对代码进行实际测试,系统纠正了自己的错误,并实现了更高的成功率。同样,在车辆路径规划中,混合方法将不可能路径的比例从显著的百分比降低到了几乎为零。关键发现是,人工智能不需要学习逻辑规则本身;它只需要学习如何提出好的想法,而确保这些想法有效的重任则留给了符号引擎。

这项工作挑战了目前盛行的观点,即认为更大、更强大的人工智能模型最终将能够自行处理所有逻辑约束。作者认为,对于这类问题,再多的数据或计算能力也无法弥补统计猜测与逻辑确定性之间的鸿沟。他们指出,在受限环境下实现可靠人工智能的未来,不在于取代旧有的基于规则的方法,而在于使它们成为新学习方法的合作伙伴。通过让人工智能处理问题中杂乱、非结构化的部分,并将规则检查器用于最终验证,我们可以构建出既快速又值得信赖的系统。该论文最后呼吁科学界不要再接受将“通常正确”作为此类任务的成功指标,而是要要求系统能够证明其正确性,从而确保当我们依赖机器做决策时,这些决策不仅极有可能正确,而且是保证正确的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →