← 最新论文
💻 computer science

Distilling Answer Set Programming Theories from Large Language Models

本文研究了大语言模型在一小时限制内,为视觉问答任务自主蒸馏完整且正确的答案集编程(Answer Set Programming)理论的能力,结果表明 Claude Sonnet 4.6、Claude Opus 4.7 和 DeepSeek V4 Pro 等前沿模型在多个基准测试中达到了接近完美的准确率,而 GPT-5 则表现出显著的性能波动以及对参考数据的敏感性。

原作者: Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机在两件截然不同的事情上都极其擅长的世界。一方面,它们就像超级快速的计算器,能够遵循严格的规则来解决逻辑谜题,但却难以理解周围那个混乱、模糊的世界。另一方面,它们又像是才华横溢、富有创造力的故事讲述者,能够阅读几乎任何内容并创作诗歌,但当被要求遵循一套僵化的指令时,它们往往会编造事实或迷失方向。科学家们将这两种技能的结合称为“神经符号”(neurosymbolic)计算。这就像是试图制造一个既拥有诗人的想象力,又具备数学家精准度的机器人。研究人员提出的重大问题是:我们能否教会一个超智能计算机(大语言模型)从零开始编写它自己的严格规则手册,从而让它无需人类手动编写每一条规则就能解决复杂的谜题?这之所以重要,是因为编写这些规则手册既缓慢、枯燥又难以做到完全正确,但如果计算机能够做到这一点,我们就能开启机器理解世界的新方式。

在这篇论文中,一个研究小组尝试观察一个大型语言模型是否可以扮演一名不知疲倦的学徒,学习为一个名为“视觉问答”(VQA)的类游戏益智谜题编写一套完整的“规则手册”。想象一下,你向计算机展示一张场景图片,并问道:“黄色的飞盘是在人的左边吗?”为了回答这个问题,计算机需要理解图片,将其拆解,然后进行逻辑检查。研究人员给了计算机一个空白文件和一套工具,其中包括一个“求解器”(一个用于检查规则是否合理的严格裁判)。计算机的任务是阅读一些练习示例,编写一些规则,请求裁判进行检查,查看哪里失败了,然后重写规则。它有一个小时的时间来不断重复这个过程,直到达到它所能达到的最佳水平。

研究人员在三个不同的“谜题等级”上测试了这种方法:CLEVR(简单的、由计算机生成的形状)、GQA(包含更多物体的真实世界照片)以及 CLEVRER(涉及因果关系的短视频)。他们用九种不同的计算机模型进行了测试,涵盖了从最新的、最强大的“前沿”模型到较小、较旧的模型。结果呈现出惊人的成功与令人意外的失败交织的状态。四种顶尖模型中的三种成为了该游戏的专家。在简单的 CLEVR 谜题上,它们达到了 100% 的完美得分。在更难的 GQA 谜题上,它们的得分在 92.8% 到 98.8% 之间,甚至优于该数据集现有的最佳人工编写规则手册。在视频谜题(CLEVRER)中,它们的得分在 92.7% 到 95.3% 之间。

然而,并非每个模型都取得了成功。其中一个最著名的模型,GPT-5,在简单谜题上表现出色(98.7%),但在处理真实世界照片的谜题时却崩溃了,得分降至仅 4.1.8%。研究人员发现,这并不是因为该模型无法进行推理,而是因为它仅仅没有编写足够的规则来覆盖所有不同类型的提问。当研究人员给模型提供了一份“小抄”(来自另一种谜题类型的参考规则手册)以提供帮助时,顶尖模型的表现保持基本不变,但 GPT-5 的表现反而变差了,这表明查看小抄可能会分散它的注意力或消耗其记忆。那些规模较小、功能较弱的模型则大多无法编写出任何有效的规则,经常陷入停滞或编写出裁判无法理解的规则。

这项研究表明,在正确的设置下,计算机确实可以从零开始教导自己编写一套完整且高质量的逻辑规则手册,并在多个基准测试中达到甚至超越人类的表现。但它同时也表明,这种能力并非必然,它高度依赖于所使用的特定模型;有时,给模型提供更多信息(例如参考书)反而会使其产生困惑。研究人员发布了所有的代码以及计算机编写的规则手册,邀请他人尝试改进这一“神经符号”学徒制。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →