✨ 要点🔬 技术摘要
想象一个计算机在两件截然不同的事情上都极其擅长的世界。一方面,它们就像超级快速的计算器,能够遵循严格的规则来解决逻辑谜题,但却难以理解周围那个混乱、模糊的世界。另一方面,它们又像是才华横溢、富有创造力的故事讲述者,能够阅读几乎任何内容并创作诗歌,但当被要求遵循一套僵化的指令时,它们往往会编造事实或迷失方向。科学家们将这两种技能的结合称为“神经符号”(neurosymbolic)计算。这就像是试图制造一个既拥有诗人的想象力,又具备数学家精准度的机器人。研究人员提出的重大问题是:我们能否教会一个超智能计算机(大语言模型)从零开始编写它自己的严格规则手册,从而让它无需人类手动编写每一条规则就能解决复杂的谜题?这之所以重要,是因为编写这些规则手册既缓慢、枯燥又难以做到完全正确,但如果计算机能够做到这一点,我们就能开启机器理解世界的新方式。
在这篇论文中,一个研究小组尝试观察一个大型语言模型是否可以扮演一名不知疲倦的学徒,学习为一个名为“视觉问答”(VQA)的类游戏益智谜题编写一套完整的“规则手册”。想象一下,你向计算机展示一张场景图片,并问道:“黄色的飞盘是在人的左边吗?”为了回答这个问题,计算机需要理解图片,将其拆解,然后进行逻辑检查。研究人员给了计算机一个空白文件和一套工具,其中包括一个“求解器”(一个用于检查规则是否合理的严格裁判)。计算机的任务是阅读一些练习示例,编写一些规则,请求裁判进行检查,查看哪里失败了,然后重写规则。它有一个小时的时间来不断重复这个过程,直到达到它所能达到的最佳水平。
研究人员在三个不同的“谜题等级”上测试了这种方法:CLEVR(简单的、由计算机生成的形状)、GQA(包含更多物体的真实世界照片)以及 CLEVRER(涉及因果关系的短视频)。他们用九种不同的计算机模型进行了测试,涵盖了从最新的、最强大的“前沿”模型到较小、较旧的模型。结果呈现出惊人的成功与令人意外的失败交织的状态。四种顶尖模型中的三种成为了该游戏的专家。在简单的 CLEVR 谜题上,它们达到了 100% 的完美得分。在更难的 GQA 谜题上,它们的得分在 92.8% 到 98.8% 之间,甚至优于该数据集现有的最佳人工编写规则手册。在视频谜题(CLEVRER)中,它们的得分在 92.7% 到 95.3% 之间。
然而,并非每个模型都取得了成功。其中一个最著名的模型,GPT-5,在简单谜题上表现出色(98.7%),但在处理真实世界照片的谜题时却崩溃了,得分降至仅 4.1.8%。研究人员发现,这并不是因为该模型无法进行推理,而是因为它仅仅没有编写足够的规则来覆盖所有不同类型的提问。当研究人员给模型提供了一份“小抄”(来自另一种谜题类型的参考规则手册)以提供帮助时,顶尖模型的表现保持基本不变,但 GPT-5 的表现反而变差了,这表明查看小抄可能会分散它的注意力或消耗其记忆。那些规模较小、功能较弱的模型则大多无法编写出任何有效的规则,经常陷入停滞或编写出裁判无法理解的规则。
这项研究表明,在正确的设置下,计算机确实可以从零开始教导自己编写一套完整且高质量的逻辑规则手册,并在多个基准测试中达到甚至超越人类的表现。但它同时也表明,这种能力并非必然,它高度依赖于所使用的特定模型;有时,给模型提供更多信息(例如参考书)反而会使其产生困惑。研究人员发布了所有的代码以及计算机编写的规则手册,邀请他人尝试改进这一“神经符号”学徒制。
技术摘要:从大语言模型中蒸馏答案集程序(ASP)理论
问题陈述 从零开始编写答案集程序(ASP)理论是一项劳动密集型任务,需要数百条规则才能覆盖非平凡推理任务的算子。手工编写的理论通常是特定于领域的,无法在具有不同模式(schema)的数据集之间进行迁移。本文研究了一个大语言模型(LLM)在作为具备“求解器在环”(solver in the loop)能力的自主智能体时,能否从零开始蒸馏出一个完整且正确的 ASP 理论。其目标是确定 LLM 是否可以在仅给定一个空文件、一个固定提示词以及访问训练样本的情况下,通过迭代构建出理论,而无需人类提供模板或部分规则模式。
方法论 作者提出了一个在视觉问答(VQA)领域实例化的数据集无关的蒸馏协议。该系统在一个“神经符号”框架内运行,其中 LLM 充当推理模块的作者,而标准的 ASP 求解器(clingo)则作为执行引擎。
智能体工具架(The Agent Harness): LLM 被嵌入到一个使用 OpenCode agent CLI 的沙盒环境(Docker 容器)中。该模型可以使用文件操作工具(read, edit, write, glob, grep)以及一个受限的 bash 接口,用于运行 uv run solve(在训练数据上执行 ASP 求解器)和 uv run lint(检查语法)。
协议流程:
初始化: 智能体从一个空的理论文件开始,并接收一个最小化系统提示词,指示其生成一个能为训练样本推导出 ans(A) 的理论。
迭代: 智能体读取少量训练样本,编写一个初始的语法有效的理论,并针对求解器进行测试。
反馈循环: 根据求解器的输出(或缺乏输出的情况),智能体识别失效模式,编辑理论,并进行迭代。
终止: 循环持续进行,直到智能体自我声明完成,或达到 1 小时的时限。
评估: 最终生成的理论将在留出的验证集上进行评分。工作的单元是整个理论,它是通过多次编辑周期创作完成的。
实验设置: 本研究在三个 VQA 基准测试中评估了九个模型:
CLEVR: 侧重于组合推理的合成 3D 场景。
GQA: 具有大量物体和关系的真实世界图像。
CLEVRER: 需要时间、因果和反事实推理的短视频。
模型层级: 四个前沿模型(Claude Sonnet 4.6, Claude Opus 4.7, GPT-5, DeepSeek V4 Pro),两个中阶模型,以及三个较小的开源权重模型。
参考消融实验(Reference Ablation): 实验通过改变是否包含来自其他 数据集的手写参考理论(0, 1, 或 2 个参考)来测试可迁移性。
核心贡献
统一的蒸馏协议: 作者建立了一个在所有数据集和模型中都完全一致的固定智能体工具架、系统提示词和工具集。这隔离了模型能力作为主要变量,消除了提示工程作为干扰因素的可能性。
理论蒸馏的演示: 本研究提供了经验证据,证明智能体可以从零开始蒸馏出完整的 ASP 理论。四个前沿模型中的三个在特定基准测试上达到了匹配或超过手工参考理论的性能。
失效模式分类: 本文将观察到的失败归类为解析错误、接地(grounding)失败、“无答案”(理论处于沉默状态)以及语义错误。它还分析了模型规模和参考理论如何与这些失效模式相互作用。
结果
前沿模型表现:
CLEVR: 三个前沿模型(Sonnet, Opus, DeepSeek V4 Pro)达到了 100% 的准确率。GPT-5 达到了 98.7%。
GQA: Sonnet, Opus 和 DeepSeek V4 Pro 的得分在 92.8% 到 98.8% 之间,超过了手工参考理论的上限(77.5%)。GPT-5 显著下降至 41.8%,主要是由于“无答案”导致的失败(理论未能为大多数样本推导出答案)。
CLEVRER: 三个成功的前沿模型得分在 92.7% 到 95.3% 之间。GPT-5 得分为 86.7%。
参考理论的影响:
对于 Sonnet, Opus 和 DeepSeek V4 Pro,添加来自其他数据集的参考理论影响微乎其微(在 ±3.4 个百分点以内)。
对于 GPT-5,添加参考会导致准确率出现持续性的退化(下降 3–19 个百分点)。作者观察到,当给予参考时,GPT-5 编写的理论明显变短,这表明参考内容消耗了用于创作所需的上下文预算。
模型规模与次前沿性能:
参数量低于 27B 阈值的模型(如 qwen3.5-9b, gpt-oss-20b)大多无法生成可解析的理论,或在创作前就陷入停滞。
DeepSeek V4 Flash(中阶模型)在 CLEVR 和 GQA 上表现良好,但在 CLEVRER 上有所下降,尤其是在有参考的情况下。
较小的模型表现出高方差以及特定的失效模式,例如错误的工具调用或无法生成有效的 clingo 语法。
理论特征: 成功的模型生成的理论长度各异(例如,GPT-5 在 GQA 上编写了 65 条规则,而 Opus 编写了 343 条),但两者都实现了高准确率,这表明规则数量是创作风格的函数,而非覆盖范围的函数。
意义与主张 本文声称,神经符号智能体可以成功地从零开始蒸馏出完整且正确的 ASP 理论,挑战了这类理论必须由人工编写的观点。研究强调,虽然前沿模型可以在组合式和真实世界 VQA 任务上达到最先进的水平,但性能并非在所有顶级模型中都是统一的;GPT-5 在 GQA 上的特定失败表明,对于某些模型和特定任务,智能体循环可能会产生“负面效应”。
作者谦虚地总结道,虽然该协议适用于高能力模型,但“能力阈值”并非纯粹是参数规模的函数,而是涉及工具使用和语法生成的特定能力。他们指出,目前的蒸馏理论是静态的,并提出未来的工作方向是将它们集成到训练循环中(例如 NS-CL),并自动生成问题解析器,而不是依赖现有的函数程序注释。这项工作并不声称解决了端到端的 VQA 问题,而是证明了自动化神经符号流水线中符号推理组件的可行性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。