想象一下,你拥有一个超级聪明的机器人,它几乎读遍了互联网上的每一本书、每一个网站和每一篇文章。你可能会想:“如果它无所不知,那它在逻辑上一定是天才,对吧?”
这篇论文,QSTRBench,就像一个非常具体、极其棘手的“逻辑健身房”,旨在测试那个机器人究竟是在思考,还是仅仅基于它 memorized 的模式在猜测。
以下是作者所做工作的分解,使用了简单的类比:
1. 测试:“逻辑健身房”
研究人员创建了一个名为QSTRBench的基准测试。把它想象成一个拥有三种特定机器的健身房:
- “反向”机器(逆关系): 如果"A 在 B 的左边”,那么 B 相对于 A 是什么?(答案:右边)。
- “连锁反应”机器(组合): 如果 A 在 B 的左边,且 B 在 C 的左边,那么 A 相对于 C 在哪里?(答案:左边)。
- “邻居”机器(概念邻居): 如果你慢慢将物体 A 移向物体 B,在它们接触之前,它们可能处于的下一个位置是什么?
他们使用**九种不同的“时空语言”**对这些机器进行了测试。有些很简单(比如只说“之前”或“之后”),有些则极其复杂(涉及凹形、凸形或带有孔洞的形状)。
2. 棘手之处:“伪装”
研究人员知道这些 AI 模型擅长从训练数据中 memorize 答案。因此,他们并没有以正常方式提问,而是试图欺骗模型:
- “假词”测试: 他们没有使用"TPP"(表示“接触但在内部”的技术术语),而是使用了像"Zorp"这样的自创无意义词汇。如果模型仍然答对了,说明它确实在推理;如果它答错了,说明它只是在 memorize 真实词汇。
- “图片”测试: 他们没有使用文字,而是使用了简单的 ASCII 艺术图表。
- “交换”测试: 他们交换了定义。他们告诉模型:“在这个游戏中,‘接触’意味着‘遥远’。”如果模型遵循了新规则,说明它在思考;如果它坚持旧定义,说明它只是在复述记忆。
3. 结果:“聪明但有缺陷的学生”
该论文测试了32 个不同的 AI 模型,从可在笔记本电脑上运行的小型模型,到运行成本高昂的巨型“前沿”模型。
- 它们不是在瞎猜: 每个模型的表现都优于随机猜测。
- 它们并不完美: 没有一个模型答对了 100% 的问题。即使是最聪明的模型也会犯错。
- “简单”与“困难”的差距:
- 简单模式: 模型在简单的时间问题上表现出色(比如“之前”和“之后”)。这就像它们擅长基础算术。
- 困难模式: 模型在复杂的空间形状(特别是称为 RCC-22 的系统)上表现极差。这就像问一个数学天才一边玩杂耍一边解微积分题;他们会被复杂性搞糊涂。
- “思考”的代价: 那些试图“更深入思考”(使用更多计算能力)的模型通常表现更好,但它们运行速度更慢,成本也高得多。有时,思考过多反而使它们在特定任务上表现更差。
4. 大惊喜:“幻觉”
论文发现,当这些模型不知道答案时,它们不会只说“我不知道”。有时,它们会发明新词。
- 类比: 想象你问一个学生:"2 加 2 等于几?”他们自信地回答:“是一个'Flurg'。”
- 模型会发明规则中不存在的虚假关系名称。这表明它们试图用自信来填补空白,而不是遵循严格的逻辑。
5. 结论:“模式匹配者,而非逻辑学家”
作者得出结论,虽然这些 AI 模型令人印象深刻,但它们尚未成为真正的逻辑推理者。
- 它们严重依赖以前读过的内容。当你伪装问题(使用假词或图表)时,它们的性能就会下降。
- 它们不一致。如果你两次问同一个问题,它们可能会给出两个不同的答案。
- 目前,如果你需要一台计算机来执行严格、无错误的空间逻辑,传统的计算机程序(如计算器)仍然比这些 AI 模型更好。AI 是一个“聪明的猜测者”,而不是“逻辑机器”。
简而言之: 该论文构建了一个严格的障碍赛,以查看 AI 是否真的能理解空间和时间。裁决结果是:它们正在进步,但在路径变得过于复杂时,它们仍然容易陷入困惑、不一致以及编造事实。
QSTRBench 技术摘要:评估语言模型基于定性时空演算进行推理能力的新基准
问题陈述
定性时空推理(QSTR)是一个成熟领域,致力于使用形式化演算来表示和推理定性信息(例如“在……左侧”、“在……之前”、“是……的一部分”)。尽管大语言模型(LLM)在自然语言处理方面已展现出令人印象深刻的能力,但其在这些形式化系统内进行严格推理的能力尚未得到验证。现有基准往往缺乏对核心 QSTR 推理任务的系统性覆盖,或依赖于未基于特定演算的非正式问题。此外,关于大语言模型是真正进行推理还是仅仅复现训练数据中的模式,学界尚存争议。本文旨在探讨当代大语言模型是否能够执行与 QSTR 演算相关的特定推理任务:确定逆关系、计算关系组合以及识别概念邻域。
方法论
作者引入了 QSTRBench,这是一个综合性基准,旨在测试大语言模型在九种不同的 QSTR 演算上的表现:点代数(PA)、艾伦区间代数(IA)、区间与持续时间(INDU)、区域连接演算(RCC-5、RCC-8、RCC-22)、九交模型(9IM)、基数方向演算(CDC)以及修订版 STAR。
该基准针对每种演算评估三种特定的推理任务:
- 逆关系(Converse):给定关系 R(x,y),确定关系 R−1(y,x)。
- 组合表(Composition Table, CT):给定 R1(x,y) 和 R2(y,z),确定 x 与 z 之间可能的关系。
- 概念邻域(Conceptual Neighbourhood, CN):识别在连续变形或平移下可直接跟随给定关系的关系。
数据集包含 1,806 个问题,涵盖所选演算中的 102 个基础关系。为了测试鲁棒性以及模式匹配与真实推理之间的区别,作者创建了一个扩展数据集(QSTRBenchExtended),包含 14,372 个问题。该扩展集通过以下方式改变提示呈现形式:
- 符号表示:前缀式与中缀式。
- 术语:标准英文单词、数学符号以及“临时词”(无语义含义的随机生成术语)。
- 描述风格:自然语言文本、示意图 ASCII 图以及 LaTeX 公式。
- 匿名化:交换关系名称(例如将"TPP"标记为"EC"),以测试模型是依赖训练数据还是提示特定的逻辑。
研究评估了 32 种当代大语言模型,范围从前沿商业模型(如 GPT-5.2、Gemini-2.5-Pro、Grok-4)到较小的开放权重模型(如 Llama-3、Gemma-3)。实验在严格的温度设置(0.01)下进行,以最小化随机性,结果以准确率的微平均值报告。
主要贡献
- 基准创建:发布 QSTRBench 和 QSTRBenchExtended,提供了首个用于评估大语言模型在多种演算及提示变体下 QSTR 推理能力的广泛开源数据集。
- 新颖数据:首次发布由作者推导并验证的 RCC-22 概念邻域(CN)。
- 系统性评估:对 32 种模型在三种推理任务上进行了严格评估,不仅分析准确率,还分析令牌使用量、推理轨迹以及重复实验中的一致性。
- 方法论严谨性:使用临时词和示意图描述来探测模型是检索记忆事实还是执行逻辑推理。
结果
- 总体表现:所有测试模型的表现均优于随机猜测,但没有任何模型能始终如一地回答所有问题。表现因演算和任务类型而异。
- 任务难度:模型在逆关系(Converse)问题上表现最佳,其次是组合表(CT)问题,概念邻域(CN)问题最具挑战性。
- 演算难度:点代数(PA)最为直接(准确率最高),而 RCC-22 最为困难。有趣的是,准确率与基础关系的数量并不严格相关;例如,INDU(25 个关系)比 RCC-22(22 个关系)更容易。
- 模型表现:
- GPT-5.2(具有高推理努力)整体表现最佳,在 PA、CDC 和 STAR 上取得了近乎完美的分数,但在 RCC-22 上仍显吃力。
- OpenAI 的 GPT-5.1 表现不佳(准确率为 0.22),显著低于其前代(GPT-5)和后代(GPT-5.2),表明其“自适应推理”配置存在问题。
- 小模型:较小的模型(如 Gemma-3 1B、Llama-3 8B)表现非常差,经常无法通过基本的同一性或传递性检查。
- 推理与检索:
- 模型在标准提示下通常保持高准确率,但当关系名称被交换或替换为临时词时,表现下降,表明其依赖训练数据中的模式。
- 然而,o1 和 GPT-5.2 显示出一定的泛化能力,即使在描述为示意图或名称被匿名化时也能应对,但与文本相比,示意图的准确率显著下降。
- 幻觉:模型经常幻觉出不存在的关系名称(例如"TPPPi"或无效的 INDU 关系),表明其缺乏对演算的深层语义理解。
- 令牌使用:更复杂的演算(如 RCC-22)需要高推理模型输出显著更多的令牌(比 PA 高出几个数量级),但这并不能保证完美的准确率。
意义与主张
该论文声称,尽管大语言模型展现出模拟推理的能力(优于随机猜测),但它们尚未具备针对形式化 QSTR 演算的可靠且一致的推理能力。作者强调:
- 不一致性:即使是最佳模型,在固定种子的重复实验中,对同一问题也会产生不同的答案。
- 训练数据的局限性:临时词和示意图提示导致的性能下降表明,当前模型严重依赖训练语料库中记忆的模式,而非从第一性原理推导答案。
- 复杂性障碍:RCC-22 与较简单演算相比的难度,凸显了当前模型在处理复杂空间拓扑方面的能力上限。
- 未来效用:该基准是追踪 AI 推理进展的必要工具。作者指出,虽然大语言模型最终可能取代符号推理器,但当前的神经符号方法(使用大语言模型将自然语言翻译为符号求解器)仍容易因翻译错误而导致下游失败。
论文以谦逊的结论收尾,指出该评估是对一个快速演变领域的快照,其主要的持久价值在于基准本身以及测试推理鲁棒性的方法论。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。