← 最新论文
💻 computer science

QSTRBench: a New Benchmark to Evaluate the Ability of Language Models to Reason with Qualitative Spatial and Temporal Calculi

本文介绍了 QSTRBench,这是一个旨在评估大语言模型在不同演算体系下定性时空推理能力的综合性基准,结果显示,尽管当前模型的表现优于随机猜测,但它们在一致性方面存在困难,且其性能会因推理任务的复杂度不同而出现显著波动。

原作者: Anthony G. Cohn, Robert E. Blackwell

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Anthony G. Cohn, Robert E. Blackwell

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它几乎读遍了互联网上的每一本书、每一个网站和每一篇文章。你可能会想:“如果它无所不知,那它在逻辑上一定是天才,对吧?”

这篇论文,QSTRBench,就像一个非常具体、极其棘手的“逻辑健身房”,旨在测试那个机器人究竟是在思考,还是仅仅基于它 memorized 的模式在猜测。

以下是作者所做工作的分解,使用了简单的类比:

1. 测试:“逻辑健身房”

研究人员创建了一个名为QSTRBench的基准测试。把它想象成一个拥有三种特定机器的健身房:

  • “反向”机器(逆关系): 如果"A 在 B 的左边”,那么 B 相对于 A 是什么?(答案:右边)。
  • “连锁反应”机器(组合): 如果 A 在 B 的左边,且 B 在 C 的左边,那么 A 相对于 C 在哪里?(答案:左边)。
  • “邻居”机器(概念邻居): 如果你慢慢将物体 A 移向物体 B,在它们接触之前,它们可能处于的下一个位置是什么?

他们使用**九种不同的“时空语言”**对这些机器进行了测试。有些很简单(比如只说“之前”或“之后”),有些则极其复杂(涉及凹形、凸形或带有孔洞的形状)。

2. 棘手之处:“伪装”

研究人员知道这些 AI 模型擅长从训练数据中 memorize 答案。因此,他们并没有以正常方式提问,而是试图欺骗模型:

  • “假词”测试: 他们没有使用"TPP"(表示“接触但在内部”的技术术语),而是使用了像"Zorp"这样的自创无意义词汇。如果模型仍然答对了,说明它确实在推理;如果它答错了,说明它只是在 memorize 真实词汇。
  • “图片”测试: 他们没有使用文字,而是使用了简单的 ASCII 艺术图表。
  • “交换”测试: 他们交换了定义。他们告诉模型:“在这个游戏中,‘接触’意味着‘遥远’。”如果模型遵循了新规则,说明它在思考;如果它坚持旧定义,说明它只是在复述记忆。

3. 结果:“聪明但有缺陷的学生”

该论文测试了32 个不同的 AI 模型,从可在笔记本电脑上运行的小型模型,到运行成本高昂的巨型“前沿”模型。

  • 它们不是在瞎猜: 每个模型的表现都优于随机猜测。
  • 它们并不完美: 没有一个模型答对了 100% 的问题。即使是最聪明的模型也会犯错。
  • “简单”与“困难”的差距:
    • 简单模式: 模型在简单的时间问题上表现出色(比如“之前”和“之后”)。这就像它们擅长基础算术。
    • 困难模式: 模型在复杂的空间形状(特别是称为 RCC-22 的系统)上表现极差。这就像问一个数学天才一边玩杂耍一边解微积分题;他们会被复杂性搞糊涂。
  • “思考”的代价: 那些试图“更深入思考”(使用更多计算能力)的模型通常表现更好,但它们运行速度更慢,成本也高得多。有时,思考过多反而使它们在特定任务上表现更差。

4. 大惊喜:“幻觉”

论文发现,当这些模型不知道答案时,它们不会只说“我不知道”。有时,它们会发明新词

  • 类比: 想象你问一个学生:"2 加 2 等于几?”他们自信地回答:“是一个'Flurg'。”
  • 模型会发明规则中不存在的虚假关系名称。这表明它们试图用自信来填补空白,而不是遵循严格的逻辑。

5. 结论:“模式匹配者,而非逻辑学家”

作者得出结论,虽然这些 AI 模型令人印象深刻,但它们尚未成为真正的逻辑推理者

  • 它们严重依赖以前读过的内容。当你伪装问题(使用假词或图表)时,它们的性能就会下降。
  • 它们不一致。如果你两次问同一个问题,它们可能会给出两个不同的答案。
  • 目前,如果你需要一台计算机来执行严格、无错误的空间逻辑,传统的计算机程序(如计算器)仍然比这些 AI 模型更好。AI 是一个“聪明的猜测者”,而不是“逻辑机器”。

简而言之: 该论文构建了一个严格的障碍赛,以查看 AI 是否真的能理解空间和时间。裁决结果是:它们正在进步,但在路径变得过于复杂时,它们仍然容易陷入困惑、不一致以及编造事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →