← 最新论文
💬 NLP

Measuring Iterative Temporal Reasoning with Time Puzzles

该论文提出了名为"Time Puzzles"的算法生成基准,用于评估大语言模型在结合工具进行迭代式时间推理时的能力,研究发现现有模型即使具备搜索功能,在缺乏显式日期约束时仍难以可靠地完成此类任务。

原作者: Zhengxiang Wang, Zeyu Dong

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengxiang Wang, Zeyu Dong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 "Time Puzzles"(时间谜题) 的新测试,用来给大语言模型(LLM)做“体检”,看看它们到底会不会一边查资料、一边动脑筋去解决复杂的时间问题。

为了让你更容易理解,我们可以把这篇论文的核心内容想象成一场**“侦探破案游戏”**。

1. 背景:现在的 AI 像什么?

现在的 AI 模型(比如 ChatGPT)非常聪明,它们肚子里装着海量的知识。但是,以前的测试就像是在考**“闭卷考试”**:

  • 场景:你给 AI 一个时间问题,它必须靠脑子里的记忆直接回答,不能查书,不能问人。
  • 问题:但在现实生活中,我们遇到复杂的时间问题(比如“帮我定个会议,要在某位市长卸任后的第二年,且是农历六月的第二个周日”),我们肯定会去查日历、去搜新闻
  • 现状:以前的测试没怎么考过 AI“一边查资料一边推理”的能力。

2. 新测试:Time Puzzles(时间谜题)

作者设计了一套像**“侦探游戏”一样的谜题,专门测试 AI 的“迭代推理”**能力(即:查一下 -> 想一下 -> 再查一下 -> 再想一下)。

游戏怎么玩?
想象你手里有一张**“藏宝图”**,上面写着几条线索,你需要找出一个具体的日期(比如 1945 年 7 月 22 日)。

  • 线索 A(事实锚点):“这一年是汉斯·布拉什克(Hanns Blaschke)担任维也纳市长的最后一年。”(AI 需要去搜索:他哪年卸任的?哦,是 1945 年。)
  • 线索 B(日历逻辑):“它是农历六月的第 2 个周日。”(AI 需要去查日历:1945 年的农历六月对应公历几月?那个月的第 2 个周日是哪天?)
  • 线索 C(限制条件):“日期必须在这个月的 5 号之后。”

AI 的任务
它不能只靠猜,必须像侦探一样:

  1. 先搜线索 A,确定年份。
  2. 再查日历,把农历转换成公历。
  3. 最后把所有线索拼起来,看看哪一天能同时满足所有条件。

3. 实验结果:AI 的表现如何?

作者找了 13 个不同的 AI 模型(包括最新的 GPT-5 等)来玩这个游戏,结果有点令人意外

  • 没有工具时(闭卷考试)
    即使是目前最强的 GPT-5,正确率也只有 55.3%

    • 比喻:就像让一个博学的教授做数学题,但他被禁止用计算器,结果连简单的加减乘除都算错,因为他太依赖“死记硬背”而不是“现场计算”。
  • 有工具时(开卷考试,允许上网搜索)
    当允许 AI 使用“网络搜索”工具后,成绩确实提高了。但是,它依然没有达到完美

    • 关键发现:如果把谜题里的“线索 A"直接改成“年份是 1945 年”(即把需要搜索的事实直接告诉 AI,让它只负责算),AI 的正确率会飙升
    • 这意味着什么:AI 的推理能力其实不错,但它在**“如何有效地使用工具去获取信息”**这个环节上很笨拙。它要么搜不到关键信息,要么搜到了却不会把信息正确地用到推理链条里。

4. 核心结论:AI 的“短板”在哪里?

这篇论文揭示了一个重要的问题:
现在的 AI 就像是一个“拥有超级大脑但不会用搜索引擎的图书管理员”。

  • 如果你直接给它书里的内容(显式日期),它能算得很准。
  • 如果你让它自己去图书馆找书(隐式事实 + 搜索),它经常会在找书的过程中迷路,或者找到了书却读不懂里面的逻辑。

这就好比:
你让 AI 去算“明天是星期几”。

  • 简单版:你直接告诉它“今天是周三”,它马上能算出明天是周四(正确)。
  • 困难版:你让它“去查一下今天几号,然后算出明天是周几”。它可能会查错日子,或者查对了日子但算错了星期。

5. 总结与启示

  • Time Puzzles 是一个简单、便宜但非常有效的测试工具,用来诊断 AI 在**“工具使用 + 逻辑推理”**结合方面的能力。
  • 目前的 AI 在**“查资料”“做推理”这两件事的配合**上还有很大差距。它们要么太依赖记忆,要么在调用工具时不够灵活。
  • 未来的 AI 发展,不能只盯着让模型“背更多的书”,更要训练它们如何像人类专家一样,熟练地利用外部工具去解决复杂问题

一句话总结
这篇论文给 AI 出了一套“查资料 + 算日子”的谜题,发现现在的 AI 虽然脑子好使,但不太会“查字典”,导致在需要结合搜索和推理的复杂任务中表现不佳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →