← 最新论文
🤖 AI

Auto-Discovery-Bench: Diagnosing Structured State Tracking in Oracle-Guided Discovery

本文介绍了 Auto-Discovery-Bench,这是一个确定性的、由预言机引导的诊断基准,旨在隔离并评估智能体在交互式发现过程中维持和更新结构化信念的能力。

原作者: Tingting Chen, Beibei Lin, Srinivas Anumasa, Vedant Shah, Zifeng Yuan, Qiran Zou, Anirudh Goyal, Dianbo Liu

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingting Chen, Beibei Lin, Srinivas Anumasa, Vedant Shah, Zifeng Yuan, Qiran Zou, Anirudh Goyal, Dianbo Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图破解一个谜题,但你的助手不是侦探,而是一个超级聪明的 AI。这个谜题不是关于犯罪,而是关于一组事物如何相互作用的隐藏规则。

这篇论文介绍了一个新的“训练场”,叫做 Auto-Discovery-Bench。你可以把它想象成一个 AI 侦探的健身房,旨在测试一项特定的技能:AI 能否在长时间内追踪一个复杂且不断变化的故事,而不产生混乱?

以下是论文通过简单的类比进行的拆解:

1. 问题所在:为什么我们需要这个健身房?

真正的科学发现是混乱的。它就像是在大风吹袭、灯光闪烁、甚至草堆着火的情况下,试图在草堆里寻找一根针。如果 AI 在现实世界中失败了,我们无法判断它是由于科学能力差、阅读能力差,还是仅仅因为记不住五分钟前发生了什么。

作者想要移除这些“风、火和闪烁的灯光”。他们构建了一个 干净、受控的房间,这里的规则是完美的,反馈是即时的,AI 唯一需要做的就是根据新线索来记忆并更新自己的认知

2. 三个游戏(基准测试)

论文通过三种不同类型的谜题来测试 AI。在所有游戏中,AI 都必须通过提问并观察结果来猜测隐藏的结构。

  • 游戏 A:多米诺骨牌链(有向图发现)

    • 设定: 想象一排多米诺骨牌。有些骨牌是相互连接的;如果你推倒一个,它会撞倒下一个。但你看不见这些连接关系。
    • 任务: AI 选择一个骨牌进行推动(即“干预”)。它观察哪些其他骨牌被撞倒了。基于此,它必须画出一张精确的地图,标明哪些骨牌与哪些骨牌相连。
    • 难点: 随着骨牌数量的增加(从 3 个增加到 10 个),AI 会变得困惑。它会忘记是哪块骨牌撞倒了哪块。
  • 游戏 B:权力的游戏邻里关系(无向关系发现)

    • 设定: 想象一群房子。如果一座房子变得愤怒(一次“攻击”),它的邻居也会跟着愤怒。愤怒会蔓延,但连接是双向的(如果 A 房对 B 房愤怒,B 房也会受到影响)。
    • 任务: AI “攻击”一座房子,并观察愤怒是如何蔓延的。它必须弄清楚房子之间隐藏的友谊/敌对地图。
    • 难点: 当只有 3 间房子时,AI 表现出色。当变成 10 间时,许多 AI 会放弃或出错。
  • 游戏 C:秘密配方(符号方程发现)

    • 设定: 想象一种魔法药水。最终的颜色取决于质量、速度和温度等成分。但 AI 并不知道背后的配方(公式)。
    • 任务: AI 混合成分,观察结果,并尝试猜出背后的数学公式。
    • 难点: 论文加入了“干扰项”——这些成分看起来很重要,但实际上毫无作用。AI 必须忽略这些垃圾,找到真正的配方。

3. 测试结果:谁通过了测试?

作者测试了几种顶尖的 AI 模型(如 GPT-4o、Gemini、Grok 等)。

  • “超级侦探”: 少数模型(特别是 Grok-4Gemini-2.5-pro)非常出色。即使地图变得庞大或配方变得复杂,它们也能解决谜题。
  • “挣扎的侦探”: 其他模型(如某些版本的 Claude 和 Llama)在处理小规模谜题时表现尚可,但当谜题变大时就会彻底崩溃。它们会在故事的中途迷失方向。
  • 效率差距: 即使两个模型都得到了正确答案,其中一个可能尝试了 10 次,而另一个只需 2 次。这些“超级侦探”不仅更聪明,而且效率更高。

4. “记忆测试”(轨迹追踪)

为了找出 AI 失败的原因,作者进行了一项特别测试。他们去掉了“思考”部分(猜测公式或地图),而只是要求 AI 观看一段变化过程的视频,并回答:“在步骤 1 到步骤 2 之间,哪座房子变色了?”

  • 发现: 即使没有高难度的思考,许多 AI 依然失败了。随着视频变长(步骤增加),它们对开头发生的事情的记忆力消失了。
  • 隐喻: 这就像读一本长篇小说。如果你要求学生总结情节,他们可能会失败。但如果你只是问,“第一章里主角的帽子是什么颜色的?”,而他们仍然记不住,那么问题不在于情节,而在于他们的短期记忆。论文指出,如果 AI 要成为优秀的科学家,它们首先需要变得擅长在脑海中保持一个长期的、有结构的叙事,而不至于丢掉剧情。

5. 核心结论

这篇论文并不是说这些 AI 已经准备好去治愈疾病或发现新物理学了。相反,它是在说:“在我们信任 AI 去进行复杂的科学研究之前,我们需要确保它能在长对话中保持连贯的思维逻辑。”

Auto-Discovery-Bench 是一个用来检查这项特定技能的工具。它表明,虽然一些 AI 正在变得非常出色,但许多 AI 在面对漫长且复杂的叙事时,仍然难以维持住结构化的信息。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →