← 最新论文
💻 computer science

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

本文介绍了 SciCrafter,这是一个基于《我的世界》的基准测试,通过红石电路任务评估人工智能智能体在“从发现到应用”循环中的表现,揭示出尽管当前前沿模型因知识应用方面的局限而将成功率停滞在 26% 左右,但先进系统面临的新瓶颈正逐渐转向识别知识缺口和提出正确问题的能力。

原作者: Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一位才华横溢但缺乏经验的学徒如何制造一台复杂的机器,比如一个发条机器人。你递给他一盒零件和一个目标:“让机器人走起来。”

这位学徒不仅仅需要知道如何组装齿轮(应用);他首先需要弄清楚哪些齿轮能工作、为什么它们会那样转动,以及如果以奇怪的方式连接它们会发生什么(发现)。

这篇题为《当前智能体能否弥合“发现”到“应用”的鸿沟?——以《我的世界》为例》的论文,本质上是一份成绩单,评估当今最先进的 AI“学徒”处理整个流程的能力。

以下是他们发现的分解,使用了简单的类比:

1. 测试:一个“红石”谜题

研究人员没有在现实世界中测试 AI(因为那太混乱且昂贵)。相反,他们使用了《我的世界》(Minecraft),这是一款你可以使用“红石”(游戏中的电线版本)来构建复杂机器的电子游戏。

  • 任务:AI 必须构建一个电路,以特定的模式(一次性全部点亮,或按顺序点亮)点亮特定数量(从 4 到 64 个)的灯。
  • 难点:AI 不能只是猜测。随着灯的数量增加,游戏规则也会改变。例如,在《我的世界》中,信号传输得越远就越弱。要点亮 64 盏灯,AI 必须发现它需要特殊的“中继器”(信号放大器),并将它们排列成特定的“枢纽”形状。如果它只是试图记住点亮 4 盏灯的解决方案并将其放大,就会失败。

2. 结果:AI 撞上了墙

研究人员测试了当时可用的最智能的 AI 模型(如 GPT-5.2、Gemini-3-Pro 和 Claude-Opus-4.5)。

  • 得分:即使是最好的 AI,成功率也仅为**26%**左右。
  • 类比:想象给一位天才学生一份数学测试。他们可以完美地解决简单的加法,但当你要求他们发明一种新的乘法方法来解决更难的问题时,他们就会卡住。他们非常擅长遵循指令,但极不擅长弄清楚他们自己需要编写什么样的指令

3. 诊断:他们在哪里失败了?

研究人员将 AI 的失败分解为四个步骤,就像一场接力赛。他们想看看是哪位选手掉了接力棒。

  • 步骤 1:知道自己不知道什么(识别)

    • 问题:AI 不知道该问什么。它没有意识到:“嘿,我不知道信号随距离衰减的情况。”
    • 解决方法:当研究人员给 AI 一个提示,比如“检查信号能传播多远”时,成功率翻了一倍
    • 洞察:对于最聪明的 AI 来说,最大的问题不是解决谜题,而是弄清楚谜题到底是什么。它们不擅长提出正确的问题。
  • 步骤 2:运行实验(发现)

    • 问题:AI 不知道如何系统地测试其想法。
    • 解决方法:研究人员添加了一个“科学家”子智能体。这是第二个 AI,其唯一任务是运行小测试(例如:“如果我把方块放在这里会发生什么?”)并撰写报告。
    • 洞察:当 AI 有一个“科学家”来做实验时,它的表现变好了。这表明,虽然 AI 拥有如何进行实验的知识,但在没有结构化流程的情况下,它们难以亲自执行实验。
  • 步骤 3:写下规则(巩固)

    • 问题:AI 找到了答案,但因为笔记写得太乱,后来忘记了如何使用它。
    • 解决方法:当研究人员强制 AI 以严格的格式(主张、证明、约束、示例)写下其发现时,它的表现要好得多。
    • 洞察:仅仅“知道”某事是不够的;AI 需要知道如何存储和组织这些知识,以便以后使用。
  • 步骤 4:建造机器(应用)

    • 问题:即使在弄清楚规则并将其写下之后,AI 仍然难以在游戏中正确放置方块。
    • 洞察:这是“残留”的鸿沟。AI 仍然难以将其新知识转化为完美的物理构建。然而,对于最聪明的模型来说,这个鸿沟正在变小,而“提出正确问题”的鸿沟正在变大。

4. 主要结论

该论文得出结论,我们正迎来 AI 的转折点。

  • 过去:AI 在所有方面都很差劲:提出问题、实验和构建。
  • 现在:如果你给 AI 规则,它在构建(应用)方面变得非常擅长。
  • 未来的瓶颈:最困难的部分不再是“解决问题”。最困难的部分是**“定义问题”**。

最终比喻
想象你有一辆汽车,一旦你告诉它目的地和路线,它就能完美地自动驾驶。问题是,这辆车目前非常不擅长透过车窗观察,意识到“哦,路被堵住了”,并决定寻找新路线。它需要有人告诉它:“嘿,路被堵住了,绕道而行。”

研究人员表示:我们需要停止试图让汽车开得更快,转而教它如何观察道路并弄清楚该去哪里。

贡献总结

  1. SCICRAFTER:一项新的测试(在《我的世界》中),用于评估 AI 能否从“发现”走向“应用”。
  2. 分解:他们证明了聪明 AI 目前最大的障碍是识别它们需要学习什么,而不仅仅是应用它们已知的知识。
  3. 工具:他们创建了一个“科学家”助手和一种更好的笔记方法,这显著帮助了 AI 学习新事物。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →