← 最新论文
💬 NLP

OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions

本文介绍了 OdysseyArena,这是一个包含 120 个标准化任务和极端压力测试的新型基准测试,旨在评估大语言模型进行长程、主动及归纳式交互的能力,并揭示了即使是前沿模型在复杂环境中自主发现潜在转移规律方面也存在困难。

原作者: Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Li
发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明的机器人玩一种新的、复杂的棋类游戏。

旧的方法(演绎法):
目前大多数 AI 测试就像是在机器人开始玩之前把规则手册交给它。你会说:“规则如下:如果你落在红色格子上,向后移动两格。如果你掷出六点,向前移动。”机器人只是在遵循这些明确的指令。它擅长听从命令,但它并不真正理解规则为什么存在,或者如果规则手册丢失了该如何自行推导。

新的方法(归纳法):
《ODYSSEYARENA》的研究认为,现实世界的智能不在于遵循规则手册,而在于在玩的过程中发现规则。想象一下,你把棋盘递给机器人,但却把规则手册藏了起来。机器人必须尝试移动棋子,观察结果,感到困惑,再次尝试,并慢慢地靠自己摸索出隐藏的逻辑。这被称为“归纳推理”。

问题所在

研究人员发现,即使是当今最聪明的 AI 模型也在这方面表现糟糕。它们擅长遵循指令(演绎),但在规则隐藏时通过经验学习(归纳)却表现得很差。它们会陷入循环、忘记已学到的知识,或者在游戏变得漫长且复杂时选择放弃。

解决方案:ODYSSEYARENA

为了测试这一点,团队构建了一个名为 ODYSSEYARENA 的新“健身房”。他们没有创建短小、简单的任务,而是创建了四个不同的“游戏”,迫使 AI 成为一名侦探。这些游戏旨在设计成长程任务(数百步),并要求 AI 进行主动探索。

以下是这四个游戏的解释,使用了简单的类比:

  1. 打开灯光(逻辑谜题):

    • 设置: 你有一面灯泡墙。有些亮着,有些熄灭着。你可以拨动开关,但你不知道内部的布线情况。
    • 挑战: 拨动一个开关可能会点亮一个灯泡,但也可能意外地关掉另外三个灯泡,因为存在隐藏的连接。AI 必须通过拨动开关、观察结果,通过试错法来弄清楚隐藏的布线图。
    • 隐喻: 这就像是在没有说明书的情况下修理一串缠绕在一起的圣诞灯,猜测哪个灯泡控制着其他灯泡。
  2. AI 交易(股票市场):

    • 设置: AI 是一名持有投资组合的交易员。每天市场都在根据隐藏的“因素”(如天气或新闻)波动,而 AI 无法直接看到这些因素,只能看到一些暗示。
    • 挑战: AI 必须观察股价和新闻,猜测连接它们的隐藏数学关系,并预测未来以盈利。
    • 隐喻: 这就像是通过观察人们的穿着来预测天气,而从未亲眼见过天空。你必须找出“人们穿着外套”与“下雨”之间的模式。
  3. 能源调度(电网):

    • 设置: AI 是一名发电厂经理。它必须平衡来自太阳能、风能和煤炭的能量,以维持城市运转。
    • 挑战: 太阳和风是不可预测的,并且遵循隐藏的周期(如季节)。如果 AI 连续三天犯错,整个电网就会崩溃。它必须学习自然界隐藏的节奏,才能保持灯火通明。
    • 隐喻: 这就像是在暴风雨之夜完美地维持一堆篝火,而风每小时都会改变方向,你必须猜出其中的规律。
  4. Repo 系统(软件修复者):

    • 设置: AI 是一名试图安装软件包的计算机程序员。
    • 挑战: 安装一个软件可能会破坏另一个软件,因为存在隐藏的版本冲突。AI 必须经历安装、测试、出错、修复、再安装的过程,慢慢绘制出不同程序之间隐形的依赖网络。
    • 隐喻: 这就像是在盖房子,买一扇新门可能会意外地撞倒你昨天建的一面墙。你必须在建造的过程中摸索出蓝图。

他们的发现

研究人员在这些游戏上测试了 15 个以上世界上最聪明的 AI 模型(包括顶尖的商业模型和开源模型)。

  • 结果: 即使是最优秀的模型,在处理长程任务时也表现得极其糟糕。它们会陷入循环(重复同样的错误)、忘记之前学到的东西,并且无法弄清隐藏的规则。
  • 差距: 当研究人员预先给出规则时,模型表现得很好。但当它们必须发现规则时,性能几乎降至零。
  • 结论: 现在的 AI 就像是一个背诵教科书非常出色,但一旦被要求在没有书的情况下解决问题就完全失败的学生。制造真正自主智能体的最大瓶颈不在于让它们变得更大或更快,而在于教它们如何从自己的错误中学习,并发现世界中隐藏的模式。

简而言之,ODYSSEYARENA 是一种新的测试 AI 的方式,它不再问“你能听从命令吗?”,而是开始问“你能靠自己弄明白这个世界是如何运作的吗?”目前的答案是:“并不太行。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →