← 最新论文
💻 computer science

Tycho: Active Abstraction with Programmatic World Models for ARC-AGI-3

该论文介绍了 Tycho,这是一个通过将环境形式化为参数化 Moore 机并利用“主动抽象”来动态构建、测试和修复可执行世界模型的编码智能体系统,旨在解决 ARC-AGI-3 挑战,并在所有 183 个关卡上实现了与人类重放完全一致的效率,同时显著降低了动作计数,优于人类基准。

原作者: Jens Lehmann, Andrei Aioanei, Sahar Vahdati

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Jens Lehmann, Andrei Aioanei, Sahar Vahdati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你被丢进了一款全新的电子游戏,没有说明书,没有教程,也无法寻求帮助。你只能看到屏幕,按下按钮,然后观察接下来的变化。为了获胜,你必须弄清楚隐藏的规则,猜测目标,并且必须在做这一切时绝不浪费任何一次操作,因为每一次按键都会扣除你的分数。这就是**主动抽象(active abstraction)**的挑战:通过在世界中实践来学习其运作方式,而不是仅仅死记硬背答案。科学家称之为“技能获取(skill acquisition)”,这基本上是指通过仅有的几次尝试就能快速学会一项新技巧的能力,而不是需要练习一百万次。核心问题在于:计算机能否像人类一样,通过观察、猜测规则,然后利用这些规则进行预判,从而玩转这些神秘的游戏?

这篇论文介绍了一个名为 Tycho 的系统(以天文学家第谷·布拉赫命名,他精确地绘制了星图,使得后人能够发现宇宙规律),旨在回答这个问题。Tycho 是一个“编码智能体(coding agent)”,旨在玩一组被称为 ARC-AGI-3 的复杂谜题。它不仅仅是猜测下一步的操作,而是尝试编写一段小型的计算机程序,作为游戏本身的模拟器。它观察游戏,编写代码来预测如果按下某个按钮会发生什么,检查该代码是否正确,然后利用该代码来规划其移动路径。研究人员测试了 Tycho 使用该模拟器的四种不同方式:完全忽略它、让主脑自己编写代码、请求一个助手机器人编写代码,或者在出错时自动修复代码。

结果令人惊讶且富有层次感。团队发现,仅仅拥有一个模拟器是不够的;何时使用它的“策略”最为关键。表现最好的方法是请求式委托(actor-requested delegation),即主智能体仅在认为有必要时,才会请求一名专家助手来构建游戏模拟器。这种方法在初步测试中获得了最高的效率。当他们将这一获胜策略交给目前最强大的两个 AI 模型(GPT-5.6 Sol 和 Opus 5)时,结果令人惊叹:它们解决了 25 个公开游戏中的 100% 以及其中的所有 183 个关卡。Opus 5 模型表现得尤为高效,完成相同关卡时比平均人类玩家减少了 61% 的动作次数。

然而,论文也警告了一种常见的陷阱。他们发现,构建一个能完美预测游戏中每一个像素的模拟器(高准确度)并不保证你一定会赢。有一种被称为“自动修复(automatic repair)”的策略,虽然构建出的模拟器在预测下一步发生的事情时极其准确,但智能体的表现依然糟糕,因为它不知道目标是什么,也不知道何时该停止使用模拟器。这就像拥有一张完美的迷宫地图,却不知道出口在哪里。论文得出结论:真正的智能不仅仅在于构建一个完美的模型,更在于一种“主动抽象”的能力,即决定何时构建模型、何时信任模型,以及何时忽略模型并直接行动。Tycho 表明,通过将游戏视为一套待发现和测试的规则,而非仅仅是一个待解决的图像,AI 可以像人类一样高效地学习玩转新游戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →