技术摘要:Tycho —— 用于 ARC-AGI-3 的程序化世界模型的主动抽象
问题定义
本文针对 ARC-AGI-3 进行研究,这是一个交互式基准测试,智能体必须仅通过观察和行动,从陌生的游戏中推断出规则、隐藏状态和目标。与静态推理任务不同,ARC-AGI-3 施加了严格的行动预算(action budget):每一次移动都会计入得分,智能体必须在探索(收集证据)与利用(完成关卡)之间取得平衡。
核心挑战是主动抽象(active abstraction):智能体不仅必须决定环境的真实现状是什么,还必须决定何时值得投入成本去构建模型、使用模型进行规划、在失败时修复模型,或者完全绕过模型。论文将这些环境形式化为参数化的渲染确定性 Moore 机(parameterized rendered deterministic Moore machines),区分了底层状态(包括计数器或摄像机偏移等隐藏变量)、转移动力学(transition dynamics)以及观测生成(渲染)。一个关键难点在于,相同的渲染网格可能对应不同的底层状态(非马尔可夫观测),这要求智能体维护交互历史以消除歧义。
方法论:Tycho 系统
Tycho 是一个旨在在交互过程中构建并利用程序化世界模型(programmatic world models)的编码智能体系统。它在一个共享的任务时间架构(图 1)上运行,该架构包含一个执行者(actor)(负责推理并提交行动)和一个可选的工作台(workbench)(负责构建或修复可执行模型)。
1. 形式化框架
- 渲染 Moore 机: 环境被建模为一个确定性系统,其中动作更新底层状态 s,状态产生观测(网格)、可用动作和结果。转移可能会在稳定到下一个决策帧之前发射中间动画帧(瞬态证据)。
- 类型化交互历史: 系统记录了结构化的决策帧、动作、瞬态帧和终止结果。这可以防止智能体将动画帧与决策点混淆。
- 部分预测: 为了处理不确定性,模型的渲染器可以对无法确定的像素进行弃权(abstain)(返回 ⊥),或者返回一组受限的**观测变体(observation variants)**以处理量化歧义(例如,代表隐藏计数器的 HUD 进度条)。
2. 可执行假设语言
Tycho 将世界模型表示为实现以下四个核心功能的 Python 程序:
init_state:将初始网格和关卡索引映射到建模状态。
transition:给定一个动作,推进状态。
render:将状态映射回网格(支持弃权)。
outcome:将状态分类为进行中、关卡完成或游戏结束。
该模型是自由形式的,允许智能体根据特定的游戏机制选择状态表示(例如,对象列表、元胞自动机、计数器)。
3. 元推理策略
论文评估了四种用于管理执行者与模型之间交互的不同策略:
- 无世界模型(直接推理): 执行者直接对证据进行推理,而不构建可执行的模型。
- 单一模式(执行者自创): 执行者既负责推理,也负责根据需要编辑模型。
- 编排者模式(执行者请求委派): 执行者可以请求一个专门的**构建子智能体(builder subagent)**来构建或修复模型。
- 触发模式(自动修复): 当验证失败(例如,转移不匹配、覆盖度不足)或在关卡边界时,测试框架会自动调用构建器。
4. 验证与规划
- 验证: 通过重放记录的交互历史来测试模型。如果模型预测的网格在所有声明的单元格上与观测到的网格匹配(或匹配其中一个允许的变体),则该转移被“接受”。
- 规划: 一旦模型经过验证,系统会在状态空间中搜索通往
level_complete 的动作序列。生成的计划会针对模型的内部状态进行验证,并逐步执行,执行者在每次行动后重新验证状态。
核心贡献
- 形式化: 论文将 ARC-AGI-3 形式化为带有转移发射的渲染确定性 Moore 机的主动识别过程,明确处理了隐藏状态、非单射观测以及交互成本。
- 程序化世界模型: 它定义了一种自由形式的可执行假设语言,允许智能体将规则外化为可检查、可编辑的 Python 代码,支持部分预测和状态抽象。
- 策略基准测试: 论文在相同的推理预算下,对四种模型维护策略(无模型、单一、编排者、触发)进行了匹配比较,隔离了模型分配(谁来构建模型以及何时构建)对性能的影响,而非仅仅是模型合成能力。
- 指标区分: 该工作区分了转移准确性(模拟器是否重现了历史记录)与游戏表现(模型是否有助于获胜)。它证明了高转移准确性并不保证高分,如果模型未能识别目标或策略分配资源不当。
- 人类适应环路: 它描述了一个过程,即利用智能体运行中的元反射(meta-reflections)来迭代优化智能体的测试框架(工具、记忆、验证),然后再将其冻结用于未来的运行。
实验结果
评估是在 25 个公开 ARC-AGI-3 游戏(共 183 个关卡)上进行的,使用了前沿大模型(Claude Opus 4.8, GPT-5.6 Sol, 和 Opus 5)。
匹配策略选择 (Opus 4.8)
- 直接推理(无模型): 达到了 79.07 RHAE(相对人类行动效率)。
- 单一模式(执行者自创): 达到了 85.36 RHAE。
- 编排者模式(委派): 达到了 88.49 RHAE,是匹配策略中最高的。
- 触发模式(自动修复): 达到了 83.07 RHAE。尽管该模式产生的模型拥有最高的接受转移匹配度(88.1%),但其表现不及编排者模式。这一差距说明,仅仅准确模拟动力学对于成功是不够的,还需要正确识别目标并高效分配资源。
前沿模型评估 (选定的编排者策略)
使用更强的模型采用编排者策略:
- GPT-5.6 Sol: 达到了 100.00 RHAE,在 7,766 个计分动作内完成了全部 25 个游戏和 183 个关卡。
- Opus 5: 达到了 100.00 RHAE,在 6,641 个动作内完成了全部 183 个关卡(比 GPT-5.6 Sol 少用了 14.5% 的动作)。
- 效率: Opus 5 使用的计分动作数比人类基准总和少了 61%。
- 成本: Opus 5 的运行估计成本为 $2.99k(API 等效值),显著低于其他系统的同类运行(例如,Rodionov 的验证运行在类似条件下估计为 13.6k–15.5k)。
定性分析
案例研究(如 cd82, tu93, sk48)显示:
- 成功: 模型可以用经过验证的序列取代试错法(如 cd82),并支持在缩减的状态空间上进行搜索(如 tu93)。
- 失败: 如果目标识别错误,即使转移模型很准确也会失败(如 sk48,其中模型完美模拟了机制,但未能识别目标)。
- 修复: 系统能够成功定位不匹配之处(例如 tu93 中意外的巡逻爆炸),并修复模型以实现重新规划。
意义与主张
论文声称主动抽象是通用智能的一个关键组成部分:即从代价高昂的交互中生成可测试模型,并决定何时使用它们的能力。
- 选择性建模: 结果表明,世界建模在委派给专家(编排者)时最为有效,而不是强制执行(触发)或完全由执行者处理。
- 准确性 vs. 效用: 高保真度的环境转移模拟是必要的,但不是充分的;系统还必须正确推断目标并高效分配计算资源。
- 系统架构: 从 79.07 到 100.00 RHAE 的性能提升归功于复合智能体系统(测试框架 + 模型 + 策略),而非仅仅是基础模型本身。论文强调,通用智能取决于能够将有限的经验组织成任务模型,并能适应支持该过程的机制。
- 谦逊态度: 作者承认这些结果是对固定公开测试集的表征。他们指出,目前的适应环路是由人类介导的(作者根据智能体笔记优化框架),未来的工作必须实现这种外层环路的自动化,以实现真正的自我改进。他们还提醒,高推理成本(API 调用)是用未计分的计算量换取计分动作的效率,这种权衡与生物效率有所不同。