OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration
OPINE-World 是一个基于大语言模型(LLM)的智能体,它通过将假设生成与本体错误优先级的探索相结合,从基于像素的交互中在线学习数据高效、可重用且以对象为中心的程序化世界模型,在无需针对特定游戏进行训练的情况下,在具有挑战性的 ARC-AGI-3 基准测试上实现了强大的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你被丢进了一个全新的电子游戏中。你不知道规则,不知道角色叫什么名字,甚至连“目标”是什么都不知道。你只能不停地按按钮,看看会发生什么。大多数计算机程序会陷入困境,试图记住它看到的每一个像素,或者需要玩成千上万次游戏才能弄明白按下“向上”会让角色跳跃。
这篇论文介绍了一种名为 OPINE-World 的新型 AI 智能体,它学习玩这些游戏的方式更像人类:通过构建一个世界的心理模型,测试它,并在出错时修正它。
以下是它的工作原理,分为几个简单的概念:
1. 双脑系统
与其使用一个试图处理所有事情的巨型大脑,OPINE-World 使用了两个协作的智能体(可以把它们想象成两个正在合作的专家):
- 探索者 (动作智能体/The Explorer): 这是“双手”。它在实时进行游戏。它尝试各种动作,观察结果,并记录下每一次移动和结果的“日记”。它现在还不尝试编写规则手册;它只是在收集证据。
- 建筑师 (世界模型智能体/The Architect): 这是“大脑”。它阅读探索者的日记,并尝试编写一套规则(一个计算机程序)来解释为什么会发生这些事情。它会问:“如果我在地面上按下‘向上’,角色就会跳跃。如果他们在空中,他们就会落下。让我把这条规则记下来。”
2. “假设与测试”循环
该系统不仅仅是猜一次然后听天由命。它运行着一个持续的假设与测试循环:
- 建筑师编写一份规则手册草案(一个程序)。
- 探索者继续玩游戏。
- 验证者根据探索者的日记来检查建筑师的规则手册。它会问:“你的规则手册是否能精确预测日记中发生的所有事情?”
- 如果规则手册完美预测了未来,则被接受。
- 如果规则手册说“角色应该跳跃”,但角色实际上摔倒了,这就是一个反例 (Counterexample)。建筑师会收到一个“红旗”警告,重写规则手册以修复这个特定的错误,然后再次尝试。
3. 学习“本体论”(对象词汇表)
这是 OPINE-World 特别之处。在许多游戏中,计算机会被告知“这是一个玩家,这是一个墙壁”。但 OPINE-World 并非被告知这些信息的。它必须从零开始自行摸索。
- 问题: 想象你看一张桥梁的照片。它是一个巨大的物体,还是由许多小木板组成的?如果 AI 对物体的分组错误,它的规则将会变得混乱。
- 解决方案: 系统使用了一个聪明的衡量标准,叫做本体论误差 (Ontology Error)。你可以把它看作是一个“困惑度计”。
- 如果 AI 对某个物体的类型感到困惑(例如,“这是一个钥匙还是一个门?”),计数器就会上升。
- 如果 AI 对一个物体的行为感到困惑(例如,“有时这个按钮可以开门,有时却不行”),计数器也会上升。
- 系统利用这个计数器来引导探索者前往游戏中最令人困惑的部分以收集更多数据,从而帮助建筑师理清正确的“物体词汇表”。
4. “精确回放”规则
大多数 AI 系统只要“大致正确”即可。但 OPINE-World 是一个完美主义者。它使用了一种称为反例引导的归纳合成 (CEGIS) 的方法。
- 只有当建筑师的程序能够完美回放过去每一次的动作,精确到最后一个像素时,该程序才被允许使用。
- 如果程序哪怕仅有一次失败,也会被拒绝。这确保了一旦 AI 认为它掌握了规则,它就是真正掌握了规则,而不是仅仅基于模式进行猜测。
5. 结果:击败基准测试
研究人员在 ARC-AGI-3 上测试了它,这是一个旨在测试 AI 在没有预先训练的情况下学习新技能速度的极难基准测试。
- 挑战: AI 必须玩 25 种不同的游戏。它不知道目标、物体名称或规则。
- 结果: OPINE-World 成功解决了 25 个游戏中的 20 个。
- 效率: 它不仅解决了问题,而且解决得非常高效。在许多游戏中,它所采取的动作比人类还要少。
- 对比: 其他 AI 方法(如试图记忆像素的深度神经网络,或其他程序合成方法)在相同的严格条件下未能解决任何游戏。
总结类比
想象你被丢进了一个没人说你所用语言的异国他乡。
- 旧的 AI: 试图记住它看到的每一张脸和每一个路标,希望以后能识别出模式。它会被信息淹没并感到困惑。
- OPINE-World:
- 探索者四处走动,指着东西并记录:“当我推这个时,门开了。”
- 建筑师根据这些笔记编写了一本字典和一本语法书。
- 困惑度计告诉他们:“我们还不知道那个红色物体是什么,我们再去观察一下。”
- 他们不断完善他们的字典,直到他们能够完美预测接下来会发生什么。
- 一旦他们有了完美的字典,他们就可以规划前往目的地的路线,而不需要进行任何猜测。
论文声称,通过将“执行”与“思考”分离,并坚持要求其内部规则手册具有完美的准确性,这种系统可以比以往的方法更快、更高效地学习复杂的未知环境。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。