Twin: Playing an Unknown Game with a Test-Time Digital Twin
本文介绍了“Twin”,一种测试时世界模型推理系统,它使编码智能体能够通过交互动态构建并迭代修复未知网格游戏的的可执行模拟,通过在执行前向数字孪生验证动作,在 ARC-AGI-3 级别上实现了 97.8% 的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你被丢进了一个从未见过的电子游戏中。没有说明书,没有教程,没有人告诉你按键的功能,也没有人告诉你目标是什么。你只能通过按下按钮、观察变化并进行试错来摸索规则。这就是人工智能在面对“未知世界”时的日常现实。长期以来,人工智能研究人员一直试图教会计算机成为超级聪明的“猜谜者”,希望它们能通过记忆模式或从数百万个示例中学习。但当规则发生彻底改变,或者面对一个全新的游戏时,这些猜谜者往往会陷入困境,只能随机乱按按钮直到碰巧成功。计算机科学领域的这个核心问题是:人工智能如何像人类一样快速且高效地学习一个新游戏,而不需要先进行一百万轮练习?
这篇论文介绍了一个名为 Twin 的巧妙新系统,它通过彻底改变游戏方式解决了这个问题。Twin 不仅仅是在猜测,它更像是一个好奇的侦探,在计算机程序内部构建了一个“数字孪生体”——一个完美运行的游戏规则副本。你可以这样理解:当你玩一个新游戏时,你可能会在心里记下,“如果我点这里,方块就会变红。”Twin 不仅仅是做个心理笔记;它实际上会编写一段微小的代码,写道:“如果你点击这里,方块就会变红。”然后,在它于实际游戏中做出任何真实动作之前,它会在自己的大脑中使用这段代码运行一次模拟。如果模拟显示方块会变蓝,但实际游戏显示方块变红了,Twin 就知道它的代码错了。它会立即重写代码以修正错误。它不断重复这个过程——编写、测试并修正自己的规则手册——直到它的数字孪生体能完美预测真实世界。只有到那时,它才会采取真正的行动。
结果令人印象深刻。研究人员在 25 个全新的、神秘的网格游戏(属于一个名为 ARC-AGI-3 的基准测试)上测试了 Twin,在这些游戏中,规则和目标都是隐藏的。在这些游戏中,直接进行游戏而没有任何特殊辅助的标准 AI 模型仅通过了一个游戏,得分仅为 100 分中的 7.8 分。即使是配备了标准“辅助工具”的聪明 AI,其表现也仅提升到了 61.1 分。但拥有自写规则手册的 Twin,成功通过了 25 个游戏中的 23 个,得分高达 93.3。或许更令人惊讶的是,Twin 在获得奖励或“游戏结束”信号之前,就已经在 87.2% 的关卡中弄清楚了“获胜”意味着什么。它是通过猜测可能的目标,在自己的数字孪生体中测试该猜测,并且只有在模拟显示方案可行时才执行计划来完成这一点的。
论文表明,构建一个可用的世界模型其实比人们想象的要简单,但弄清楚“目标”才是难点。Twin 不仅仅是对游戏做出反应;它实时构建游戏的逻辑,根据它做过的每一次移动来检查自己的工作,然后充满信心地规划下一步。事实证明,如果你给人工智能一种编写自身模拟器的方法,并强制它在行动前证明该模拟器的有效性,它就能像人类第一次玩游戏时那样,几乎同样高效地学习未知的游戏。这表明,智能 AI 的秘诀不仅在于拥有更大的大脑,还在于拥有一种在行动前测试自己理论的更好方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。