← 最新论文
💻 computer science

ActSWM: Action-Sensitive World Models for Long-Horizon Planning in Open-World Games

本文介绍了 ActSWM,一种通过强制执行转移分离原则来解决“上下文崩溃”失效模式的动作敏感型潜在世界模型,以确保长程展开在不同动作序列下仍保持可区分性,从而提升在开放世界游戏中的规划性能,并实现从离线视频中进行动作恢复。

原作者: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenfeng Gan, ZiTong Zeng, Jiajun Cheng, Yeke Song, Yongyi Tang, Xueqian Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人玩电子游戏,但你不能让它每做一个动作都去碰控制器。相反,你想让机器人在脑海中构建一个游戏的“梦境”。它观察屏幕,想象如果它跳跃会发生什么,接着想象如果它奔跑会发生什么,然后从中挑选出一条最好的路径前进,而不会真的撞上一堵墙。这就是**世界模型(World Models)**的世界——这是人工智能的一个分支,在这里,机器通过在一个压缩的、数学化的“梦境空间”中进行模拟,来学习预测未来。

为了让这一切奏效,机器人的梦境必须对其选择保持敏感。如果机器人想象跳跃,梦境应该显示它向上飞起。如果它想象奔跑,梦经过应该显示它向前加速。目前科学家们面临的一个大问题是,这些梦境往往会变得“懒惰”。机器人可能会预测一个看起来很完美的未来,但这个未来实际上并不会根据机器人的决策而改变。这就像是在看一部情节早已写死的电影:无论角色试图向左转,镜头始终只会向右平移。这篇论文针对了这个特定的故障,提出了一个问题:我们能否教会机器人构建一种让未来能够“听从”其动作的梦境?


“懒惰梦境”问题

见见 ActSWM,一种旨在阻止机器人产生“懒惰梦境”的新型 AI 大脑。在像《我的世界》(Minecraft)这样的开放世界游戏中,智能体(机器人)需要对遥远的未来进行规划。它们需要弄清楚:“如果我现在挖掉这块石头,以后我能不能盖出一座房子?”为了实现这一点,它们使用了一个潜空间世界模型(Latent World Model)。你可以把这个模型看作是一个在后台高速运行的超级模拟器。它并不处理游戏屏幕上的每一个像素,而是将世界压缩成一个简化的“潜空间”代码——一种思维上的缩写。

目标是让智能体在瞬间进行数千次这种心理模拟,以找到最佳动作。但问题在于:许多现有的模拟器都存在一个作者称之为**上下文崩溃(Context Collapse)**的漏洞。

想象一下你在向朋友讲故事。如果你说:“我去了公园”,你的朋友可能会想象一个晴朗的日子。如果你说:“我去了公园,而且下雨了”,他们会想象一个潮湿的日子。这很好。但上下文崩溃就像是一个无论你说什么,都只会想象同一个晴朗日子的朋友。他们太专注于“公园”这个大概念,以至于不再听取你关于“下雨”的具体细节。在 AI 世界中,这意味着模拟器预测了一个合理的未来(一个晴朗的公园),但却无法根据机器人采取的具体行动来改变其预测(下雨)。机器人想:“我可以跳,也可以跑,但未来的样子看起来都一样,”这使得规划变得无法实现。

解决方案:一个冻结的“动作侦探”

作者提出了 ActSWM(动作敏感型世界模型)来解决这个问题。他们的秘诀在于一个被称为**转换分离(Transition Separation)**的原则。他们希望确保如果机器人选择了两条不同的路径,产生的梦境必须看起来不同。

为了强制执行这一点,他们引入了一个聪明的技巧:固定动作读取器(Fixed Action Readout)。想象你有一个侦探,其职责是观察一个场景并猜出刚才发生了什么动作。通常,如果侦探与场景一起学习,他们可能会“作弊”。如果两个不同的动作导致的场景看起来过于相似,侦探可能会直接修改自己对“跳跃”的定义以匹配场景,而不是迫使场景本身变得不同。

ActSWM 通过冻结侦探来阻止这种作弊行为。他们给 AI 配备了一个拥有固定、不可更改规则书的侦探。于是,AI 被迫使其“梦境”(潜空间转换)变得如此独特,以至于这个被冻结的侦探能够准确地分辨它们。如果 AI 试图让“跳跃”的梦和“奔跑”的梦看起来一样,冻结的侦探就会无法猜出动作,从而导致 AI 受到惩罚。这迫使 AI 保持其未来预测的敏锐度,并对每一次具体的按键操作做出响应。

研究发现

团队在混乱且充满方块的《我的世界》以及另外三款游戏(《反恐精英 2》、《侠盗猎车手 V》和《Apex 英雄》)中测试了这个新大脑。

1. 阻止崩溃:
当他们将 ActSWM 与旧模型进行比较时,差异非常显著。在一次测试中,我们要求 AI 想象一个带有真实动作的未来,与一个机器人什么都不做(全零动作)的未来。旧模型产生的未来几乎完全相同。然而,新的 ActSWM 则创造了巨大的差距。作者测量了这个“动作间隙(action gap)”,发现 ActSWM 产生的分离度大约是之前最强基准模型的 380 倍。机器人的梦境终于开始听从控制器的指令了。

2. 更好的规划:
由于梦境更加准确,机器人的表现也变得更好。在《我的世界》中,当被要求执行诸如放置火把、挖掘石块或搭建柱子等任务时,ActSWM 显著提高了成功率。例如,与基准模型相比,它在挖掘石块任务中的成功率提升了 90.0%,在搭建柱子任务中的成功率提升了 54.5%。机器人现在可以可靠地分辨出哪条路径通向房屋,哪条路径通向悬崖。

3. 从视频中读取心智:
最后,他们测试了 AI 是否可以通过观察人类玩游戏的视频来猜出玩家正在按哪些键。这就像是在看电影并猜测演员的动作。通过使用一种称为交叉熵最小化(CEM)的方法,ActSWM 从离线视频中恢复正确动作的能力远优于随机猜测。在《侠盗猎车手 V》中,它寻找正确动作的“代价”比随机搜索提高了 252.38,并且在识别活跃按键(即玩家实际按下按钮时)方面的准确度提升高达 0.711。

总结

该论文表明,对于 AI 智能体要真正掌握复杂的开放式游戏,它们需要的不仅仅是对未来的准确预测;它们需要的是对动作敏感的预测。如果当你改变主意时,未来并没有随之改变,那么你就无法进行规划。通过冻结一个简单的“动作侦探”并迫使 AI 保持其未来场景的差异性,ActSWM 证明了我们可以构建出不仅是在白日梦,而且真正能“倾听”玩家的世界模型。这不仅仅是一个微小的改进;这是我们在教机器如何想象自身选择的后果方面的一次根本性的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →