← 最新论文
🤖 machine learning

Cortex: Compact Behavior Cloning for Quake with Frozen Visual Features

该论文介绍了 Cortex,这是一种用于《雷神之锤》(Quake)的紧凑型行为克隆策略,它利用冻结的 DINOv3 视觉编码器和一个六层 Transformer,在大型数据集上实现了稳定的关卡推进和战斗成功,证明了在求助于强化学习或显式记忆之前,简单的模仿学习是有效的。

原作者: Dzmitry Malyshau

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Dzmitry Malyshau

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字心灵的游乐场

想象一个世界,那里的计算机不再仅仅是遵循僵化的指令,而是通过观察来学习,就像孩子观察年长的兄弟姐妹骑自行车一样。这就是机器学习的领域,特别是被称为**行为克隆(behavioral cloning)*的一个分支。在这个科学领域,研究人员向人工智能(AI)喂入数千小时的人类游戏录像,希望计算机能够模仿职业玩家的动作、时机和直觉,而无需被明确告知如何*玩游戏。

驱动这一领域的重大问题是:一个简单的、紧凑的 AI 仅通过模仿,能在我们需要添加复杂的“大脑”特征(如记忆、目标设定或试错学习)之前,学到多少东西? 这就像是在问,一只鹦鹉在不需要理解空气动力学的情况下,仅通过背诵苍鹰的飞行路径,能飞多远。如果我们能构建一个通过模仿就能玩得很好的小型、高效的 AI,就能节省大量的计算能力和能源。但如果 AI 在遇到与练习内容略有不同的情况时立刻陷入困境,我们就知道我们需要教会它如何从错误中恢复。这是科学家们不断测试的“简单模仿”与“智能适应”之间的微妙平衡。


Cortex:微型《雷神之锤》复制者

在题为《Cortex: Compact Behavior Cloning for Quake with Frozen Visual Features》(Cortex:基于冻结视觉特征的《雷神之券》紧凑型行为克隆)的论文中,研究员 Dzmitry Malyshau 决定测试这种“简单模仿”理念的极限。他构建了一个名为 Cortex 的 AI 智能体,并将其投入到经典 1996 年视频游戏《雷神之锤》(Quake)那混乱且节奏极快的世界中。具体来说,他要求它导航第一个关卡 E1M1——这是一个由走廊、门、按钮和怪物组成的迷宫,需要结合奔跑、跳跃、射击和解决简单谜题的能力。

Cortex 的设计极其精简。它并没有一个从零开始构建的庞大大脑。相反,它使用了一个“冻结”的视觉大脑——一个预训练的计算机视觉模型 DINOv3——作为一对经过高度训练的眼睛。这些眼睛是“冻结”的,意味着它们已经擅长识别形状和纹理,并且在训练过程中不会发生改变。Cortex 真正的“大脑”是一个只有 1098 万个可训练参数 的微型六层 Transformer。对比来看,该领域其他著名的游戏 AI 拥有数亿个参数。Cortex 是轻量级的短跑选手,而其他模型则是重量级冠军。

训练过程出奇地短促且高效。AI 观看了 6,849 段 人类玩家的录像,总计约 474.7 小时 的游戏时间。然而,Cortex 并没有观看每一秒钟。研究人员选择了一个特定的“采样纪元”(sampled epoch),这就像是对数据进行一次精心策划的单次遍历。这涉及 51.7048 万个短片段(每个片段包含四帧),且 AI 在单块高端显卡(RTX 5080)上仅用 3.3 分钟 就完成了优化。其目标是观察这个微型、快速训练的模型是否能跟上那些更大、更复杂的 AI。

结果:喜忧参半

当研究人员让 Cortex 在《雷神之锤》中自由驰骋时,结果呈现出一种令人着迷的复杂性:既有惊人的技能,也有预料之中的失败。

好消息:
Cortex 在基础操作方面表现得异常出色。在两组分别包含 20 个回合(每个回合持续 120 秒)的独立测试中,Cortex 在每组的 20 个回合 中都成功到达了“开门处”、“按钮室”和“下降闸门”。它还在 20 个回合中的 19 个 里成功完成了击杀。这表明,对于关卡早期较为直接的部分,单纯模仿人类动作的效果非常好。它能够有效地在初始走廊中导航并进行战斗。

坏消息:
尽管取得了早期的胜利,但 Cortex 在所有 40 个回合中均未能完成关卡(两组均为 0/20)。AI 会陷入困境,通常是在靠近墙壁或水域的地方,并且无法自行脱困。研究人员指出,这是行为克隆中的一个经典问题,称为协变量偏移(covariate shift):当 AI 犯下一个微小的错误时,它会进入一个在训练视频中从未见过的状态,由于它只知道模仿所见之物,它就会陷入停滞或恐慌。

对比:
研究人员还在相同的条件下测试了另外两个规模大得多的 AI 模型(P2P-150M 和 NitroGen)。这些在数千小时多种不同游戏中训练的巨头,在这次特定测试中的表现甚至更差。它们各自仅完成了 5 个回合中的 0 个,并且几乎立即陷入困境。这表明,对于这项特定的、狭窄的任务,像 Cortex 这样专门的、紧凑的模型实际上可以胜过庞大的通用模型,至少在游戏的前一分钟内是如此。

实验揭示了什么

论文并未止步于玩游戏,还进行了一系列“消融实验”(ablation experiments),以观察是什么驱动了 Cortex 以及是什么让它崩溃。

  • 细节有助于战斗,而非导航: 当研究人员给 Cortex 提供更密集、更详细的屏幕视图(使用更多的“token”或视觉补丁)时,AI 在战斗和生存方面变得更强了。它获得的击杀更多,死亡次数更少。然而,这些额外的细节并没有帮助它更好地进行路径导航。事实上,它有时甚至让路径的可靠性略微下降。这表明,看到更多细节有助于 AI 对敌人做出反应,但不一定能帮助它理解下一步该去哪里。
  • 记忆并非万能药: 团队尝试给 Cortex 加入对过去动作的“记忆”,希望它能从错误中学习。令人惊讶的是,这并没有持续提升其表现。仅仅因为 AI 记住了五秒钟前做了什么,它并没有在导航关卡方面变得更好。
  • 离线指标具有误导性: 研究人员发现,标准的计算机测试(例如 AI 在测试集上预测下一步动作的能力)是衡量 AI 实际游戏表现的糟糕预测指标。一个 AI 在理论上可能看起来很完美,但在实际游戏中却表现得一塌糊涂。这对未来的研究人员提出了一个至关重要的警告:不要只相信数字,要亲眼观察游戏。

结论

论文总结道,虽然一个紧凑、简单的 AI 可以通过仅仅模仿人类,很好地学会玩复杂游戏的早期阶段,但它也遇到了一个难以逾越的瓶颈。它无法从自身的错误中恢复,也无法应对从未见过的场景。其失败情况符合 协变量偏移 的概念——它在游戏的“未知”部分迷失了方向。

作者们认为,下一步的目标不是让 AI 变得更大,而是教会它如何恢复。他们提出了一种名为 DAgger 的方法,即当 AI 陷入困境时,由人类介入并展示正确的动作,从而让 AI 专门针对这些“救援”时刻进行学习。

简而言之,Cortex 证明了你并不需要一台超级计算机就能在短时间内玩好一款电子游戏。一个微型、高效的模型可以凭借惊人的技巧模仿人类最初几分钟的游玩过程。但是,如果没有一种从错误中学习或在情况出错时采取行动的方法,它最终会撞上一堵无法逾越的高墙。该论文并非声称解决了游戏问题;相反,它提供了一份清晰、诚实的地图,标明了简单模仿在何处有效、在何处失效,从而为未来如何构建真正具备适应能力的智能体提供了指引。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →