The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom
对 LeWorldModel 的这项独立复现表明,其在 TwoRoom 环境中报告的成功完全取决于未注明的评估惯例和配置选择,而非模型本身的能力,因为作者自有的权重在其实际发布的设置下表现失败,且预测准确率被证明与长程规划的成功无关。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
侦探的困境:当地图与疆域不符时
想象一下,你正在教一个机器人如何通过迷宫。你不仅仅是想让机器人记住路径;你还希望它能在脑中构建一个“世界模型”——一张能够预测如果它向左转或向右转会发生什么的心理地图。如果机器人能准确预测未来,它就能提前规划并解决复杂的谜题。这就是**潜在世界模型(latent world models)**的梦想:AI 系统通过学习环境中的隐藏规则,从而实现智能行动,而无需人类手把手地指导。
但棘手之处在于:你如何知道机器人的心理地图是否真的优秀?通常,科学家通过观察机器人预测“下一步”的表现好坏来进行检查。如果它能完美猜中视频的下一帧,我们就假设它理解了这个世界。然而,这篇论文提出了一个危险的问题:如果机器人是一个预测下一秒的专家,但在规划下一分钟的任务时却是个彻头彻照的灾难呢?
这个故事来自机器学习领域,特别是关于 AI 如何学习模拟现实的研究。在这个领域,研究人员构建数字大脑来理解物理、运动和因果关系。由于如果我们基于那些在纸面上看起来很完美、但在现实世界中却会失效的模型来制造机器人或自动驾驶汽车,后果可能会非常严重,因此其中的利害关系极高。这篇论文讲述了一群独立研究人员如何扮演“侦探”的角色,去拆解一个名为 LeWorldModel 的著名新 AI 方法。他们想要看看这个魔术表演是真的有效,还是魔术师只是在说明书中隐瞒了一些关键步骤。
失踪的说明书
研究人员试图复现一篇论文中的结果,该论文声称他们的新 AI —— LeWorldModel,能够以约 87% 的成功率解决一个简单的两室迷宫。相比于其他达到 97–100% 成功率的方法,这个数值看似较低,但作者声称其方法之所以特别,是因为它更简单,不需要花哨的技巧就能奏效。
由 Joyjeet Singh 领导的独立团队租用了计算资源(大约 24 美元 的 GPU 时间)来从头重建这个 AI。他们原本预期会看到同样的 87% 成功率。然而,他们发现了一堆隐藏的秘密。
四个隐藏规则
团队发现,原论文的说明就像一份忘了提到最重要配料的食谱。如果仅按照发布的配置文件进行操作,AI 将无法学习任何东西。研究人员发现,代码中埋藏了四个决定一切的“未记录惯例”:
- 密集动作采集(Dense Action Gathering): AI 需要看到机器人进行的每一次微小移动,而不仅仅是几个快照。
- 程序化宽度(Programmatic Width): 大脑特定部分的尺寸是由一个隐藏的数学公式决定的,而不是设置文件中的一个数字。
- ImageNet 归一化(ImageNet Normalization): 输入给 AI 的图像必须以一种非常特定的方式进行处理(使用 “ImageNet” 标准),而不仅仅是通过将颜色除以 255。
- Z-Score 处理动作(Z-Scored Actions): 机器人的移动必须根据整个数据集进行数学调整,并且要先剔除奇怪的 “NaN”(非数字)错误。
如果没有这四个隐藏的修正,AI 的“预测器”(即猜测未来的部分)甚至无法收敛。这就像尝试用一份忘了说“加入面粉”或“预热烤箱”的食谱来烤蛋糕一样。
机器中的幽灵
即使修复了食谱,团队还是遇到了障碍。在三次训练运行中,AI 看起来像是失败了。“验证损失”(衡量 AI 表现有多差的分数)剧烈波动,表明模型似乎坏掉了。但“训练损失”(衡量其在学习数据上的表现有多差)实际上却在变好!
他们找到了罪魁祸首:一个 批归一化层(Batch Normalization layer)。可以把它想象成 AI 大脑中的恒温器。在错误模式下,这个恒温器失灵了,将微小的误差放大了 300 倍。它让 AI 看起来像是在失败,而实际上它正在完美学习。一旦他们“重新校准”了这个恒温器,真实的性能才显现出来。
两张不同的地图
团队还发现,原论文发布了两套完全不同的测试规则,且给出了截然不同的结果:
- “短程”测试: 代码的配置文件规定,测试 AI 时目标距离为 25 步,预算为 50 步。在这种规则下,原作者自己的 AI 达到了 84.0%。
- “长程”测试: 论文附录中说,测试目标距离为 100 步,预算为 150 步。在这种规则下,同一个 AI 的成功率仅为 14.0%。
研究人员意识到,论文声称的 “87%” 成功率很可能是基于“短程”测试,而“长程”测试(如附录所述)则要难得多,并揭示了该 AI 的弱点。
大惊喜:准确性并不等于技能
最令人震惊的发现不在于隐藏规则,而在于什么才是真正的“好”。
团队训练了三个不同版本的 AI:
- 一个预测误差较高的“差”版本。
- 一个(原作者版本的)“中等”版本。
- 一个预测误差极低的(团队修正后的)“优秀”版本。
短期胜利:
当目标较近(25 步)时,“优秀”的 AI 表现最好,成功率达 94.0%。“差”的 AI 表现最差,为 78.0%。这符合逻辑:更好的预测 = 更好的规划。
长期灾难:
但当目标较远(100 步)时,规则完全反转了。
- “优秀”的 AI(预测最准确的那个)变成了最差的规划者,成功率仅为 20.0%。
- “差”的 AI(预测最不准确的那个)反而成为了最好的规划者,成功率达到了 80.0%。
那个最准确的 AI 因为对自己的完美预测过于自信,导致它做出了巨大的、鲁莽的动作,最终偏离目标,距离目标竟有 116.6 个单位(比随机猜测还要远!)。而那个“差”的 AI 由于对自己的预测不确定,反而行动得更加谨慎,最终成功到达了目标。
这对未来意味着什么
这篇论文并不是说这种 AI 方法毫无用处。事实上,一旦修复了隐藏规则,团队的 AI 在短程测试中达到了 94.0%,超过了原有的声称。其表征(心理地图)是稳固的;机器人知道自己在哪里。
然而,论文提出了一个强烈的警告:你不能通过观察一个规划者预测下一步的能力好坏,来判断它的规划能力。
在这个特定的迷宫中,成为一个“完美的预测者”反而让 AI 变得更糟于长期的规划。研究人员发现,最准确的模型因为对自己的路径过于笃定,从而采取了极端行动,导致自己误入歧途。
团队还发现,一项预注册实验(旨在测试 AI 在导航“同室目标”与“跨室目标”时表现差异的测试)在一个版本的 AI 上有效,但在另一个版本上却完全失败。这表明,AI 的“魔力”可能取决于模型的具体版本,而非该方法的通用属性。
总结
论文的结论是,如果你想构建一个能够进行长远规划的 AI,你不应该仅仅选择那个预测未来最准确的模型。事实上,在这项任务中,选择最准确的模型意味着选择了最差的规划者。未来的教训是,我们需要新的测试 AI 的方法,去审视那些超越简单预测分数的维度,因为一张完美的地图并不总是意味着你知道如何驾驶汽车。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。