MoP-JEPA: Hard-Assigned Predictor Mixtures for Stochastic JEPA World Models
MoP-JEPA 通过采用具有 个硬分配头的仅上下文路由器来生成有限数量的候选后继状态,解决了随机 JEPA 世界模型中单输出预测器的局限性,在图搜索任务中的原始覆盖率和验证路径成功率方面均显著优于标准的回归和混合密度网络(MDN)方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人如何在巨大的、扭曲的迷宫中导航。这个机器人拥有一个“水晶球”(世界模型),它试图猜测在采取一步行动后会发生什么。
问题:“平均值”陷阱
大多数目前的机器人使用的一种水晶球,就像一个非常礼貌但优柔寡断的图书管理员。如果你问:“如果我往左走,我会到哪里?”而这里有两个可能的答案(也许是传送门把你送到了厨房,或者陷阱把你送到了花园),这个图书管理员不会给你两个选项。相反,它会给你一个答案:即厨房和花园之间的精确中点。
在现实世界中,并不存在厨房和花园之间的“中间点”。如果机器人试图走向那个中间点,它就会撞上一堵在两种现实中都不存在的墙。这篇论文称之为“单输出限制”(single-output restriction)。它指出,当未来是混乱且具有多种可能性(随机性)时,试图只预测一个“平均”的未来,是导致失败的诱因。
解决方案:“硬分配”团队
作者 Zhi Song 及其来自腾讯和香港城市大学的团队构建了一种新型的水晶球,称为 MoP-JEPA。它不再是雇佣一位图书管理员,而是雇佣了一个由 K 个不同专家(头)组成的团队。
它是这样运作的:
- 路由(The Router): 一个聪明的经理观察当前的情况,并决定哪些专家可能处于活跃状态。至关重要的是,这个经理只能看到当前的上下文;它无法窥探未来究竟发生了什么。
- 专家(The Experts): 每个专家都经过训练,能够非常擅长预测一种特定的未来类型。
- 候选集(The Candidate Set): 当一个新的情况发生时,系统不会将专家的意见融合为一个答案。相反,它会输出一个来自活跃专家的列表,包含若干个截然不同的可能性。
这创造了一个由截然不同的、有效的可能性组成的列表(一个“候选集”),而不是一个模糊、虚假的平均值。这就像是向旅行社询问一个可能的目的地列表,而不是一张通往巴黎和东京之间某个位置的地图。
证据:它真的有效吗?
该团队在一些棘手的迷宫(来自数据集 OGBench)上测试了它,在这些迷宫中,机器人可能会传送或被缝合到不同的路径中。
- 旧方法: 当标准机器人尝试利用其“平均”预测进行路径规划时,它仅在 0.02 到 0.09(2% 到 9%)的查询中成功。它大多是在错误地猜测。
- 新方法: 使用其由不同可能性组成的列表的 MoP-JEPA 机器人在 0.85(85%)的查询中成功。
但作者非常谨慎。他们知道,仅仅拥有一个很长的猜测列表是不够的;你可能会通过胡乱猜测所有可能来碰运气。因此,他们增加了一个严格的测试,称为 “realroute”。这会检查机器人的猜测列表是否真的包含了一条由可以实际行走的真实转换所构成的路径。
- 结果: MoP-JEPA 在所有三个迷宫上都通过了这个严格的测试。
- 对比: 另一种被称为“混合密度网络”(MDN)的方法虽然可以猜测很多东西(高覆盖率),但其中的许多猜测都是现实迷宫中并不存在的虚假边缘。MoP-JEPA 的猜测是有用的且真实的。
这意味着什么(以及不意味着什么)
论文证明,对于在不确定世界中导航的机器人来说,你需要一个能够说“可能是 A,也可能是 B”的系统,而不是“会在 A 和 B 之间”的系统。
- 它排除了什么: 论文明确反对使用“门控”混合(如 M3-JEPA)这类将专家融合为单一输出的做法。即使内部有很多专家,如果它们将答案压合成一个向量,你仍然会陷入“平均值陷阱”。
- 它建议了什么: 作者认为,这种“硬分配”的方法是处理现实世界中多路径性质的更好方式。
- 信心来源: 结果是在特定的、留出的数据集(OGBench)上测量的。论文显示,在这些模拟中,新方法远优于旧有的“平均值”预测器。它并不声称已经解决了所有机器人规划问题,但它展示了在这些特定迷宫场景中的一次清晰且有据可查的胜利。
简而言之,如果你想让机器人为一个具有多种可能性的未来进行规划,请停止要求它给出平均值。给它一个专家团队,让他们生成一份真实的选项列表,然后让机器人从这份列表中选择最佳路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。