← 最新论文
🤖 machine learning

QQWorld: Quantile-Quantile Matching for World Model Regularization

本文介绍了 QQWorld,一种新颖的世界模型正则化方法,该方法通过使用分位数-分位数匹配方法(包括一种跨批次变体)来取代 Epps-Pulley 目标函数,从而在分布尾部保持有效的修正梯度,进而实现比 LeWorldModel 基线更好的高斯对齐效果和提升的规划性能。

原作者: Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhoushun Yu, Xiaoyu Hu, Xiangyu Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩国际象棋,但你并没有向它展示棋盘,而是只让它窥视游戏状态的一个微小的、压缩后的摘要。这个摘要是它的“潜空间”——一种机器人用来理解世界的秘密内部语言。为了让这种语言变得有用,科学家们发现,机器人的内部摘要应该看起来像一个完美的钟形曲线(高斯分布)。你可以把它想象成一个组织有序的图书馆,书本按高度整齐地堆叠;如果书本散乱无章,或者堆成混乱的高耸土堆,机器人就会感到困惑并做出错误的移动。

有一段时间,保持这个图书馆整洁的最佳方法叫做“Epps–Pulley”测试。它就像一位严格的图书管理员,检查书籍是否大致摆放正确。然而,这位管理员有一个盲点:他们擅长整理书堆中间的书籍,却完全忽略了那些被扔到房间极端角落里的少数书籍。这些“离群值”书籍造成了数据中沉重且混乱的尾部,导致机器人产生不可能发生的场景幻觉,并导致任务失败。科学家们提出的问题是:我们如何强迫机器人清理掉这些混乱的角落,而不破坏图书馆的其他部分?

这篇论文介绍了一种名为 QQWorld 的新解决方案。研究人员发现,旧的管理员方法之所以失效,是因为它对那些混乱角落书籍施加的“修正力”会随着书籍远离中心而消失。这就像试图用一根橡皮筋将失控的火车拉回车站,而一旦火车跑得太远,橡皮筋就会断裂。为了解决这个问题,他们用 分位数-分位数 (QQ) 匹配策略取代了旧的测试。这种新方法不再仅仅是检查整体形状,而是像一场精确的匹配游戏:它将机器人内部摘要从小到大排列,并强迫它们与一组预先确定的理想“高斯”位置完美匹配。

结果是惊人的。通过使用这种新的匹配游戏,研究人员展示了 QQWorld 如何有效地将那些失控的“尾部”样本拉回正轨,创造出一个更加整洁的内部世界模型。在四个不同控制环境的测试中,这种更整洁的模型不仅看起来更好,而且实际上帮助机器人更成功地规划动作,将其平均成功率从约 79.75% 提升到了 85.08%。该论文还提出了一种巧妙的技巧,称为“跨批次 QQ (Cross-Batch QQ)”,它让机器人能够利用更大规模的样本来确定排名,而无需消耗更多计算机内存,使整个过程更快、更高效。最终,这项研究证明了,对于一个机器人要进行良好的规划,其内部世界模型不仅需要大致正确,而且必须精确到边缘处的完美对齐。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →