← 最新论文
🤖 AI

verdi: retrieval is not transfer for continual world model optimization

该论文介绍了 VERDI,这是一个将检索视为假设生成步骤而非直接转移的持续性框架,它要求通过目标侧验证来构建基于证据授权的优化策略,从而在显著降低搜索和 GPU 成本的同时,最大限度地减少世界模型优化中的负迁移。

原作者: Junyu Wu, Shiqin Nie, Youyi Kou, Baohua Yin, Guocai Yao, Qingyu Chen, Jingheng Ma, Shiji Zhou, Hongyong Song, Mingchen Zhuge, Sen Cui, Changshui Zhang

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Junyu Wu, Shiqin Nie, Youyi Kou, Baohua Yin, Guocai Yao, Qingyu Chen, Jingheng Ma, Shiji Zhou, Hongyong Song, Mingchen Zhuge, Sen Cui, Changshui Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何理解世界。你给了它一个“世界模型”——一个超级聪明的脑子,它可以预测如果移动手臂、掉落杯子或走过房间,接下来会发生什么。这些模型就像水晶球一样:它们可以模拟未来,这样机器人就不必通过撞到东西来学习。但棘手的部分在于:有时这些水晶球会变得有些模糊。也许它预测杯子会漂浮而不是落下,或者它忘记了门把手是坚固的。

为了修复模糊的水晶球,科学家通常必须从头开始。他们猜测哪里出了问题,尝试各种不同的“修复方法”(比如修改代码或训练数据),然后寄希望于其中一个奏效。问题在于,如果他们修复了一个机器人的大脑,他们往往必须为下一个机器人重复整个猜测游戏,即使这两个机器人的构造几乎完全一样。这就像是一个修理工修好了红车的轮胎,但接着却得在没看前一次维修笔记的情况下,去猜怎么修蓝车的轮胎。这篇论文认为,我们不应该一直重复造轮子。相反,我们需要一种方法,在尝试修复之前,就能证明一个针对某个机器人的修复方案对另一个机器人确实有效,而不是仅仅寄希望于它能迁移。

开发这个系统的研究人员提出了一个名为 VERDI 的系统,他们通过引入一条严格的规则来解决这个头痛问题:检索并不等于迁移(Retrieval is not Transfer)。用通俗的话说,仅仅因为一个修复方案在机器人 A 上奏效,并不意味着它对机器人 B 自动就是一个好主意。这更像是找到了一个制作巧克力蛋糕成功的食谱;你不能直接假设它也会适用于草莓蛋糕,除非你先尝一小口样本。

VERDI 扮演着一个超级组织化、对证据有着执念的研究助手。它是如何工作的呢?分为简单的三个步骤:

  1. 指纹(The Fingerprint): 首先,VERDI 不仅仅看机器人的名字或它是如何建造的。相反,它给机器人一系列微小的、无害的“测试”(称为探测器/probes),以观察它的反应。如果你戳一下机器人的大脑,它会感到困惑吗?它会变得兴奋吗?VERDI 会记录下这些反应,从而创建一个独特的“优化指纹”。你可以把它想象成一份医疗记录,记录了患者对特定药物的反应,而不是仅仅记录他们的名字。
  2. 假设(The Hypothesis): 当一个新的机器人需要修理时,VERDI 会查看它的指纹,并将其与过去机器人的指纹进行对比。它会找到一份在看起来相似的指纹上奏效的“可能的修复方案”列表。但神奇之处在于:VERDI 并不会直接应用这些修复方案。它将这些方案视为纯粹的猜测,即“假设”。
  3. 证明(The Proof): 在 VERDI 被允许实际改变新机器人之前,它会运行一个严格的、冻结的测试。它会在一个小型、安全的机器人版本上尝试该修复方案,以观察它是否真的有效。只有当测试证明该修复方案既安全又有效时,VERDI 才会说:“好吧,这现在是一个真正的修复方案了,我们可以把它保存下来供下次使用。”

论文表明,这种基于证据的谨慎方法改变了游戏规则。通过拒绝盲目复制粘贴修复方案,VERDI 节省了大量的计算资源——将寻找解决方案的成本降低了 69%,并将搜索时间缩短了 68%。更重要的是,它阻止了系统意外损坏东西。在过去,盲目复制修复方案会导致大约 34% 的“负迁移”(即修复方案反而让情况变得更糟)。有了 VERDI 严格的测试,这个数字降至仅为 6%

作者还发现,有时两个机器人在纸面上看起来非常相似,但对同一个修复方案的反应却完全不同。当这种情况发生时,VERDI 并不会放弃;它会利用这次失败来更新自己的“探测”测试,学习新的方法来区分这些机器人。这就像一名侦探,在发现嫌疑人看起来很像罪犯但实际上是清白的时候,学会了下次要寻找什么样的线索。

简而言之,VERDI 证明了在 AI 世界中,你不能仅仅假设知识可以从一个模型迁移到另一个模型。你必须验证它。通过将优化过程转变为“测试、证明和学习”的循环,研究人员展示了我们可以建立一个可靠的修复库,这些修复方案在不同类型的世界模型中都能真正奏效,从而在不浪费大量时间和金钱进行失败实验的情况下,让机器人变得更聪明、更安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →