← 最新论文
💻 computer science

HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy

该论文提出了 HaWMPO,一种幻觉感知型世界模型策略优化框架,通过在想象的展开过程中估计并抑制预测幻觉,增强了通用机器人策略,从而显著提高了在基准测试和真实世界机器人上执行复杂长程操控任务的成功率。

原作者: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

发布于 2026-09-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Zengjue Chen, Peidong Liu, Jiawei Li, Qi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

能够学习执行各种任务(从堆叠积木到折叠衣物)的机器人一直是人工智能领域长久以来的目标。为了实现这一目标,研究人员开发了“通用型”策略,这些策略本质上是类似于大脑的系统,通过接受语言和视觉训练,来理解机器人应该如何移动。然而,在现实世界中教授这些系统既缓慢、昂贵又具有风险。机器人每尝试一个新动作,都可能损坏物品或自身,使得这种试错过程变得危险。为了解决这个问题,科学家们转向了“世界模型”(world models),即数字模拟器,允许机器人在计算机内部进行练习。这些模型可以根据当前动作预测下一步会发生什么,从而创造出一个安全的学习空间。然而,这些数字模拟器并不完美;随着对未来的进一步预测,它们往往会开始编造从未发生过的细节,这种现象被称为“幻觉”(hallucination)。如果机器人从这些虚假场景中学习,它可能会学会一些在计算机中有效但在现实世界中完全失败的动作。

一个研究小组开发了一种新方法,旨在帮助机器人有效地从这些不完美的数字模拟中学习,而不被其错误所误导。他们将这种方法称为 HaWMPO,这是一个旨在让机器人意识到其数字训练场正在对其撒谎的系统。该系统并没有将每一个想象出的场景都视为同等重要,而是包含了一个特殊的组件,其作用类似于质量控制检查员。这个检查员会观察模拟器生成的图像序列,并分配一个分数,用以指示该序列的可靠程度。如果模拟器开始陷入幻想,创造出不符合物理定律或预期结果的图像,检查员就会将其标记出来。随后,系统利用这一信息来调整学习过程,有效地告诉机器人忽略那些看起来过于不可靠的部分,并专注于看起来真实的部分。

研究人员在名为 LIBERO 的计算机环境中使用一套标准的机器人任务对该方法进行了测试,该环境涉及将物体移动到特定位置。他们将这种新系统与使用世界模型但缺乏此类质量控制功能的其他方法进行了对比。结果显示,这种新方法具有明显的优势。在模拟中,使用幻觉感知系统的机器人达到了 63.7% 的成功率,显著高于次优的方法。这种改进在需要空间推理和物体操控的任务中尤为明显,在这些任务中,机器人区分真实与虚假场景的能力帮助它学习到了更稳健的策略。研究人员发现,通过在机器人依赖高度幻觉场景时对其进行惩罚,该系统防止了机器人养成那些仅在损坏的模拟中才有效的坏习惯。

为了确保这种方法在计算机之外也能奏效,团队还在现实世界的物理机器人上测试了它。他们给机器人布置了两个具体的挑战:将纸巾放入盒中以及将耳机放在支架上。在没有新系统的情况下,机器人在耳机任务中的成功率约为 60%。应用了幻觉感知训练后,成功率平均上升至 AUC 0.8,其中机器人在纸巾任务上的成功率为 85%,在耳机任务上的成功率为 75%。这一性能的飞跃证明了在数字世界中学到的教训实际上是可以迁移到物理世界的,因为机器人已经学会了忽略通常会干扰这些系统的数字噪声。研究人员指出,该系统通过不断检查模拟未来的连贯性来工作,确保机器人只从看起来符合物理常理的轨迹中学习。

这项研究强调,更好的机器人学习关键不仅在于拥有一个模拟器,还在于有一种信任它的方法。通过构建一个能够检测模拟何时脱离现实的系统,研究人员为机器人的进步创造了一条更稳定的路径。虽然目前的测试是在相对较短的任务中进行的,但其成功表明,这种方法对于机器人必须提前规划许多步骤的更复杂、更长期的任务至关重要。这项工作证实,对于机器人要成为真正的通用型助手,它们必须学会区分有用的预测与具有说服力的谎言,而这种新方法通过让学习过程本身意识到自身的局限性,提供了这种技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →