← 最新论文
🤖 machine learning

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

本文介绍了 MaskLAM,这是一种通过零样本分割将预训练重建目标限制在智能体像素上,从而在存在视觉干扰的情况下提升潜在动作模型性能的方法,该方法迫使模型仅学习智能体控制的动态,而无需额外的架构更改或动作标签。

原作者: Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向机器人展示数千小时的居家视频来教它如何行走。目标是让机器人弄清楚,视频中哪些部分是由行走者的腿部运动引起的(即“动作”),而哪些部分仅仅是背景场景的变换、摄像机的晃动或风吹树叶(即“干扰项”)。

这正是论文MaskLAM试图解决的问题。

问题:机器人容易分心

先前的方法(例如一种名为 LAPO 的系统)试图通过观察整个视频帧来进行学习。它们会问:“这一帧与下一帧之间发生了什么变化?”

在一个拥有纯白背景的完美世界里,唯一发生变化的就是机器人的移动。但在现实世界中,背景是杂乱无章的。

  • 类比:想象一下,你试图通过观看一段视频来学习如何开车,视频中司机正在转动方向盘,但窗外的景色也在剧烈地飞速掠过。如果你试图通过观察整个画面来学习,你的大脑可能会感到困惑,并认为:“哦,汽车在移动是因为树木在飞速掠过!”你可能会学会去控制树木,而不是控制方向盘。

从技术术语来说,机器人的“潜在动作”(即其对“该做什么”的内部理解)会被背景噪声所污染。它学会了预测背景的运动,而不是智能体(agent)的实际控制,从而导致其在尝试行动时失败。

解决方案:戴上“眼罩”(掩膜)

作者们意识到,虽然“智能体”和“干扰项”的概念是抽象的,但在实际的视频像素中,它们通常位于不同的位置。机器人在这边;移动的背景在那边。

他们创建了MaskLAM,其工作原理如下:

  1. 定位智能体:在训练开始之前,他们使用一个智能的预训练 AI(称为 SAM 2.1)来在视频中仅围绕机器人或智能体绘制数字轮廓(掩膜)。这是自动完成的,无需人工标注每一帧。
  2. 忽略其余部分:当机器人试图从视频中学习时,系统会告诉它:“只看轮廓内部的像素。忽略轮廓之外的所有内容。”
  3. 结果:如果背景中的树木移动了,机器人并不在意,因为那些像素在掩膜之外。如果机器人的腿移动了,机器人能清晰地看到它,因为它在掩膜之内。

为什么这很重要

该论文声称,这个简单的技巧解决了一个巨大的问题,而无需复杂的新型架构或昂贵的人工标注。

  • 无需额外作业:与其他需要机器人通过人工编写的指令(动作标签)来学习忽略背景的方法不同,MaskLAM 仅通过观察掩膜内的像素就能学会忽略背景。
  • 性能更优:在他们的测试中(使用模拟环境,如奔跑的猎豹或机械臂),MaskLAM 的学习速度和准确性都远超先前的方法。
    • 类比:如果先前的方法像是在嘈杂的自助餐厅里学习的学生,那么 MaskLAM 就像是戴上了降噪耳机,只让老师的声音通过。
  • 鲁棒性:即使“轮廓”并不完美(例如,它漏掉了机器人脚的一小部分,或者包含了一小部分背景),该系统仍然运作良好。它对错误具有包容性。

核心结论

该论文证明,你不需要构建一个超级复杂的大脑,就能通过杂乱的视频来教机器人。你只需要教它们看向哪里。通过将学习过程限制在仅属于智能体的像素上,机器人不再试图控制背景,而是开始学习如何真正移动自身。

这使得机器人能够从互联网上海量的“无动作”视频中学习,而无需昂贵的人工标签来告诉它们该忽略什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →