想象一下,你正在教一个机器人做家务,比如把香蕉从绿色盘子移到蓝色盘子里。
目前大多数机器人的“大脑”(称为VLA 模型)就像热情但略显笨拙的实习生。它们观察任务,猜测下一步该做什么,然后立即行动。如果它们把香蕉掉在地上,它们并不会意识到自己犯了错。它们只是继续尝试“倾倒”那根已经掉在地上的香蕉,或者在手里空无一物的情况下继续伸手去够蓝色盘子。它们缺乏自我意识。
Sentinel-VLA 是一种新型机器人“大脑”,它像一个聪明、警觉的监督员,内置了一个“哨兵”(守卫)。其工作原理可拆解为以下简单概念:
1. “哨兵”守卫(主动状态监控)
将机器人的正常运行想象成在一条笔直空旷的道路上开车。你无需费神思考,只需操控方向盘即可。
- 正常模式:90% 的时间里,Sentinel-VLA 处于“巡航控制”状态。它看到任务,知道该做什么,并在无需耗费精力深入思考的情况下直接行动。这使其既快速又高效。
- 哨兵:然而,该机器人配备了一名专职“守卫”在监控仪表盘。如果香蕉滑落,或者机器人意识到自己拿错了物体,哨兵就会发出警报。它会说:“等等!出问题了。我们需要停下来思考。”
2. 仅在需要时“深度思考”(动态推理)
旧款更智能的机器人模型试图在每一步都进行“思考”(规划与推理),就像一个人在迈出每一步之前都要停下来写一段哲学思考。这既缓慢又令人疲惫。
- 哨兵的方法:Sentinel-VLA 仅在哨兵守卫触发警报时才进行“深度思考”。
- 开始时:它规划整个路线。
- 当错误发生时:它暂停,分析出错原因(例如:“我掉了香蕉,是因为握得不够紧”),并制定恢复计划(例如:“把它捡起来,小心移动,然后轻轻放下”)。
- 修复后:它回到“巡航控制”状态,完成工作。
3. 从错误中学习而不遗忘(自我进化学习)
通常,当机器人学习一个新技巧来修复特定错误时,它可能会忘记如何完美地执行旧技巧。这被称为“灾难性遗忘”。
- 解决方案:该论文引入了一种名为SECL的特殊学习方法,并配有OC-Adapter(正交适配器)。
- 类比:想象一个图书馆。当你添加一本新书(新技能)时,你不会把它直接扔在旧书上面,把旧书压坏。相反,你会使用一种特殊的书架系统(正交适配器),确保新书被放置在一个不与旧书重叠的空间里。这样,机器人就能学会新的错误恢复方法,而不会丧失执行原始任务的能力。
4. 通过“模拟”错误进行训练(EC-Gen)
你无法在现实世界中通过 260 万次破坏性操作来轻松训练机器人。
- 流程:研究人员构建了一个名为 EC-Gen 的机器,它能将完美的机器人动作在模拟环境中自动“破坏”。它模拟掉落物体、抓取错误目标或偏离目标等场景。
- 结果:机器人在超过260 万个此类“模拟失败”场景中进行训练。它学会了识别何时出错以及如何修复,而无需人类手动记录每一次错误。
结果
在现实世界测试中(使用物理机械臂):
- 成功率:Sentinel-VLA 的任务成功率比此前最佳的机器人模型高出30%。
- 速度:由于它不会持续“思考”,其速度几乎与那些简单、不思考的机器人一样快,但更加智能。
- 韧性:当环境混乱或机器人发生碰撞时,Sentinel-VLA 能够恢复并继续前进,而其他模型则直接放弃或失败。
简而言之:Sentinel-VLA 是一个知道何时应自动执行、何时应停下来思考并自行修复错误的机器人,同时还能记住它曾经学会的所有其他技能。
技术摘要:Sentinel-VLA
问题陈述
视觉 - 语言 - 动作(VLA)模型通过利用广泛的世界知识和泛化能力,推动了具身操作的发展。然而,当前最先进的(SOTA)模型在现实世界部署中面临三个关键局限:
- 推理能力不足:大多数 VLA 充当直接的输入到动作映射,缺乏处理复杂、长视野任务所需的深度推理。
- 缺乏状态监控:现有模型往往无法感知运行时错误(例如抓取空物体),并在故障状态下继续执行。
- 无法自我修正:VLA 通常无法从自身错误中学习或恢复,损害了可靠性和安全性。
现有解决方案往往是零散的。像 ECoT 和 CoT-VLA 这样的方法采用僵化的“每一步都推理”策略,导致高延迟;而错误恢复方法通常依赖外部监控器,VLA 难以精确遵循。
方法论:Sentinel-VLA
作者引入了Sentinel-VLA,这是一种元认知 VLA 模型,设计有集成的认知架构,支持动态的、按需推理和错误恢复。
1. 主动状态监控与动态推理
核心创新是一个主动的“哨兵”模块(Esm),它严密跟踪任务的实时执行状态。
- 机制:在每个时间步,模型接收图像观测和任务指令。VLM 专家(Evlm)将这些投影到潜在空间。状态监控专家随后使用可学习的
[MONITOR] 查询探测此内部上下文,以确定当前状态。
- 触发状态:监控器将状态分类为四种:初始、正常、新子任务 和 错误。
- 按需推理:
- 正常状态:在绝大多数帧中,模型检测到“正常”状态,直接输出动作而不触发深度推理,从而最小化计算开销。
- 触发状态:当状态为 初始(规划)、新子任务(进展)或 错误(恢复)时,模型激活“深度思考”过程。它更新思维记忆(Mt)以生成任务计划、子任务更新或错误恢复策略。
- 动作生成:动作专家(Eact)整合当前上下文和更新后的思维记忆,生成最终动作。
2. EC-Gen:可扩展的数据生成管道
为了在不进行繁琐人工标注的情况下训练模型的状态感知行为,作者开发了EC-Gen。
- 流程:该管道通过随机扰动,将成功的专家轨迹转换为错误修正序列。
- 错误注入:它模拟了三种核心失败模式:
- 物体交互错误:抑制夹爪状态变化。
- 空间定位错误:为末端执行器姿态添加噪声。
- 语义理解错误:将目标偏移至错误的物体。
- 标注:该管道自动生成思维链(CoT)标签,包括任务计划、子任务定义和错误反思。关键在于,错误步骤的动作损失被屏蔽,以防止模型学习错误的行为。该过程在 44 个任务中生成了超过 260 万次转换。
3. 带有 OC-Adapter 的自我进化持续学习(SECL)
为了使模型能够在不遗忘先前技能的情况下随时间扩展其能力,作者提出了SECL算法。
- 边界识别:模型识别其成功率在稳定性和失败之间波动(例如 20%–80%)的“边界设置”。
- 从成功中学习:它收集来自这些边界设置的成功轨迹,以训练一个新的在线适配器。
- 正交持续适配器(OC-Adapter):为了防止灾难性遗忘,新适配器的训练受到正交性惩罚的约束。这确保了新知识是在与先前学习技能在数学上去相关的参数空间中学习的,从而实现模型知识边界的稳健、持续扩展。
主要贡献
- Sentinel-VLA 架构:一个统一的 VLA 模型,集成了主动状态监控器以实现动态、按需推理。这种元认知方法实现了稳健的自我修正,同时避免了静态、逐步推理的高延迟。
- EC-Gen 管道:一个可扩展的自动化数据生成系统,合成了 260 万 + 个带标注的错误恢复轨迹,消除了对人工数据收集的需求。
- SECL 算法:一个包含 OC-Adapter 的持续学习框架,允许模型逐步扩展其能力并处理新的错误类型,同时减轻灾难性遗忘。
实验结果
在 RLBench(仿真)、LIBERO-LONG 和真实世界机械臂(Agilex Piper)上进行了广泛的实验。
- 性能提升:
- RLBench(未见任务):Sentinel-VLA 实现了 51.3% 的成功率,优于 SOTA 模型 PI0(42.0%)和 OpenVLA(30.7%)。
- 真实世界任务:该模型实现了 60.0% 的平均成功率,显著优于 PI0(46.0%)和 OpenVLA(30.7%)。
- LIBERO-LONG:实现了 90.7% 的成功率,展示了强大的长视野泛化能力。
- 鲁棒性:在高干扰设置下,Sentinel-VLA 保持了 54.7% 的成功率,而 OpenVLA 的性能崩溃至 25.6%。
- 效率:由于其按需推理机制,Sentinel-VLA 在 RTX 4090 上的运行速度为 每动作 13 毫秒。这与非推理基础模型相当,并显著快于基于 CoT 的方法(如 ECoT,1528 毫秒)。
- 消融研究:
- 移除状态监控器使已见任务的性能下降了约 2-3%,证实了将状态分类与动作生成分离的架构价值。
- 移除 SECL/OC-Adapter 组件导致灾难性遗忘,使真实世界性能下降了 9.3%。
意义与主张
论文声称,Sentinel-VLA 代表了迈向构建稳健且自适应的具身智能体的重要一步。通过将元认知状态监控与动态推理相结合,该模型弥合了大型语言模型(LLMs)的推理能力与机器人实时执行需求之间的差距。作者强调,他们的方法使智能体能够识别自身的能力边界、自我修正错误,并从经验中持续学习,同时不牺牲计算效率或安全性。这项工作表明,与持续推理或纯粹的反应式控制相比,“仅在必要时思考”是具身人工智能的一种可行且更优越的范式。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。