LM-X: Explainable Action Modeling with Progress, Event, and Uncertainty Prediction for Generalist Robot Manipulation
LM-X 是一个用于通用机器人操控的可解释动作建模框架,它通过显式预测任务进度、语义事件和局部可靠性来增强长程控制性能,在真实机器人基准测试中实现了优于现有最先进模型的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够通过观察人类来学习执行复杂任务的机器人不再是科幻小说;它们是人工智能领域中一个快速发展的现实。这些系统通常被称为通用机器人,它们结合了视觉和语言,以理解诸如“折叠衬衫”或“拿起杯子”之类的指令,并将这些词汇转化为物理动作。多年来,标准的方法一直是训练这些机器人去预测它们下一步应该进行的动作,即一步步地进行预测。虽然这种方法对于简单、短促的动作效果良好,但当任务变得漫长且复杂时,它就会遇到瓶颈。机器人看到了眼前的指令,却对其自身的进度视而不见,不确定自己是在向目标靠近还是在偏离目标。它无法判断一次犹豫是因为在进行仔细思考,还是因为产生了困惑,也无法解释为什么选择了特定的动作。这种内部意识的缺乏,使得在不可预测的环境中建立对机器人的信任或在出错时对其进行修复变得十分困难。
最近的一项研究详细介绍了一种寻求解决此问题的新方法,即通过在机器人的控制系统中赋予其一个“内在声音”。新模型名为 LM-X,它不仅仅是输出一个动作,而是被设计为不断回答三个特定的问题。首先,它会问:“我是否正在接近完成任务?”第二,它会问:“我正试图实现的下一个主要步骤是什么?”第三,它会问:“我对这个特定动作是否有效有多大的信心?”通过训练机器人同时预测这些答案及其物理动作,研究人员创建了一个不仅功能更强大,而且对其自身状态具有透明度的系统。机器人不再仅仅是行动,它还会实时监测自己的进度和不确定性,从而能够处理复杂的、多步骤的任务,并达到以往模型难以实现的可靠水平。
研究人员通过借鉴生物大脑组织运动的方式构建了这个系统。在自然界中,大脑并不仅仅是随机触发肌肉;它维持着一种预测的层级结构。它持有一个关于整体目标的慢速感知,一个关于即时子目标的快速感知,以及一个对正在发送的运动指令可靠性的持续检查。LM-X 模型将这一生物学原理转化为软件。它并不试图模仿大脑的解剖结构,而是采用了其利用不同时间尺度来引导行为的功能策略。该模型是在超过 20,000 小时的真实机器人运动大规模数据集上训练的,其中包括数千小时的失败尝试。包含这些失败对于系统至关重要。通过观察机器人的挣扎、抓取失败或陷入困境,系统学会了识别什么是“退步”,而不仅仅是记忆什么是“成功”。
该系统的核心由三个与机器人的运动并行运行的截然不同的信号组成。第一个信号,研究人员称之为“剩余量”(return-to-go),充当了一个进度条。它是一个估计任务还剩多少部分的单一数值。如果机器人平稳地向目标移动,这个数值就会上升。如果机器人犯了错误,例如掉落物体或向错误方向移动,该数值会立即下降。这使得系统能够在问题发生瞬间就检测到问题,而不是等到任务完全结束。第二个信号,“事件量”(event-to-go),识别任务中下一个有意义的转变。在像组装家具这样复杂的任务中,存在不同的阶段:拿起零件、插入零件和拧紧螺丝。这个信号告诉机器人它当前正在追求哪一个阶段,确保即使即时的动作看起来与过程的其他部分相似,它也能保持在正确的轨道上。第三个信号测量不确定性。它计算机器人的预测变化程度,本质上是在询问它对下一步动作有多大的把握。当机器人犹豫不决或在前后摆动时,这个不确定性信号就会激增,标记出机器人对其动作感到不确定。
为了测试这些额外的信号是否真的有所帮助,研究人员在投入大规模、高成本的训练之前,首先在一个包含五个困难任务的小型实验中进行了测试。他们将一个仅预测动作的标准机器人模型与包含一个或多个新信号的版本进行了对比。结果非常明确:包含所有三个信号的模型表现显著优于标准模型,也优于任何仅包含其中一个新特征的版本。这证明了这些信号协同工作,提供了一个完整的任务图景。随后,研究人员在大型真实机器人数据集上训练了完整的模型。在针对 50 个不同任务的基准测试中,新模型的成功率达到了 74.1%,相比之下,之前的最佳模型成功率仅为 55.4%,这是一个实质性的进步。
当模型在四种不同类型的机器人上进行的七个不同现实任务中接受测试时,这种提升更为显著。在这些物理测试中,新模型的成功率为 68.6%,而之前的标准模型为 50.7%。研究人员观察到,进度信号对机器人的实际表现反应非常灵敏。在一项涉及双臂任务(机器人必须用双手对物体进行分类)的实验中,随着机器人成功将物品移入到位,进度得分随之上升。然而,一旦机器人掉落物体或远离目标,得分便立即下降,准确地反映了挫折。同样,不确定性信号为机器人的犹豫提供了清晰的窗口。当机器人试图抓取物体并在没有做出最终决定前不断调整位置时,不确定性信号上升。一旦机器人做出了坚定的决定并闭合了抓取器,该信号就会下降,表明其产生了信心。
这项工作表明,要让机器人成为复杂环境中的真正可靠伙伴,它们需要的不仅仅是移动手臂的能力。它们需要理解自身的运行状态。通过明确地预测进度、意图和可靠性,LM-X 模型弥合了原始机械动作与智能决策之间的鸿沟。研究人员强调,这些信号不仅仅是供人类观察者阅读的,它们是机器人自身控制循环的一部分,有助于根据当前任务状态来塑造下一步的动作。虽然该系统并不完美,在某些特定任务中仍会遇到困难,但结果表明,增加这些自我意识层级使机器人变得更加鲁棒。该研究结论指出,这种多层级的方法为构建不仅能执行困难任务,还能解释自身行为并在出错时从错误中恢复的机器人提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。