HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface
HIL-UMI 引入了一种无需机器人的、人类在环的后训练视觉-语言-动作模型框架,该框架利用手持式通用操控接口和策略引导的能量评分来高效地收集目标数据并优化优势估计器,从而克服了静态监督微调的局限性,并实现了无需物理机器人部署的可扩展、迭代式改进。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人正变得越来越能够通过视觉和语言来理解世界,通过学习海量数据来执行复杂的任务。然而,这些人工智能系统在通用学习与在特定厨房、车间或工厂中的实际应用之间,仍然存在着显著的差距。当机器人被部署在真实环境中时,它经常会遇到从未见过的场景,从而导致错误不断累积,直至任务失败。为了解决这个问题,研究人员传统上依赖于“监督式微调”,这是一个人类在机器人身上演示正确动作并让机器模仿的过程。虽然这有所帮助,但过程缓慢且昂贵,并且往往会错过机器人最容易出错的关键时刻,因为机器人只从它被给予的示例中学习,而不是从它在尝试独立解决问题时犯下的错误中学习。
一个研究小组开发了一种名为 HIL-UMI 的新方法,改变了人类教导机器人的方式,消除了训练阶段对机器人的物理依赖。该方法不再是看着机器人挣扎然后进行纠正,而是使用一个看起来像机器人夹爪、由人类操作员持有的便携式手持设备。操作员使用该设备执行任务,同时运行机器人当前“大脑”的计算机程序会观察相同的视频流,并试图预测人类下一步会做什么。该系统并不移动机器人;它只是将人类的实际动作与其自身的预测进行比较。当人类做出计算机未预料到的动作时,系统会将该时刻标记为一个学习机会并将其记录下来。这使得机器人能够在从未实际尝试过该任务并承担失败风险的情况下,从自身的盲点中学习。
这种方法的核心是一个持续的观察与优化循环。当人类演示任务时,计算机不断检查其自身的预测是否与人类的动作相匹配。如果计算机的猜测与人类正在做的动作大相径庭,系统就知道它处于“盲点”——即机器人理解不佳的情况。此时,系统会提示人类继续演示,并将该特定片段的数据保存下来。研究人员还加入了第二层智能:一种判断任务进展情况的方法。如果系统认为任务进展不顺,即使人类的动作是正确的,它也会记录下那一刻,以帮助计算机学习如何更好地判断成功。通过结合这两类数据,机器人不仅学习如何做,还学习哪些动作对于完成工作最为有效。
为了测试这一想法,研究人员利用标准的机械臂将其应用于四个不同的现实世界任务。这些任务涵盖了折叠毛巾、清理桌面、堆叠方块以及高精度盖章纸张。在每种情况下,机器人都从一套基础指令开始,然后通过使用这种新型手持方法进行多轮训练。结果显示,与传统方法相比,该方法有明显的改进。传统的训练技术往往会遇到瓶颈,即增加更多数据也无法带来提升,而这种新方法则让机器人能够随着每一轮训练持续进步。机器人学会了比以前更有效地处理长且复杂的动作序列以及精细、精准的动作。
其中一个最引人注目的发现是这种新方法收集有用信息的效率。要求机器人物理移动并由人类进行纠正的传统方法既缓慢又难以规模化。相比之下,手持式方法在收集必要数据方面的速度快了五倍以上。这是因为人类操作员可以自由移动设备,无需等待机器人重置,也无需等待人类对沉重的机器进行物理干预。该系统成功识别了机器人需要帮助的确切时刻,将训练重点放在任务最困难的部分,而不是在机器人已经掌握的部分上浪费时间。
这项研究表明,这种方法为在不同地点、由不同人员教授机器人新技能提供了一条可扩展的路径。由于训练是在手持设备上进行的,多个操作员可以潜在地在不同地点同时收集数据,并全部汇入同一个机器人的学习过程中。研究人员发现,通过专注于机器人知识的具体空白并使用一个奖励进度的系统,他们可以创造出更加可靠且高效的机器人。这项工作指向了一个未来:机器人可以快速、安全地适应新环境,而无需进行重复、昂贵且耗时的物理试验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。