CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning
本文介绍了 CLIFT,一种非侵入式的闭环迭代微调方法,该方法使使用闭权重基础模型(如 Gemini Robotics On-Device)的人形机器人能够通过将部署时的奖励反馈转化为用于基于 API 的策略改进的监督数据,从而实现近乎完美的任务掌握,进而克服了纯模仿学习的局限性,且无需访问模型的内部结构。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人跳一段复杂的舞蹈。在人工智能的世界里,有两种主要的方法可以做到这一点。第一种是“开源”,你可以获得机器人的整个大脑、它的代码以及它的内部线路,你可以亲手调整每一个螺丝。第二种是“闭源”,机器人就像一个黑匣子。你看不见内部,摸不到线路,也无法更改代码。你所能做的只是给机器人一份指令清单(比如“像这样跳舞”)并要求它学习。这正成为当今最强大的机器人大脑的标准形式:它们极其聪明,但都被锁在了一扇数字门后。
科学家们正在探讨的一个大问题是:如果你无法窥视机器人的大脑内部,你是否仍能教会它掌握困难的现实世界任务?通常情况下,当你看不见内部时,你只能局限于模仿你所看到的东西(即模仿学习)。但现实生活是混乱的。机器人可能会在视频中完美地模仿人类,但当它尝试在不平整的地板或面对一个光滑的杯子时,由于微小的延迟或它未曾考虑到的物理特性,它可能会失败。要变得真正优秀,机器人需要练习、失败、意识到哪里错了,然后再次尝试——这个过程被称为“闭环学习”。挑战在于:当你被禁止触碰其内部的学习机制时,你该如何教会一个机器人从自己的错误中学习?
这篇题为 CLIFT 的论文正是针对这一问题展开研究的。研究人员想要看看,他们能否在不打开“模型盒子”的情况下,将一个强大的、受限的机器人模型——“Gemini Robotics On-Device”——转化为处理复杂、高接触任务(如叠盘子或装箱)的高手。他们发现,仅仅通过复制人类视频(一种称为监督微调的方法)虽然让机器人比其他开源机器人表现得更好,但对于实现现实世界的灵活性来说仍然不够完美。机器人经常会掉落物品或在最后一步时手忙脚乱。
为了解决这个问题,团队发明了一个聪明的技巧,叫做 CLIFT(闭环迭代微调)。你可以把它想象成一个无法修改游戏代码但仍能教导玩家的电子游戏教练。它是这样运作的:
- 练习赛: 机器人在现实世界中尝试执行一项任务。它可能成功,也可能失败。
- 计分卡: 并不是简单地说“做得好”或“做得差”,而是一个特殊的 AI 评委(奖励模型)会观察视频,并为动作的每一个微小片段评分。它能识别出哪些部分是流畅且有帮助的,哪些部分是笨拙或危险的。
- 神奇标签: 团队将这些带有评分的视频转化为新的训练课程。他们在好的部分添加一个特殊的“徽章”(比如金星),并在坏的部分添加一个“警告”。
- 课程: 他们通过 API(一个数字菜单)将这个带有新标签的课程发送回机器人的锁定大脑。机器人利用这些新数据进行重新训练,学习去寻求“金星”并避开“警告”。
研究人员运行了这个循环两次,就像一个飞轮在不断加速旋转。结果令人印象深刻。到最后,机器人不再仅仅是模仿人类;它开始发明自己的巧妙动作。例如,在装箱时,机器人学会了用手指挤压并旋转箱子,以便在提起之前获得更好的抓握力——这是一个人类老师从未展示过的动作。当尝试把瓶子放入杯中时,如果第一次没成功,它学会了尝试重来,而不是放弃。
论文表明,这种“非侵入式”的方法效果显著。通过这种方法,机器人在处理叠盘子和插入瓶子等困难任务时的成功率从大约 50-70% 跃升至接近 100%。更令人惊讶的是,当他们对另一个开源机器人(一个他们本可以触碰代码的机器人)尝试同样的技巧时,那个受限的机器人表现得更好。这表明,拥有一个非常强大的、预训练好的“大脑”,比拥有对代码的完全访问权更为重要。
简而言之,这篇论文证明了你不需要拆解机器人的大脑也能教会它。通过将现实世界的练习环节转化为智能的、带标签的课程,你可以引导一个受限的机器人成为专家,通过“尝试、评分、再学习”这样一个简单的迭代闭环,掌握复杂的物理任务。作者发现,仅需两个周期,这种方法就能推动机器人达到近乎完美的精通水平,而这一切都无需“打开模型盒子”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。