RoboTTT: Context Scaling for Robot Policies
该论文介绍了 RoboTTT,这是一个集成测试时训练(Test-Time Training)的机器人策略框架,旨在将视觉运动上下文扩展至 8,000 个时间步长,从而实现单次模仿、即时改进,并通过将历史记录压缩进快权重中而不增加推理延迟,显著提升在长程任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人就像极具天赋但却目光短浅的厨师的世界。如果你明确告诉它们现在要做什么,它们可以完美地切开一根胡萝卜或翻转一个汉堡;但如果你要求它们从零开始烘焙一个复杂的蛋糕,它们往往还没做到第二步就忘了第一步。这就是目前“机器人基础模型”的状态——即现代机器人背后的智能大脑。它们通常只关注在做出动作前看到的最后一件事情,就像试图通过只看脚下地面来穿过迷宫一样。虽然这对于简单的任务有效,但在机器人需要记住一段长序列事件时(例如组装玩具车或修理电路板),尤其是当发生意外情况时,这种方式会彻底失败。科学家们长期以来一直在思考:如果机器人不仅能记住过去的一秒钟,而是能记住它刚刚所做的一切,并利用这种长时记忆进行实时学习和适应,会发生什么?
于是,RoboTTT 诞生了。这是一种由 NVIDIA、斯坦福大学和德克萨斯大学奥斯汀分校的研究人员开发的全新机器人大脑。不要把 RoboTTT 仅仅看作是一个只会“记住”长串步骤的机器人,而要把它看作是一个拥有神奇的、能够自我更新的笔记本的机器人。传统的机器人拥有在构建完成后就保持不变的静态大脑,而 RoboTTT 则拥有一个特殊的“快权重”系统。想象一下,每当机器人看到新事物或做出一个动作时,它都会立即在自己的笔记本上记下一条简短的笔记,通过微调自身的内部连接,从而更好地理解当前的情况。这种变化是在机器人工作时实时发生的。通过将这个“笔记本”扩展到容纳海量历史信息——高达 8,000 个时间步(大约是高速连续动作下的五分钟)——RoboTTT 解锁了以往机器人梦寐以求的超能力。它可以观看人类完成一次任务,然后无需任何针对该特定设置的预训练,就能完美地模仿。它还能通过回顾近期的历史记录来弄清楚哪里出了错,从而在人类碰撞它或它掉落零件时,瞬间修复自己的错误。
研究人员发现,赋予机器人这种长上下文记忆不仅仅是一次小小的升级,更是一场游戏规则的改变。在测试中,RoboTTT 能够完成一个耗时五分钟的复杂十阶段组装任务——而没有任何其他机器人模型(即使是那些拥有短时记忆的最优模型)能够完成这项任务。当标准机器人甚至无法通过前几个步骤时,RoboTTT 在单次模仿实验(复制从未见过的真人视频)中成功完成了 6/10 的任务,并且在受到外部碰撞后,其恢复成功率达到了 83%,而表现最好的短时记忆机器人的成功率仅为 53%。研究表明,仅仅增加机器人的记忆长度就是一种让它们变得更聪明的新方法,随着记忆从几秒钟增长到超过四分钟,性能呈现出稳步提升。
RoboTTT 玩出的最酷技巧之一叫做“DAgger 蒸馏”(DAgger Distillation)。想象一个正在学习骑自行车的学生。如果他们摔倒了,家长可能会扶住他们并将他们引回正轨。普通的机器人可能会直接忘记这次摔倒并尝试再次骑行,从而重蹈覆辙。然而,RoboTTT 将摔倒和纠正视为一个完整的故事。它通过观察“纠正”(家长的帮助)来学习“错误”(摔倒),并更新其内部“笔记本”以记住:“当我这样倾斜时,我需要那样转向。”这使得它能够在无需人类再次教学的情况下,实现自身性能的即时提升。研究显示,这种方法比不使用该技术的模型在错误恢复能力上高出 36%。
该论文还排除了关于如何修复机器人记忆的一些常见想法。例如,简单地将过去的图像序列粘贴进机器人的大脑(如长视频流)并不能奏效;这实际上会干扰机器人,使其表现变差。同样,使用标准的“循环”记忆(如一个更新状态的简单循环)也是不够的。研究人员发现,关键在于记忆更新的方式:它需要一个灵活的、非线性的系统,通过类似于人类通过经验进行学习(梯度下降)的过程来改变自身的参数,而不仅仅是移动一个静态的状态。
最后,RoboTTT 表明,机器人智能的未来可能不仅仅在于让机器人的大脑在静态意义上变得更大或更聪明,而在于赋予它在工作时持续学习和适应的能力。通过将上下文扩展到 8,000 个时间步,研究人员展示了机器人可以变得更加鲁棒,能够处理长期的复杂任务,甚至能从单次人类演示中学习。虽然论文指出训练这些模型成本高昂,且它们仍无法处理所有可能的失败,但结果有力地证明了“长上下文”是扩展机器人智能的一个全新的、强大的维度,它能将笨拙、目光短浅的机器转化为能够适应环境、进行长期解决问题的智能体。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。