TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces
TraceFlow 引入了一种测试时引导方法,通过利用从存储在 TraceBank 中的成功与失败展开轨迹中提取的进度对齐修正场,增强了冻结的流匹配机器人策略,在无需更新模型权重的情况下,显著提高了在现实世界装箱任务和特定模拟基准测试中的任务成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够看见、理解语言并能移动手臂完成复杂任务的机器人不再是科幻小说中的情节,而是当今实验室里正在实现的现实。这些机器依赖于一种被称为“视觉-语言-动作策略”(vision-language-action policy)的软件。可以将这种策略想象成一个大脑,它观察摄像头的画面,阅读人类的指令,然后决定下一步进行什么样的物理动作。为了确保安全和可靠,工程师通常会在训练完成后“冻结”这些大脑,这意味着内部设置会被锁定,以防止机器人在工作时意外地遗忘已掌握的知识。然而,一个被冻结的大脑存在一个盲点:如果机器人在执行任务过程中犯了错,它无法利用这次失败来改变紧接着的下一个动作,因为它的指令是固定的。这就像一位完美背诵了路线的司机,但当他突然看到路面上的坑洼时,却无法调整方向盘,因为他的双手被束缚在预先写好的剧本之中。研究人员面临的问题是,如何在不重新训练整个大脑或添加复杂新传感器的情况下,让机器人能够实时从自身的错误中学习。
香港大学与南方科技大学的一个研究小组开发了一种名为 TraceFlow 的方法来解决这个问题。他们并没有尝试重新训练机器人的冻结大脑,而是构建了一个充当临时向导的系统,利用机器人过去尝试记录的简单信息来引导其当前的动作。该系统的工作原理是存储机器人每次尝试任务的过程,记录其成功或失败,并保留其运动过程中的详细日志。当机器人开始新的尝试时,TraceFlow 会观察其当前处境,并快速搜索日志中与之相似的历史时刻。如果它发现过去的某次尝试是成功的,它就会轻轻地将机器人当前的运动计划拉向曾经成功过的路径;如果它发现过去的某次尝试是失败的,它就会将机器人的计划推离那个特定的错误。至关重要的是,这种引导是受限的,这意味着它既有足够的强度来纠正航向,又足够温和,绝不会覆盖机器人的核心训练,从而确保机器人的安全与稳定。
研究人员在充满杂物的房间里,通过一个真实的机械臂对该方法进行了测试,要求它执行特定的任务序列,例如移动一段胶带,然后将一把锤子放在柜子上。在没有引导系统的情况下,机器人在 50 次尝试中仅完成了 21 次完整的序列任务,且经常出错乱步骤顺序。在启用 TraceFlow 后,机器人在 50 次尝试中成功了 39 次。在研究人员让机器人再运行一轮任务,并将新的成功与失败经验反馈回系统后,提升效果更加显著。在第二轮中,机器人正确完成了序列任务 47 次(总计 50 次),且在步骤顺序上实现了零错误。该系统仅通过为每次过去的尝试贴上一个简单的“是”或“否”标签(用以指示成功或失败)即可实现,无需对机器人究竟哪里出错进行复杂的分析。
在计算机模拟实验中,结果表现出更强的选择性,显示出该方法最适用于需要记住正确步骤顺序或将技能迁移到新物体的任务。例如,在涉及堆叠积木的模拟中,当系统被允许从自身的失败中学习时,成功率从约 54% 跳升至 62%。然而,研究人员发现这种引导并非对所有类型的任务都有效。当机器人需要计数物体或寻找隐藏在其他物体后面的物品时,该系统并未提高性能,有时甚至使其表现略微下降。这表明,该方法特别擅长修正动作序列方面的错误,但无法修复那些由于机器人本身缺乏感知或理解场景所需信息而导致的问题。
该研究还探讨了机器人可以从自身历史中学习多久。研究人员运行了十轮任务,并在每一轮结束后将新经验添加到系统中。他们发现,机器人的表现起初提升很快,随后趋于平缓,根据任务不同,在第二轮或第七轮左右达到顶峰。这表明,在不改变底层大脑的情况下,机器人能从近期历史中获益的程度是有限的。此外,团队发现,过去成功与失败尝试的比例并不能预测系统的表现如何;即使机器人在记忆中拥有比成功案例更多的失败案例,它依然可以取得进步。这一发现挑战了“机器人需要完美的过往记录才能进行学习”的观点。
最终,TraceFlow 为使冻结的机器人策略更具适应性提供了一种实用的方法。通过利用基于胜负历史的简单且受限的修正,机器人可以在无需从头开始重新训练的情况下,更可靠地处理复杂的有序任务。研究人员证明,这种方法在真实硬件上行之有效,能将一个在步骤顺序上挣扎的机器人转变为一个能够可靠完成一系列动作的机器人。虽然它并不是解决所有机器人挑战的万能钥匙——尤其是在涉及计数或隐藏物体时——但它为通过让机器人从当下的错误中学习,从而使其在现实世界中更加稳健地运行提供了一条清晰的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。