KAN We Flow? Advancing Robotic Manipulation with 3D Flow Matching via KAN & RWKV
本文介绍了 KAN-We-Flow,这是一种轻量级且高效的用于机器人操控的 3D 流匹配策略,它通过使用一种新颖的 RWKV-KAN 架构和动作一致性正则化来取代沉重的 UNet 主干网络,从而以显著更少的参数量实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直难以掌握精细操作的艺术。虽然它们擅长沿直线移动重物,但那些需要类人触感的任务——例如穿针引线、转动门把手或组装笔记本电脑——却一直难以实现。多年来,研究人员一直试图通过向机器人展示专家执行动作的视频来教它们这些技能,这一过程被称为模仿学习。最近最成功的尝试依赖于复杂的数学模型,这些模型就像是在玩一场猜谜游戏。这些模型从一个随机且带有噪声的猜测开始,然后逐步进行细化,直到这个猜测变成一个清晰的运动计划。虽然这种方法能产生高质量的动作,但它的速度极其缓慢。机器人必须为它采取的每一个动作进行数十次细化步骤,从而产生了无法进行实时控制的延迟。这就像是通过不断猜测下一步转向、修正猜测、再次猜测、再次修正,才试图去驾驶一辆汽车,而在此之前汽车甚至还没移动哪怕一英寸。
为了解决这个速度问题,科学家们转向了一种称为“流匹配”(flow matching)的新方法。这种方法不再通过许多小步骤来细化猜测,而是学习从一个随机起点到正确动作的直接路径,理论上允许机器人在单步之内决定其下一步行动。然而,一个主要的障碍仍然存在:驱动这些模型的计算机大脑仍然过于沉重和臃ser(笨重)。它们依赖于庞大且耗能的架构,需要强大的服务器,这使得它们无法在实际机器人所携带的小型电池供电计算机上运行。该领域需要一种方法,既能保持新方法的速度,又不必背负旧硬件的重量。
在一项新的研究中,一个研究小组构建了一个机器人策略,恰好实现了这种平衡。他们引入了一个名为 KAN-We-Flow 的系统,该系统用一种更轻量、更高效的设计取代了沉重的传统计算机架构。研究人员结合了人工智能领域的两项最新进展,创造出一种新型的处理模块。第一部分处理时间的流动,使机器人能够理解其动作如何在序列中相互连接,就像是跟随一个故事,而不仅仅是看一个静态快照。第二部分充当微调器,利用一种学习灵活曲线模式而非僵硬直线的方法,以极高的精度调整机器人的动作。通过将这两项能力交织在一起,团队创建了一个比之前最优方法小 86.8% 的模型,但运行速度更快,且错误更少。
这项工作的成果在标准基准测试中表现惊人。在涉及开门、转动笔和组装家具等任务的一系列模拟环境中,新系统始终优于其前身。在一项涉及机器人手部操纵笔的困难任务中,新模型达到了 68% 的成功率,而之前的领先方法仅为 55%。在另一个涉及门的测试中,它达到了 83% 的成功率,大幅超越了次优系统。或许对实际应用而言最重要的一点是,该系统速度极快。它可以在大约 8 到 11 毫秒内决定一个新的动作,这足以让机器人以每秒 100 次的速度控制其运动。这种速度可以与人类的反射神经相媲美,而旧方法每一步需要超过 100 毫秒,经常导致机器人踉跄或错过目标。
为了确保机器人不偏离轨道,研究人员添加了一个特定的训练规则,充当安全网。在学习阶段,系统不仅被教导预测下一步动作,还被要求确保如果它将当前的路径向前投影,它会恰好落在专家人类最终停留的位置。这条规则防止了机器人在执行长期复杂任务时偏离航线。团队发现,这个简单的补充稳定了训练过程,并在不需要额外决策时间的情况下提高了最终的准确性。整个系统在三个不同的任务集上进行了测试,涵盖从简单的物体处理到复杂的组装,它始终能以旧模型所需计算内存的一小部分,交付最高的成功率。
这项工作的意义在于它将机器人学习从实验室推向工厂车间或家庭的潜力。通过证明一个轻量、高效的模型可以超越庞大、缓慢的模型,研究人员消除了一个部署障碍。新系统不需要超级计算机来运行;它足够小,可以直接安装在机器人本身。这意味着机器人最终可以即时学习新技能,适应新的物体和环境,而无需与强大的云端服务器保持持续连接。这项研究表明,机器人操控的未来并不在于构建更大、更重的“大脑”,而在于构建更聪明、更高效的大脑,使其能够像人类的手一样快速思考并精准行动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。