Optimization of sim-to-real transfer in the humanoid robot NICO
本文提出了一种针对类人机器人NICO的新颖、低成本的从仿真到现实(sim-to-real)抓取流水线,该流水线结合了基于YOLO的检测、立体视觉定位和视觉反馈,在不依赖昂贵的外部追踪系统的情况下,实现了桌面物体抓取的高成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人就像是试图学习一项新运动的热情学生的世界。它们在电子游戏中练习得非常出色,那里的物理法则完美无缺,光照理想,且永远不会有任何东西损坏。但当你要求那个同样的机器人走出游戏,进入现实世界时,情况就会变得混乱。现实世界有摇晃的关节、略显模糊的摄像头,以及并不总是表现得像代码中的数学公式那样精准的重力。这种完美的数字练习与混乱的现实生活游戏之间的差距被称为“模拟到现实”(sim-to-real)差距。这就是为什么机器人可能在模拟器中看起来像个优雅的舞者,但在尝试拿起一杯咖啡时却会绊倒自己的原因。科学家们正痴迷于缩小这一差距,因为如果机器人不能可靠地抓取物体,它们就无法帮我们做家务、建造物品或与人安全互动。大问题在于:当世界与其训练手册不符时,我们该如何教机器人去信任它的眼睛和肌肉?
这篇论文讲述了一个名为 NICO(意为神经启发式伴侣,Neuro-Inspired COmpanion)的人形机器人的故事,以及它在掌握从桌上拿起一个毛绒番茄的艺术过程中的探索。研究人员 Juraj Gavura 和 Igor Farkaš 面临着一个棘手的问题:尽管他们已经教会了 NICO 高精度地触摸屏幕上的特定点,但拿起一个物体要难得多。这需要机器人看到物体,确定它在 3D 空间中的确切位置,然后移动它的手去抓取,而不至于将其撞倒。团队想要看看他们旧有的“触摸屏训练”方法是否能帮助 NICO 抓取物体,还是说他们需要一种新的技巧。
他们尝试了两种主要的策略。第一种是利用机器人从触摸屏训练中获得的“肌肉记忆”。他们使用一个计算机模型来预测究竟要如何微调机器人的手,以补偿其在现实世界中的笨拙。这就像教练告诉球员:“当你瞄准左角时,实际上要瞄准右边两英寸的地方,因为你的手臂会向那边偏。”他们测试了三种不同版本的这种“教练”,从简单的经验法则到复杂的神经网络(一种人工智能大脑)。结果是两个世界的寓言:在机器人练习过的特定区域内,复杂的 AI 教练表现得像个超级明星,帮助 NICO 成功抓取番茄的概率达到了 96.7%。然而,一旦机器人踏出那个熟悉的区域,AI 教练就开始胡乱猜测,成功率显著下降。事实证明,机器人的“肌肉记忆”并不能很好地泛化到桌子的其他部分。
第二种策略更像是利用机器人自身的眼睛玩一场“冷热游戏”。他们没有依赖预先计算好的地图,而是给了 NICO 一个视觉反馈环。机器人会将手移到番茄附近,观察自己的手实际所在的位置,然后在抓取之前进行微小的调整,以实现完美对齐。这就像是看着镜子穿针引线;你会不断移动线头,直到它与眼睛对齐。这种方法不需要预先训练的桌面地图。它在整个工作空间内表现得惊人地好,整体成功率达到了 72.7%。事实上,当机器人的眼睛工作完美且能清晰看到自己的手时,这种方法达到了 94.1% 的成功率。
论文指出,虽然“肌肉记忆”校准在它训练过的领域内极其精确,但“视觉反馈”方法对于整个桌面来说更具鲁棒性和适应性。研究人员发现,阻碍视觉反馈的主要因素不是机器人的大脑,而是它的眼睛:有时机器人的立体摄像头会被背景干扰,导致无法准确判断手的位置。但当眼睛正常工作时,机器人几乎每次都能抓到番茄。最终,这项研究表明,你不需要昂贵的高科技 3D 摄像头或动作捕捉服来教机器人抓取物体;通过低成本摄像头、一点校准和视觉反馈环的巧妙结合,就能完成任务。作者得出结论,虽然校准法是其“主场”的冠军,但视觉反馈法是应对混乱、不可预测的现实世界的更佳全能选手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。