← 最新论文
🤖 machine learning

Fourier Features Let Agents Learn High Precision Policies with Imitation Learning

本文提出将点云映射到高维傅里叶空间,以克服神经网络的谱偏差,证明了这种简单的方法能显著增强基于点云的模仿学习策略在不同基准测试和真实场景中进行高精度机器人操作的精度与鲁棒性。

原作者: Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling, Enrico Krohmer, Nicolas Schreiber, Xiaogang Jia, Niklas Freymuth, Gerhard Neumann

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling, Enrico Krohmer, Nicolas Schreiber, Xiaogang Jia, Niklas Freymuth, Gerhard Neumann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:机器人的思维是“模糊”的

想象一下,你正在试图教一个机器人完成一项精细的任务,比如把一个木桩放入一个小孔中,或者堆叠一叠杯子。为了做到这一点,机器人需要以 3D 的方式来“观察”世界。

如今大多数机器人使用**点云(point clouds)**来观察世界。你可以把点云想象成一个由数百万个微小点组成的数字云团,每个点都代表空间中的一个特定位置。这就像是一个 3-D 版的“连点成图”游戏。

问题在于,这些机器人的“大脑”(神经网络)有一个坏习惯。它就像一个擅长理解故事大意、却看不清细节文字的学生。在技术术语中,这被称为谱偏差(spectral bias)。这些大脑天生能很快学会“低频”信息(宏观、缓慢的变化),但在学习“高频”信息(微小、尖锐的细节)方面却表现得很吃力。

正因如此,当机器人试图判断一个木桩是否仅仅偏离了孔洞 1 毫米时,它往往会忽略这种细微的差别。它能看到孔洞的大致形状,却看不见成功操作所需的精确边缘。

解决方案:给机器人戴上“高清晰度”眼镜

本文作者提出了一个简单而强大的修复方案:傅里叶特征(Fourier Features)

把机器人的大脑想象成一个收音机调谐器。目前,它只能听到低沉、轰鸣的低音(低频),却听不到清脆、高亢的小提琴高音(高频)。

作者建议在机器人的输入端添加一个特殊的“适配器”。这个适配器获取 3D 点的原始坐标,并将其转化为一种充满波纹和模式的高维复杂语言。

  • 类比: 想象你正在向朋友描述一座锯齿状的山峰。
    • 没有适配器时: 你说:“那是一座大山。”(低频)。你的朋友得到了大致的概念,但不知道哪里有陡峭的悬崖。
    • 有了适配器后: 你说:“那是一座带有锯齿状边缘的山,每隔几英寸就会向上剧烈跳动。”(高频)。你的朋友现在可以看清精确的形状。

通过将 3D 点转化为这种“傅里叶”语言,机器人的大脑突然就能“听到”那些它之前一直忽略的高音和尖锐细节了。

他们是如何测试的

研究人员不仅停留在理论层面,还在真实的机器人和复杂的视频游戏模拟环境(如 RoboCasaManiSkill3)中进行了测试。

  1. 实验设置: 他们选取了各种不同的机器人“大脑”(不同类型的编码器),并让它们执行相同的任务:打开抽屉、按压按钮、堆叠杯子以及倒咖啡。
  2. 对比实验: 他们对机器人进行了两次运行:一次使用标准的“模糊”视角,另一次使用全新的“傅里叶眼镜”。
  3. 测试结果:
    • 成功率大幅飙升: 在模拟实验中,使用傅里叶特征的机器人成功率比未使用时的机器人高出多达 20%。在某些特定任务中(例如关抽屉),成功率从 34% 跳升至 72%。
    • 现实世界验证: 他们在真实的物理机器人上进行了测试。使用傅里叶特征的机器人表现得更加精准。如果没有这些特征,机器人在尝试堆叠杯子时经常会撞倒杯子,或者无法正确抓取物体。有了这些特征后,其动作变得更加平滑且自信。
    • 鲁棒性: 即使在数据存在噪声(例如摄像头看到的图像略微模糊)的情况下,傅里叶特征也能帮助机器人保持轨迹不偏离。

为什么这很重要

论文指出,这不仅仅是针对某一个特定机器人的小技巧,而是一种通用的升级。无论机器人使用的是简单的脑结构还是复杂的脑结构,添加这些傅里叶特征都能帮助它学习 3D 世界中的“细节文字”。

总结:
如果你想让机器人胜任精细、高精度的任务,你不能仅仅给它 3D 数据;你必须给这些数据一个“频率提升”。通过将机器人观察世界的视角转化为一种能够突出锐利细节的语言,机器人终于能够学会执行那些需要人类般精准度的任务。

作者已经公开了他们的代码和视频,以便他人可以使用这个“适配器”来让自己的机器人变得更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →