NAC: Neural Action Codec for Vision-Language-Action Models
本文介绍了神经动作编解码器(Neural Action Codec, NAC),这是一种受神经音频编解码器启发的架构,它将机器人动作轨迹视为多通道一维信号,旨在实现高保真压缩,并使视觉-语言-动作模型在下游任务中的表现优于现有的标记化方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机械臂完成一项精细的任务,比如堆叠积木或倒饮料。机器人需要移动得平滑且精准,但控制它的“大脑”(一种“视觉-语言-动作”模型)是用来处理文字和图像进行思考的,而不是用来处理物理运动这种平滑、连续的流动的。
为了让它们能够进行交流,我们必须将机器人的平滑运动翻译成计算机能理解的语言:即一系列离散的步骤或“标记”(tokens)。这就像是将一段流畅的旋律转换成一系列音符。
问题所在:旧方法很笨拙
以前,科学家尝试通过两种主要方式来进行这种翻译:
- “分箱”(Binning)法: 想象一下,如果你只能使用一把刻度很少的尺子来描述一条平滑的曲线。你不得不将运动切割成微小且锯齿状的步骤。这会产生一份极其庞大的指令列表,处理起来既慢又不准确。
- “频率”法: 有些人尝试像压缩 ZIP 文件一样压缩运动,但他们使用的工具是为人类语言设计的。虽然这有所帮助,但并不完美,因为机器人的运动与人类的声音有着本质的区别。
解决方案:借鉴音乐(NAC)
这篇论文的作者 Ahad Jawaid 和 Yu Xiang 有一个聪明的想法:为什么不使用压缩音乐的技术呢?
现代音频 AI 模型(例如那些生成音乐或压缩 Spotify 文件的模型)非常擅长将复杂的声波转化为紧凑的代码列表,随后又能完美地重建声音。他们称之为“神经音频编解码器”(Neural Audio Codec)。
该团队意识到,机器人的运动实际上就是伪装成声波的运动。
- 音频: 随时间变化的空气压力波(高频)。
- 机器人动作: 随时间变化的关节角度波(低频)。
他们构建了一个名为 NAC(神经动作编解码器) 的新系统。他们将这个“音乐压缩”引擎进行了改造,用以“压缩”机器人的运动。
转折点:不要去“听”机器人
这是这篇论文最重要的发现:你不能通过“听”来教机器人运动。
音频编解码器的训练目标是让声音听起来悦耳,因此它们使用了一种被称为“梅尔频谱图”(Mel-spectrogram)的特殊滤波器,这种滤波器模拟了人类对音高的感知。作者发现,如果他们在机器人身上使用这种“人类听觉”滤波器,机器人将会彻底失败。这就像是用狗叫声来为吉他调音;工具完全不匹配。
相反,他们剥离了这些“人类耳朵”滤波器,取而代之的是只关注准确性的简单数学运算。他们告诉 AI:“不要担心听起来如何,只要确保机器人的手最终停在完全正确的位置即可。”
它是如何工作的(类比)
把机器人的运动想象成一部漫长而复杂的电影。
- 编码器(总结者): NAC 系统观察这部电影,将其分解为几个关键场景(粗略结构),然后填充微小的细节(精细运动)。它将整部电影转化为一份简短、高效的代码列表。
- 解码器(投影仪): 当机器人需要移动时,它会获取那份简短的代码列表,并使用一个特殊的投影头(称为 ISTFT 头)将其还原为一段平滑、高清晰度的运动电影。
- “判别器”(评论家): 为了确保运动是平滑而非顿挫的,系统使用了一个“评论家”AI,它会将运动与原始运动进行对比检查。如果运动看起来太颠簸,评论家就会大喊“不!”,并迫使系统重新尝试,直到运动变得平滑为止。
实验结果
团队在计算机模拟和现实世界中测试了这种新方法。
- 在模拟中: 使用 NAC 的机器人在完成任务(如堆叠积木)方面明显优于使用旧方法的机器人。它更精确,犯错更少。
- 在现实世界中: 当他们将其应用于真实的物理机器人时,NAC 依然胜出,实现了 50% 的成功率,而其他方法的成功率要低得多。
核心结论
该论文声称,通过将机器人运动视为音频波,并利用音乐产业中最优秀的工具(但去除了“人类耳朵”滤波器),我们可以更高效地教机器人运动。它将一个混乱的、连续的物理问题转化为了一个整洁、有序的指令列表,使现代 AI 能够轻松学习和预测。
简而言之: 他们通过教机器人如何“歌唱”它们的动作来教机器人运动,但他们确保机器人是用自己的语言在歌唱,而不是人类的语言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。