Beyond Transformers: Linear Attention Policy for Open-Vocabulary Object Goal Navigation
本文介绍了 LANav,这是一种导航策略,它通过使用由加权状态扩展线性注意力(WSLA)增强的结构化线性注意力机制来取代标准的基于 Transformer 的自注意力机制,从而与现有基准相比,实现了卓越的开放词汇目标导航性能、计算效率以及鲁棒的仿真到现实迁移能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在一间从未见过的房子里寻找一个特定的物体,比如一个“复古烤面包机”。你只能通过一个狭窄的窗口看到正前方的景象,而且你必须记住自己去过哪里、看到了什么,以及正在寻找的目标,以便决定下一步行动。这就是机器人导航世界的日常工作——这是一个被称为**具身智能(Embodied AI)**的科学领域。为了实现这一点,机器人使用一个“大脑”(策略网络),它就像一个短期记忆,根据新的视觉和听觉信息不断更新其内部状态。长期以来,科学家们尝试了两种构建这种记忆的主要方法:一种是将历史压缩成一个单一的、不断缩小的摘要(就像一本旧式的笔记本);另一种是保留一份最近看到的所有内容的详细清单,并在每次需要时重新阅读整份清单以寻找联系(就像一个超级组织有序但动作缓慢的图书管理员)。核心问题在于:当机器人寻找的物体可能有一个奇怪的名字,或者位于一个完全陌生的房子里时,哪种方法能更好地帮助它找到路径?
这篇论文介绍了一种名为 LANav(基于线性注意力的导航)的新方法,以及一个特别的升级版 WSLA。研究人员发现,曾被认为处于技术尖端地位的“超级图书管理员”方法(使用带有自注意力的 Transformer 模型)实际上在机器人需要记忆长距离旅程时会遇到瓶颈。令人惊讶的是,让机器人观察更长的历史记录并不会让 Transformer 变得更好;事实上,有时反而会变差。相反,团队发现一种称为**线性注意力(Linear Attention)**的方法效果更好,这种方法像一个稳定、结构化的流一样更新其记忆,而不是重新阅读整份清单。他们利用这个想法,通过 WSLA 对其进行了强化,该技术将记忆拆分为多个“子流”,并学习如何分配每个子流的权重。在测试中,这个新系统在一次具有挑战性的模拟实验中成功找到了目标物体 36.4% 的次数,明显超越了顶尖的 Transformer 模型。更酷的是,他们在真实的房间里用真实的机器人狗进行了测试,成功率达到了 82%,这证明了这种“流式记忆”的思想不仅适用于计算机,在现实世界中同样有效。
问题所在:机器人的记忆危机
想象一下,你正在一个巨大的、陌生的迷宫中寻找一把“蓝色椅子”。你只能看到前方几步远的距离。每当你转过一个弯,你都会看到新事物,但你也会忘记十秒钟前看到了什么。为了找到椅子,你的大脑需要保留线索:“我经过了一扇红门”、“我听到了风扇声”、“我向左转了两次”。
多年来,机器人科学家尝试用两种主要的记忆类型来解决这个问题:
- 压缩器(RNNs): 这些就像是一个将所有过去记忆挤压成一个微小、致密球体的机器人。它很快,但随着旅程变长,这个球体会变得越来越小且混乱,导致机器人遗忘重要的细节。
- 重读者(Transformers): 这些就像是一个保留着一份完美的、长长的关于它所见之物的卷轴的机器人。每当它需要决定下一步往哪走时,它都会从头到尾重新阅读整份卷轴以寻找联系。这很强大,但如果卷轴变得太长,就会变得缓慢且混乱。
研究人员问道:“如果我们给 Transformer 机器人一个更长的卷轴(更长的历史记录),它会更擅长寻找物体吗?”他们针对一项名为**开放词汇目标导航(Open-Vocabulary Object Goal Navigation)**的任务测试了这种“重读者”(Transformer)方法。这是一种高级说法,意思就是:“即使我使用的是你从未听过的奇怪名字,比如用‘装汤的东西’代替‘锅’,你也要找到那个物体。”
惊喜:更多的历史记录并没有帮助
团队进行了一系列受控实验。他们保持所有变量不变——机器人的眼睛、地图、训练规则——仅改变记忆系统。他们预期如果给 Transformer 机器人一个更长的卷轴来阅读,它找到物体的频率会更高。
但转折来了:这并没有奏效。
当他们增加 Transformer 可以看到的历史长度时,机器人的表现并没有提高。事实上,在某些情况下,表现甚至略有下降。这就像机器人溺死在了自己的记忆中,无法分辨长长的卷轴中哪些部分才是真正重要的。这种“重读者”方法似乎遇到了天花板。事实证明,对于在迷宫中徘徊的机器人来说,不断重新阅读整个历史并不是更新其状态的最佳方式。
解决方案:“流式”记忆
研究人员随后尝试了一种不同的方法:线性注意力(Linear Attention)。与其重新阅读整份卷轴,不如想象一个拥有“流式记忆”的机器人。当它行走时,它会像河流一样逐步更新其内部状态。它不会回看整条河流,而只是根据新的降雨(新的观测结果)和当前的水流来更新水位。
他们利用这种流式方法构建了一个名为 LANav 的系统。结果立竿见影且令人印象深刻:
- 优于旧方法: LANav 击败了“压缩器”(RNN)和“重读者”(Transformer)模型。
- 越长越好: 与 Transformer 不同,当他们给 LANav 机器人更长的历史记录进行学习时,它的表现实际上变得更好了。训练的历史记录越长,机器人就变得越聪明。
升级版:WSLA(多流大脑)
研究人员并没有止步于此。他们意识到,即使是流式记忆也可以得到改进。他们问道:“如果我们的机器人不仅仅有一条记忆流,而是有几条,并且可以学习该听从哪一条呢?”
他们创建了 WSLA(加权状态扩展线性注意力)。
- 类比: 想象机器人的大脑里有四个不同的“笔记本”(子状态)而不是一个。一个笔记本记录颜色,另一个记录形状,第三个记录转向,第四个记录声音。
- 魔力所在: 一个特殊的“指挥家”(可学习的权重)决定在任何给定时刻应该听取多少来自每个笔记本的信息。如果机器人正在寻找一个“红色的盒子”,指挥家可能会调大“颜色”笔记本的音量,并调低“声音”笔记本的音量。
这个 WSLA 系统最终成为了冠军。
- 在 HM3D-OVON 模拟(一个大规模、真实的 3D 房屋数据集)中,WSLA 机器人的成功率达到了 36.4%。
- 最好的 Transformer 模型仅达到了 30.1%。
- 这是一个 6.3 个百分点的提升,这在这一领域是非常巨大的进步。
为什么这很重要:距离与现实生活
研究人员还观察了机器人的导航方式。他们发现,新系统在长距离航行中表现尤为出色。
- 短途旅行: 两种机器人表现都还可以。
- 长途旅行: Transformer 机器人经常迷路或过早放弃。然而,WSLA 机器人却能保持冷静。它在成功导航距离达 15 米或以上 的任务中,成功率达到了 14.36%,而 Transformer 仅为 6.68%。
但真正的考验是将它从计算机带入现实世界。团队将他们的 LANav 系统安装在了一台 Unitree Go2 机器人(一台真实的物理机器人狗)上。他们要求它在真实的房间里寻找诸如垃圾桶、植物或椅子之类的东西。
- 他们进行了 50 次试验。
- 机器人成功完成了 41 次。
- 这意味着在现实世界中的成功率高达 82%!
这证明了“流式记忆”的思想不仅仅是一个酷炫的计算机技巧;它对于在真实空间中移动的机器人确实有效,能够处理现实生活的复杂性。
总结
论文表明,对于试图在复杂且未知的环境中寻找路径的机器人来说,旧的“重读一切”的方法(Transformers)可能不是最好的工具。相反,一种以结构化、流式方式更新记忆的方法(线性注意力),尤其是通过多个专业化子记忆进行增强(WSLA),要有效得多。它更快,在长距离航行中扩展性更好,而且最重要的是,当你把它放在现实房间里的机器人狗身上时,它确实有效。机器人导航的未来可能不在于记住更多的历史,而在于如何更好地记住它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。