LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation
本文介绍了 LH-AVLN,这是一个针对长时程音视频语言导航的新基准,它通过在声学丰富的室内环境中向智能体提出多目标任务挑战,并提出了 PAG-Nav,一种无需训练的智能体,该智能体能有效利用双耳音频进行搜索,同时依赖视觉语义验证来完成目标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人成为一名顶级的家政侦探。通常,当我们教机器人如何在房屋中移动时,我们会给它一个简单的任务:“去找那个红色的球。”它们会用摄像头的眼睛观察四周,也许会记住自己去过的地方,然后走动直到发现目标。这个科学领域被称为“具身导航”(embodied navigation),即机器人学习如何在现实世界中移动以完成任务。但这里有一个难点:大多数这类训练游戏都是完全静音的。机器人只能看到其镜头正前方的景象。如果球在关着的门后或者隐藏在黑暗的角落里,机器人就会陷入困境,对视野之外的一切视而不见。
现在,想象一下给那个机器人一种超能力:耳朵。在现实世界中,声音并不只是沿直线传播;它会绕过转角并渗过缝隙。一个拥有灵敏耳朵的机器人可以听到隔壁房间传来的狗吠声,或者墙后水龙头滴水的声音,即使它还没看到物体,这些声音也能为它提供前往某处的线索。这篇论文提出了一个宏大且棘手的课题:如果我们结合这两种超能力——视觉和听觉——但把任务变得更加困难,会发生什么?如果机器人寻找的不只是一个东西,而是一整份不同的清单,其中有些是通过文字描述的,有些是通过图片描述的,还有些仅仅是通过名称描述的,而且在机器人解决谜题的过程中,屋子里的声音也在不断变化,那又会怎样呢?
这项研究背后的研究人员(由来自香港科技大学和吉林大学的陈儒风及其同事领导)构建了一个全新的挑战,名为 LH-AVLN。你可以把它看作是一个高风险、多层级的机器人视频游戏。在这个游戏中,机器人被投放到一个 3D 房屋中,并被赋予一个包含两个到四个不同目标的“全局任务”。这些目标非常复杂:一个可能是“寻找沙发”(类别);另一个可能是“寻找那张靠着薄纱窗帘的浅灰色沙发”(描述);第三个可能是“寻找这张特定的床的图片”(图像参考)。
然而,真正的转折点在于声音。在这个游戏中,机器人正在寻找的每一件物品都会发出声音。但问题在于:这些声音并不是固定的目标。当机器人找到并完成一个目标后,该物品发出的声音就会停止。与此同时,那些尚未被找到的物品会继续发出声音,轮流成为最响的声音。这创造了一个混乱的情况。如果机器人正在寻找沙发,但它听到了马桶冲水声(因为它还没找到马桶),那么这个声音就是一个干扰项。机器人必须弄清楚:“这个声音是在帮助我找到当前的目标,还是一个误导我走向另一个未完成任务的红鲱鱼(干扰信息)?”
为了测试这一点,作者创建了一个庞大的数据集,其中包含超过 15 万个回合,机器人在这些回合中需要应对带有噪声的多目标任务。他们发现,现有的机器人——即使是那些擅长遵循指令或记忆视觉地图的聪明机器人——表现得也非常糟糕。当声音变得混乱或任务变得漫长时,这些机器人就会迷失方向或放弃。它们无法区分什么是有效的线索,什么是干扰性的噪音。
为了展示这有多难,团队构建了他们自己的机器人智能体,称为 PAG-Nav。这个机器人并不使用复杂的训练来学习,而是使用了一种聪明的策略。它维持着一张整个房屋的心智地图,追踪它去过的地方、它见过什么以及声音是从哪里传来的。它利用声音在看不见东西时引导搜索,但在得到清晰、明确的观察以确保物体无误之前,它拒绝说“我找到了!”即便使用了这种聪明的策略,该机器人在有序任务中的成功率也仅为 2% 到 3%,在无序任务中也仅为 3% 到 5%。
这篇论文的主要发现是:将声音加入到长期、复杂的任务中,显著增加了难度,而不是降低了难度。作者指出,虽然声音是寻找遮挡物体的有力工具,但如果机器人无法分辨出哪个声音属于哪个任务,它就会变成一场噩梦。他们认为,机器人导航的未来不仅仅在于看得更清或听得更准,而在于学习如何忽略噪音,并在正确的时间专注于正确的线索。论文总结道,我们距离解开这个谜题还很遥远,这为未来的发明家们留下了广阔的空间,去制造那些能够真正穿梭于嘈杂、多任务世界的机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。