UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following
本文介绍了 UESF-Bench,这是一个用于统一具身人类寻找与跟随的大规模基准测试,通过要求智能体在持久追踪目标之前先定位由语言描述的目标,解决了现有评估方法的局限性,并提出了 SeekFollow-VLA 框架以有效管理这两个阶段之间的转换。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在教一个机器人成为终极侧卫。在机器人领域,“看见”与“理解”之间有着巨大的区别。为了让机器人真正发挥作用,它需要具身智能(Embodied AI)——一个活在身体里的头脑,让它能够穿梭于现实世界,而不仅仅是盯着屏幕看。它还需要**视觉-语言-动作(Vision-Language-Action)**技能,这是一种高级说法,意味着它必须观察正在发生的事情,倾听你的指令,然后通过物理移动来执行任务。把它想象成一场捉迷藏游戏:机器人必须听取线索,比如“去找那个穿红夹克的人”,然后在房子里四处奔走寻找他,并在找到后紧跟其后而不撞到他。为什么这很重要?因为在现实生活中,人们并不会总是站在机器人面前等着被跟随。通常,他们可能躲在另一个房间,或者机器人已经失去了对他们的视线。如果一个机器人只能跟随它已经看见的人,那它就没那么好用了。它必须先具备“搜寻”的能力,然后再切换到“跟随”模式,同时还要在拥挤的人群中分辨出谁是谁。
这篇论文介绍了一个全新的挑战以及针对该问题的解决方案。作者们(来自多所大学和公司的研究团队)意识到,现有的多数机器人跟随测试都太简单了:它们假设目标人物从一开始就在那里,且清晰可见。他们认为这忽略了这项工作最核心的部分:搜索。为了解决这个问题,他们构建了一个庞大的新游乐场,名为 UESF-Bench(统一具身搜寻与跟随基准测试)。这就像是一个巨大的电子游戏关卡,拥有超过 143 万个不同的场景,包含 4,800 多名独特的数字人物和 770 多个不同的环境。在这个基准测试中,机器人会收到一条指令,例如:“在厨房里找到那个棕色头发的矮个子男人并跟随他”,它必须完成两件事:首先,当目标不在视线内时,主动进行搜寻;其次,一旦找到目标,即使他在人群中再次失踪,也要能无缝切换到跟随模式。
研究人员发现,仅仅告诉机器人“两者都要做”是不够的,这会让它感到困惑。他们测试了构建机器人大脑的三种不同方式。第一种是“单头(Single Head)”模式,即机器人尝试用同一个大脑同时处理搜索和跟随;第二种是带有基础切换功能的“双头(Dual Head)”模式;第三种是“任务驱动路由器(Task-Driven Router)”,这是一个更聪明的系统,它像一名交通警察一样,根据观察到的情况明确告知机器人何时停止搜索并开始跟随。结果显示,“单头”模式表现糟糕,在单人测试中的成功率仅为 4%。即使是基础的“双头”模式也表现挣扎,成功率仅为 5%。然而,“任务驱动路由器”(他们称之为 SeekFollow-VLA)改变了局面。在单人测试中,它的成功率达到了 35%;而在难度更高的多人测试中(即有假人躲藏以试图迷惑机器人),它依然保持了 20% 的成功率,远超其他方案。
论文指出,成功的关键不在于拥有更好的摄像头或更快的脑子,而在于拥有一个清晰的内部信号,能够识别出任务已从“狩猎”转变为“护卫”。研究人员展示了他们的智能路由器是如何学会先像侦探一样进行高强度的全场扫描,然后在瞥见正确目标的一瞬间,立即切换到忠诚保镖模式。他们还注意到,虽然这种新方法在寻找和跟随方面表现出色,但在拥挤的房间里碰撞的频率略有增加,这表明成为一名优秀的猎人有时会让你变得有点笨拙。最终,这篇论文论证了:要构建能在现实世界中真正帮助我们的机器人,我们不能再用简单的、静态的任务来测试它们,而必须用那些充满混乱、充满变数的现实挑战来考验它们——即去寻找一个躲藏起来的人,并在混乱中始终如一地跟随。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。