← 最新论文
💻 computer science

Retrospective Open-Vocabulary Memory for Long-Term Object Search

本文介绍了 ECROM,一种用于长期目标搜索的方法,该方法利用回顾性开放词汇记忆来推理检测机会并提高搜索效率,并通过一个新的基准测试验证了其相对于现有记忆系统显著的性能提升。

原作者: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

发布于 2026-10-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaming Wang, Zhiwei Xue, Chen Jizhuo, Peng Shiqi, Harold Soh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现实世界中移动的机器人视觉能力正在不断提升,但在记忆事物通常位于何处方面仍然表现得很糟糕。想象一下,一个机器人被要求在一间它已经造访过多次的房子里寻找丢失的一把钥匙。如果机器人只记得最后一次看到钥匙的时间,那么如果钥匙在昨天被移动了位置,它可能会在错误的地方寻找。如果它只是简单地计算自己在特定地点看到钥匙的次数,它可能会被自己的“运气不好”所蒙蔽:也许它经过厨房桌子一百次却从未向下看,而它只在客厅沙发旁瞥了一眼,恰好看到了钥匙。简单的计数会让机器人认为沙发是最好的寻找地点,尽管桌子实际上才是钥匙最常出现的地方。这就是长期物体搜索的核心问题:区分一个物体究竟“居住”在哪里,与机器人仅仅是“偶然看到”它在哪里。

为了解决这个问题,新加坡国立大学的研究人员开发了一种让机器人构建环境记忆的新方法。他们将这一系统称为 ECROM,即“暴露校准回顾式开放词汇记忆”(Exposure-Calibrated Retrospective Open-Vocabulary Memory)。团队在由十个不同数字家庭组成的系列受控模拟中测试了该系统,其中物体的移动遵循隐藏的模式,且机器人的路径被刻意进行了变化,使得某些表面被频繁观察,而另一些则很少被看到。他们发现,通过仔细权衡机器人所见内容与其是否有机会看到该表面的程度,机器人可以学习到物体的真实习性。当被要求寻找以前从未被告知要寻找的物品时,这种新的记忆系统帮助机器人比以往的方法更快、更可靠地找到了目标。

研究人员应对的挑战根植于机器人移动过程中那种混乱的现实。在真实的家中,机器人并不会以完美的清晰度扫描每一个房间的每一寸空间。它可能在穿过厨房时正盯着天花板看,或者经过一个被椅子部分遮挡的餐桌。如果机器人仅仅计算它在桌子和中岛上分别检测到“草帽”的次数,如果它在岛台附近停留的时间更长,它可能会得出错误的结论。帽子可能有一半时间在桌子上,但如果机器人只在岛台附近看过,简单的计数就会表明岛台是草帽的家。研究人员意识到,要学习物体通常出现在哪里,机器人必须将“检测到物体的证据”与“观察到该物体的机会”区分开来。一次漏检只有在机器人确实看向正确方向时才有意义;如果机器人当时正看向别处,那么检测结果的缺失便无法说明任何问题。

为了测试这一想法,团队创建了一个名为 LOOP-Bench 的基准测试,其中包含十个真实的家庭环境。在这些模拟中,他们根据隐藏的概率分布将杯子、剪刀和帽子等物体放置在各种表面上。有些物体总是出现在同一张桌子上,有些在几个位置之间移动,还有些极少出现。至关重要的是,机器人在这些家中的路径生成过程是独立于物体放置位置的。这意味着机器人可能经过一张桌子十次却从未清晰地看到其表面,而可能仅经过一次厨房岛台就获得了完美的视野。这种设置迫使记忆系统在不被机器人自身运动模式误导的情况下,去推断物体的真实位置。

新的系统 ECROM 通过将机器人的历史记录组织成一个由“支撑面”(supports)组成的地图,并精确记录每次经过时每个表面被观察到的程度来进行工作。当人类稍后要求机器人寻找特定物品时,系统会查看所有的历史行程。它不仅仅进行计数;相反,它会根据表面的暴露程度计算一个概率。如果机器人清晰地看到了一个表面但没有发现该物体,系统会大幅降低该物体存在的信念值。但如果机器人只是瞥见了某个表面,或者视野被遮挡了,系统会将检测缺失视为“中性”,拒绝对该位置进行惩罚。这使得机器人能够学习到:如果某个表面是该物体在可见状态下唯一被发现过的地方,那么即使机器人很少看到这个表面,该物体也可能在该表面上。

模拟结果非常明确。当研究人员要求机器人寻找从未被明确告知要搜索的物体时,新系统的表现优于他们测试的所有其他方法。它显著提高了预测的准确性,更重要的是,在主动搜索过程中,它找到物体的时间更短。在模拟中,使用 ECROM 的机器人大约在 59% 的尝试中找到了目标,而排名第二的方法约为 53%。更令人震惊的是,在论文展示的一个特定案例研究中,机器人寻找物体的行驶距离从 17.8 米降至仅 3.2 米。这种效率源于机器人能够准确知道哪些表面值得优先检查,而不是漫无目的地游荡或陷入重复检查已排除区域的困境。

为了确保这不仅仅是数字模拟中的“小把戏”,团队还在物理机器人(Hello Robot Stretch 3)在真实的办公环境中进行了测试。他们使用真实的物体(如红色的杯子、一把剪刀和一个午餐肉罐头)进行了同样类型的搜索任务。机器人必须在 500 平方米的范围内导航,在办公桌和架子之间移动,以寻找这些物品。结果反映了模拟的情况。使用新记忆系统的机器人在 15 次试验中成功找到了物体 14 次,而其他方法仅成功了 10 或 11 次。物理机器人行驶的距离也显著减少,平均行驶 19.4 米,而其他方法接近 29 米。这证明了将“观察机会”与“物体存在”分离的逻辑,即使在面对现实世界中不可预测的光照和杂乱环境时依然有效。

研究人员还探索了如果移除系统中关键部分会发生什么。当他们强迫机器人假设它已经完全看到了每一个表面(即使显然并未完全看到)时,机器人的性能下降了。它开始将漏检视为物体不存在的证据,从而导致它忽略了正确的地点。同样,当他们简化系统,仅观察物体是否被看到而忽略视觉证据的强度时,机器人的精确度也降低了。这些测试证实,系统的成功依赖于两个具体要素:对实际可见表面程度的仔细核算,以及对视觉证据强度的细致解读。

这项工作为需要在动态、变化的长期环境中运行的机器人指明了一条前进的道路。机器人不再仅仅是记住上次看到某物的时间,或者保留一个简单的计数,它们可以学习周围世界的习性。它们可以理解,仅仅因为最近没在柜台上看到咖啡杯,并不意味着咖啡杯不在那里;这可能只是意味着它们有一段时间没看那个柜台了。通过建立一个尊重自身视觉局限性的记忆,机器人可以成为更可靠的家庭伙伴,即使在世界处于不断变化的状态下,也能寻找到丢失的物品。研究人员计划向公众发布他们的代码和基准测试数据,以便他人在此基础上构建更智能、观察力更强的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →