← 最新论文
💻 computer science

MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection

本文提出了 MS-MEM,这是一个结合了主动视角选择、物体推移与抓取,并引入附带扰动约束的证据框架,旨在提高杂乱环境中的建图精度,同时最大限度地减少不必要的场景变化。

原作者: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

发布于 2026-09-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在我们的家庭和仓库中工作的机器人面临着一个看似简单却极其棘手的问题:它们无法看到一切。在一个杂乱的房间里,物体会互相遮挡,产生让机器人的传感器感到困惑的盲区。为了找到特定的物品,机器人不仅仅需要观察;它必须与世界进行交互。它可能会把一个盒子推到一边,以查看其后方隐藏的东西,或者移动到一个新的角度以获得更好的视野。这一研究领域被称为“主动感知”(active perception),它基于这样一个理念:机器人通过触摸和移动物体来学习,效果比仅仅盯着看要好。然而,这里有一个难点。每当机器人推动一个物体时,它都会改变场景。如果它推得太用力或太频繁,可能会弄乱原本排列整齐的架子,导致稍后难以理解布局。工程师们的挑战在于,如何教会机器人既要有足够的“好奇心”去发现隐藏之物,又要足够“谨慎”,以免在过程中把场面搞得一团糟。

卡尔斯鲁厄理工学院、波恩大学和达姆施塔特工业大学的研究人员开发了一种新系统来解决这种平衡难题。他们将其称为 MS-MEM,这是一个旨在帮助机器人绘制紧凑、杂乱空间(如货架)地图,同时尽可能保持场景不受干扰的框架。该系统允许机器人从三种不同类型的动作中进行选择:移动到新的视角以观察更多信息、推动物体以揭示隐藏之物,或者拿起并移除阻挡视线的物体。其核心创新在于,机器人不仅仅选择能揭示最多信息的动作;它还会计算该动作的“代价”。它会自问:“如果我推这个盒子,会对货架的其他部分造成多大的扰动?”以及“获得的新信息是否值得我制造的混乱?”

团队将该系统建立在“不确定性”的基础之上。机器人并不将房间的地图视为一张固定的图片,而是维护一个关于“物体在哪里”的“信念”(belief),并附带一个衡量其不确定性的指标。当机器人对某个区域非常有信心时,它就知道不去触碰它。当它不确定时,它知道自己需要进行调查。为了做出这些决策,研究人员引入了一种让机器人理解“抓取”的新方法。以往的系统在视角受限或物体处于狭窄位置时,往往难以预测机器人的机械手与物体之间的交互方式。这个新系统教导机器人不仅要估计抓取的位置,还要估计其抓取的信心程度,以及物体的朝向可能存在的不确定性。这使得机器人能够融合来自多个角度的信息,随着绕物体移动,不断优化其对抓取动作的理解。

在实验中,研究人员在一个模拟真实世界货架(堆放了随机物体)的仿真环境中测试了该系统。他们将这种新的多技能方法与仅依赖单一类型动作(例如仅推动或仅抓取)的旧方法进行了对比。结果表明,结合这些技能的效果要好得多。通过使用“推动”来分离物体并创造空间,再使用“抓取”来移除特定的障碍物,机器人能够构建出更准确的场景地图。然而,最重要的发现来自于系统对“扰动限制”的能力。当研究人员在机器人的决策过程中加入了一个特定约束——即惩罚不必要的场景变化——时,机器人变得更加谨慎了。它仍然能找到隐藏的物体,但移动的物体数量远少于那些没有此规则的系统。在模拟中,与忽略场景扰动的方法相比,新系统减少了物体移动的总距离,同时仍实现了极高的建图精度。

团队还利用配备了摄像头和机械手的物理机器人手臂,在现实世界中测试了该系统。他们将机器人置于一个包含 69 个物体的货架前,设置了五种不同的具有挑战性的场景。机器人必须尽可能多地寻找并识别物体。结合了推动、抓取和谨慎移动的系统找到的物体比仅使用单一技能的系统更多。它成功识别了 44 个物体,而仅推动系统找到了 40 个,仅抓取系统找到了 38 个。至关重要的是,它在寻找物体时造成的物体位移更小。仅抓取的系统移动最少,但因为它过于保守,未能找到许多隐藏物品。仅推动的系统找到了很多物品,但显著地弄乱了货架。新系统则达到了最佳平衡:在找到最多物体的同时,保持了场景相对有序。

这项工作表明,为了在人类空间中有效运作,机器人必须能够推断其行为的后果。仅仅能够拿起或推动物体是不够的;机器人必须理解获取信息的价值与所造成的改变之间的代价关系。通过教会机器人权衡这些因素,研究人员向着能够以人类般的细致与适应力在杂乱世界中穿行的机器迈出了重要一步。该系统不仅仅是在观察世界;它理解了“有益的交互”与“破坏性的交互”之间的区别,从而能够在不破坏其试图绘制的秩序的前提下,学习并理解其环境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →