✨ 要点🔬 技术摘要
想象一下,你是一个机器人,正走进一个凌乱的厨房,你的人类老板只给了你一条指令:“找个能舀起洒掉的汤的东西。”现在,想象一下你只能通过一个窥视孔看到房间里极小的一片区域。你可能会看到一个闪亮的红球、一个蓝色的盒子或一块形状奇特的石头。如果你仅仅根据这微小的视角进行猜测,你可能会抓起那个球,以为它是个碗,然后彻底失败。这就是“具身智能体”(embodied agents)——即生活在现实世界中并需要与之交互的机器人——每天面临的挣扎。长期以来,科学家们一直在教机器人识别物体(比如“那是杯子”)或从单张静态照片中猜测如何抓取它们。但现实生活是混乱的。物体会被遮挡,光线会变化,有时你甚至需要转动头部才能看清那个所谓的“杯子”是否真的有一个把手,或者它其实只是一块涂了颜色的石头。研究人员提出的核心问题是:我们如何教会机器人知道何时 它掌握的信息还不够,并弄清楚下一步该看向哪里来解开这个谜题,同时又不浪费时间和精力?
这篇论文介绍了一种让机器人玩转这种“我该看哪里?”游戏的新方法,称为主动功能性示能性落地 (Active Functional Affordance Grounding)。与其只是盯着一张图片瞎猜,不如鼓励机器人主动移动、窥视物体背后并收集线索,直到它绝对确定自己找到了合适的工具。来自奥本大学的作者周晨(Zhou Chen)和 Sathyanarayanan N. Aakur 提出了一个名为 FUSE (通过语义-几何探索实现功能性理解,Functional Understanding through Semantic–Geometric Exploration)的新系统来解决这个问题。把 FUSE 想象成一个使用两个不同“大脑”来破解谜题的机器人侦探。第一个大脑是一个“快速猜测者”(摊销规划器),它能快速观察场景并说:“我敢打赌勺子就在那儿!”第二个大脑是一个“缓慢而细致的调查员”(显式探索),它通过构建一个详细的房间 3D 地图来检查快速猜测者的判断是否正确。
FUSE 的神奇之处在于它知道何时使用哪个大脑。如果快速猜测者非常有信心,机器人就会直接执行计划,从而节省时间和电量。但如果快速猜测者感到困惑或场景看起来很奇怪,FUSE 就会切换到缓慢、细致的模式。它会利用一种被称为 3D 高斯泼溅(3D Gaussian Splatting)的技术构建房间的 3D 模型,以此来精确测量它对物体形状和位置的“未知程度”。然后,它会将摄像头移动到能提供最多新信息的地点。论文显示,这种“自适应”方法是大获全胜的。在测试中,FUSE 找到正确物体的概率为 72%,优于随机猜测(56%)或使用高级语言模型引导搜索(65%)。它在速度上也击败了纯粹的“缓慢细致”法,运行速度快了 1.33 倍,因为它不会在不需要时浪费时间构建 3D 地图。
研究人员还测试了 FUSE 在不同“知识来源”下的表现——基本上就是不同的告知机器人“舀汤工具”可能长什么样的途径。他们发现,无论提供候选名单的“大脑”是专门的机器人模型、像 Llama 这样的大型语言模型,还是预先知道答案的完美“先知”,FUE 都能表现良好。然而,他们也发现了一个硬性限制:如果机器人的候选名单完全错误(比如认为一块石头是勺子),那么无论怎么观察都无济于事。只有当机器人寻找的物体确实在它的可能性名单上时,它才能实现物体的落地。
最后,FUSE 表明,机器人理解世界最好的方式不仅仅是看更多,而是要看得更聪明。通过将快速直觉与基于证据的仔细检查相结合,机器人可以停止盲目猜测并开始真正掌握信息,即使在视野受阻或场景混乱的情况下,也能找到合适的工具来完成工作。这不仅仅是理论上的胜利;作者展示了通过使用这种方法,机器人可以在完成任务的同时,显著减少思考和移动所花费的时间。
技术摘要:FUSE —— 主动功能性示能性落地(Active Functional Affordance Grounding)
问题定义:主动功能性示能性落地
本文解决了具身智能中的一个关键空白:即根据功能 而非预定义的身份来识别并与物体交互的能力。现有的方法通常基于固定的视角运行,或者假设已经具备了充足的视觉证据。然而,功能性查询(例如“切一段绳子”或“舀取食物”)往往会产生多个合理的假设,而实现这些功能所需的判别性证据可能被遮挡、不完整,或者从初始视角无法获取。
作者将**主动功能性示能性落地(Active Functional Affordance Grounding)**定义为一个序列感知任务,要求智能体必须:
从功能性语言查询中推断候选物体假设(无需预定义的类别目标)。
主动选择感知动作(视角)以消除语义和几何上的歧义。
在物理执行之前,在空间上定位最符合功能意图的物体。
这不同于被动落地(可能过早做出决策)、主动物体搜索(寻求预定义类别)以及下一最佳视角规划(假设目标已知)。
方法论:FUSE 框架
作者提出了 FUSE (通过语义-几何探索实现功能理解),这是一个旨在高效获取信息观测值的自适应框架。F-USE 通过最小化功能不确定性 来运作,该不确定性被定义为落地功能目标所需的未解决的语义和几何证据。
核心组件
功能不确定性表示 :
语义不确定性 (U s e m U_{sem} U se m ) :源自 SAM3 ,它生成候选物体假设的像素级掩码和评分。不确定性估计为 1 − score 1 - \text{score} 1 − score 。
几何不确定性 (U g e o U_{geo} U g eo ) :源自 SSNR (结构信噪比),通过比较观测图像与从 3D 场景表示中渲染的图像之间的梯度来计算。低 SSNR 表示结构建模不完整或不准确。
证据图(Evidence Map) :这些组件被融合进一个功能性证据获取图 (E t E_t E t ) 中,以平衡候选物体的相关性与几何观测不足的问题。
空间证据表示 :
智能体维护一个持久且增量精细化的 3D 高斯泼溅(3D Gaussian Splatting, 3DGS) 模型。这使得智能体能够跨视角对可见性、遮挡和几何结构进行推理,而不是将观测视为不连贯的序列。
自适应规划策略 : FUSE 采用一种置信度门控机制,在两种规划模式之间切换:
摊销规划器(Amortized Planner) :一种学习到的策略(CLIP 主干 + MLP),通过单次前向传播预测感知动作的价值。它速度很快,但在陌生状态下可能会产生歧义。
显式探索(Explicit Exploration) :一个审慎的过程,通过更新 3DGS 表示、渲染候选视角并计算完整的语义-几何证据图来选择最优动作。
切换逻辑 :系统计算摊销规划器动作分布的熵。如果熵较低(高置信度),则选择摊销动作。如果熵较高(不确定性),则触发显式探索以精细化场景表示并重新评估。
终止条件 : 当融合目标得分(SAM3 得分 + 深度接近度得分)连续 K K K 步未能提升,或感知预算耗尽时,探索停止。
核心贡献
论文概述了四个主要贡献:
任务形式化 :将主动功能性示能性落地 定义为一个新的序列感知任务,该任务要求在部分可观测条件下进行目标发现和空间落地。
基准测试 :引入了一个基于 Habitat 的基准测试,包含 100 个随机场景实例、标准化的停止准则,以及对比静态、规范、随机、基于 VLM 和自适应方法的评估赛道。
算法 :开发了 FUSE ,一个通过在快速摊销规划和显式语义-几何搜索之间进行自适应切换,以平衡计算成本和落地可靠性的框架。
实证验证 :通过受控实验证明,任务驱动的语义-几何证据获取可以提升各种知识源下的主动落地性能。
实验结果
实验在提出的 Habitat 基准上进行,使用 CRAFT-E 作为主要的示能性知识源,并与其它 LLM 和 VLM 进行了对比。
性能对比基准 :
被动/静态方法 :仅实现了 42% 的成功率。
随机主动方法 :成功率提升至 56% ,但需要显著更多的步骤(12.20)且缺乏任务导向。
VLM 主动方法 :使用 Oracle 标签和基础模型引导达到了 65% 的成功率,但在最终落地质量(SAM3 得分)上仍落后于 FUSE。
FUSE :实现了最高的非 Oracle 成功率 (72%) 和 平均 IoU (70.91%) 。
效率 :
相比于完全显式探索 ,FUSE 在保持相当性能(72% vs 70% 成功率)的同时,降低了 1.33倍 的计算成本。
它仅在 33.41% 的决策中调用了显式探索,其余则依赖摊销规划器处理常规步骤。
鲁棒性 :
FUSE 在各种知识源(CRAFT、GPT、Llama、Qwen、Sonnet、Gemini)下均保持有效,表明其策略与特定的上游推理机制是解耦的。
“Oracle-Label”变体达到了 77% 的成功率,这表明虽然 FUSE 是鲁棒的,但初始功能性假设生成的质量仍然是一个限制因素。
消融研究 :
语义 vs. 几何 :仅语义落地(53%)是不够的。仅几何落地(65%)虽有所改善,但仍逊于融合方法(72%)。
粒度 :像素级语义证据(SAM3)至关重要;补丁级(CLIP)使成功率降至 34%。
终止条件 :将深度接近度纳入停止准则,比仅使用 SAM3 使成功率提升了约 5%。
意义与主张
作者声称,F-USE 通过在没有预定义目标的情况下同时解决“看什么”和“在哪看”的问题,代表了具身感知领域的重要进展。
超越被动落地 :论文认为,功能性理解需要主动获取证据;依赖固定视角或单一观测会导致过早承诺并在遮挡场景中失败。
主动感知的效率 :通过在学习型(摊销)和显式规划之间进行自适应切换,FUSE 证明了智能体可以在不承担持续显式场景重建的高昂计算成本的情况下,实现高保真度的落地。
泛化性 :该框架在不同的功能推理后端下表现稳健,表明其自适应证据获取机制是功能落地任务的一种通用解决方案。
论文总结道,虽然现有方法已提高了基于可用观测的功能推理能力,但 FUSE 明确解决了前置的感知问题:即如何确定哪些额外的观测对于可靠地落地功能意图是必要的。未来的工作建议在真实机器人平台上验证 FUSE,并将其扩展到动态环境和长程任务中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。