Bridging Learned Visual Perception and Symbolic Belief-Space Planning
本文引入了一种新颖的“将视觉语言模型(VLM)作为概率接地器”的范式,该范式将视觉感知的确定性捕捉为符号状态上的概率分布,从而实现了在部分可观测环境中优于现有确定性方法的鲁棒信念空间规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个试图整理凌乱客厅的机器人。它看到桌子上有一本书,而书架在房间的另一头,但它的摄像头在晃动,光线也很昏暗。在现实世界中,机器人的视觉很少是完美的。它们无法同时看到所有事物;物体可能躲在家具后面,传感器也经常误解它们所看到的东西。为了安全且有效地行动,机器人必须承认它所不知道的事情。如果它对物体位置的猜测错误,它可能会尝试抓取并不存在的东西,或者更糟,试图放置一个它并未持有的物体。这种不确定性是教导机器人在我们复杂且不可预测的家中进行导航的最大障碍。
多年来,研究人员一直试图通过给机器人一个能够观察图片并立即判定事实的“大脑”来解决这个问题。他们使用强大的人工智能模型,这些模型能够同时理解图像和语言。其理念很简单:给机器人看一张照片,问它“柜子开了吗?”,如果模型回答“是”,机器人就会将其视为绝对事实并规划下一步行动。但在实践中,这种方法非常脆弱。当模型出错时——这在物体被遮挡或视野不清时经常发生——机器人就会根据一个谎言来执行计划。它可能会花几分钟时间试图打开一扇已经打开的门,或者更糟,因为它认为任务是不可能的而彻底放弃。核心问题在于,这些系统将不确定的猜测视为确定的事实,没有为错误留出余地。
来自以色列理工学院的一个研究小组提出了一种看待此问题的不同方式。他们并没有强迫机器人对世界做出单一、僵化的判断,而是教会了它同时持有多种可能性。他们将这个新系统称为 RoVLaP。与其要求人工智能模型说“书在桌子上”或“书不在桌子上”,该系统会要求模型说明每种情景发生的可能性有多大。它可能会说书在桌子上的概率是 60%,而在抽屉里的概率是 40%。通过保持这些概率的存在,机器人可以建立一种承认不确定性的关于世界的“信念”。它不仅仅是为最可能的情景做计划;它同时为一系列可能的情景进行规划。
研究人员在一个模拟家庭环境中测试了这个想法,这是一个充满了虚拟家具、抽屉和物体的数字世界。他们给了机器人一些常见的家务任务,例如将书分类放回书架、清理抽屉或锁门。在这些测试中,机器人必须完全依赖其摄像头所能看到的画面,而没有任何关于隐藏物体可能在哪里的特殊知识。他们将这种新方法与另外两种常见方法进行了对比:一种是 AI 模型直接告诉机器人逐步该做什么,另一种是模型提供一个关于房间的固定描述供标准规划器使用。
结果显示,这种新方法具有明显的优势。在模拟测试中,当机器人的视野被遮挡或产生误导时,标准方法经常完全失败。例如,在一个碗被藏在关闭的柜子里的任务中,标准机器人会假设碗是可见的,并立即尝试抓取,结果每次都失败。然而,新系统识别出碗可能被隐藏了。它规划了一系列包含“先打开柜子”在内的动作序列。仅仅这一项改变,就让机器人在其他方法失败的情况下取得了成功。在困难任务中,新系统解决了 66.7% 的问题,而标准的“接地器(grounder)”方法一个也没解决。在难度中等的任务中,与标准方法相比,新系统的成功率提高了 160% 以上。
除了解决更多的任务外,这个新系统还更加高效。因为它从一开始就考虑到了不确定性,所以犯错更少,也不需要频繁重新开始计划。标准方法经常必须停止,意识到自己错了,然后重试,从而浪费时间和能量。相比之下,新系统生成的计划足够稳健,能够处理最初的混乱,而无需停止并重新思考。它以一种谨慎的自信移动,为自己的第一个猜测可能是错误的做好准备,并准备好了备选方案。
研究人员还证明了这种方法在数学上是严谨的。他们表明,如果人工智能模型哪怕只是比随机猜测稍微好一点,只要机器人持续观察并更新其信念,它最终就能弄清楚世界的真实状态。该系统并不要求模型是完美的;它只需要模型能持续比抛硬币的结果更好。随着时间的推移,随着机器人收集到更多的视觉证据,它的不确定性会缩小,其计划也会变得更加精确。这提供了一个安全网:即使机器人最初的想法是错误的,该系统也被设计为可以在不崩溃或卡死的情况下自我修正。
这项工作代表了构建自主智能体方式的一种转变。它不再认为机器人必须了解真相才能行动,而是认为机器人即使在不确定的情况下也能明智地行动。通过将世界视为一系列可能性而非单一固定的现实,机器人变得更加适应环境且更加可靠。在模拟家庭中,这意味着机器人不再是一个在看不见隐藏物体时就放弃的任务者,而是一个能耐心地打开柜子去寻找物体的任务者。随着机器人从受控实验室走向真实的家庭——在那里光线会变化,物体会移动,视野会被遮挡——这种为未知进行规划的能力,可能是让它们成为真正有用伙伴的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。