← 最新论文
🤖 AI

Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization

本文提出了一种质量-多样性(Quality-Diversity)优化框架,该框架能够发现并维护一个多样化的多模态规划策略存档,使具身智能体能够在检测到执行停滞时自适应地切换策略,从而提高长程任务的成功率与效率。

原作者: Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Pengfei Xu, Yong Liu, Xiaoya Nan, Qiang Yang, Peilan Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何在又大又乱的房子里导航,去寻找特定的物品并把它们送给一位朋友。你给了机器人一套指令,就像一份食谱,告诉它如何观察周围、决定下一步做什么以及如何移动它的手臂。这就是具身智能(Embodied AI)的世界,在这里,计算机程序不仅是在思考,还在物理或模拟环境中进行行动。通常,我们依赖大语言模型(LLMs)——这些经过海量文本训练的超级聪明计算机大脑——来充当机器人的大脑。这些模型非常擅长根据它们所看到和读到的内容来判断下一步该做什么。然而,这里有一个问题:如果机器人陷入了循环,比如反复开一个已经打开的门,或者原地转圈,它往往会一遍又一遍地重复完全相同的动作,试图得到不同的结果。这就像一个人在迷路时,因为那是他唯一知道的移动方式,所以不断朝着同一个方向走。研究人员提出的核心问题是:我们如何教会这些数字探险家意识到当前的策略行不通了,并尝试一种完全不同的思考方式?

这篇题为《通过质量-多样性优化发现多模态具身智能体的多样化规划策略》的论文,正是针对这一问题展开研究的。来自南京信息工程大学的研究团队指出,解决方案并不是让机器人单一的“最佳”计划变得更聪明,而是建议给机器人背上一个装满不同策略的背包。他们使用了一种称为质量-多样性(Quality-Diversity, QD)优化的方法,这就像是一场寻找多种不同“类型”的成功行为的寻宝游戏,而不仅仅是寻找一个完美的行为。

以下是他们的系统是如何运作的,我用一个生动的比喻来解释。想象机器人是一名正试图穿越山脉运送包裹的徒步旅行者。大多数机器人接受的是单一的徒步风格训练:“始终向上爬,寻找最陡峭的路径。”如果徒步者遇到了悬崖或沼泽,他们可能会一直尝试攀爬悬崖或在沼中跋涉,从而陷入困境并浪费能量。这篇论文建议,与其只有一种风格,不如我们创建一个徒步风格库。有些徒步者可能是“探索者”,会检查每一个角落;有些是“直接奔跑者”,会向目标冲刺;还有些是“谨慎攀爬者”,会测试每一步是否稳固。

研究人员构建了一个两阶段系统来创建和使用这个库:

  1. 离线阶段(库的创建): 在机器人真正执行任务之前,计算机先运行数千次模拟。它获取一个基础的“食谱”(即机器人思考的方式),并开始像疯狂科学家交换蛋糕配方中的原料一样,对其中的不同部分进行混合与匹配。有些配方会让机器人变得非常话唠且谨慎(高“交互强度”),而有些则会让它非常专注且快速(高“目标导向性”)。计算机在模拟世界(具体是一个名为 ThreeDWorld 的 3D 环境)中测试所有这些配方。它并不只是保留单一的最佳配方,而是为每种不同的风格都保留了“最佳”配方。如果某种“谨慎”风格在特定情况下表现良好,它就会被保存在库中的一个特殊位置。如果某种“快速”风格在另一种情况下表现出色,它也会被保存下来。这创建了一个多样化的策略存档,每种策略都贴有其行为特征的标签。

  2. 在线阶段(实际任务): 现在,机器人开始执行真正的任务。它从库中挑选一种策略并开始移动。系统内置了一个“停滞检测器”。想象有一个教练在观察机器人。如果机器人在没有接近目标的情况下连续做了 10 步重复动作(比如绕圈走),教练就会大喊:“停!这个策略行不通!”与其让机器人继续失败,系统会按下倒带键(检查点),回到上一个安全时刻。然后,它会查看库,并挑选一个与刚才失败的策略完全不同的策略。如果机器人刚才表现得过于谨慎,系统可能会切换到“直接奔跑者”风格。这使得机器人能够打破循环,立即尝试全新的方法。

研究结果非常令人振奋。在测试机器人搬运物体穿过模拟房屋的任务中,团队发现这种“库”方法比使用单一固定风格或使用 ReActTree-of-Thoughts 等其他常见方法的机器人表现要好得多。具体来说,在“食物(Food)”任务(搬运食物类物品)中,他们的方法成功率达到了 51%,而标准基准模型仅为 33%。在“杂物(Stuff)”任务(搬运普通物体)中,他们的成功率达到了 43%,而基准模型为 24%。更令人印象深刻的是,在实现这些成功的同时,他们使用的“Token”(衡量计算机思考和交流程度的指标)比一些先进方法还要少。

论文还在另一种类型的任务上测试了这个想法:一个视觉导航游戏,机器人需要根据语音指令在房子里行走。尽管在那项任务中机器人并没有携带物体,只是在行走,但同样的“库”技巧同样帮助它提高了成功率(从 35.2% 提升到了 37.3%)。这表明,拥有多样化策略的想法是帮助机器人从困境中恢复的一种通用方法。

作者们谨慎地指出,他们并没有“解决”机器人智能的终极问题。相反,他们的实验表明,拥有一套多样化的预设策略是应对现实世界任务中混乱且不可预测性的有力手段。他们认为,当前机器人的最大弱点不在于它们不够聪明,而在于当目前的计划不再奏效时,它们太过于固执,不愿改变主意。通过赋予它们一个可以采取不同行动的“工具箱”,机器人可以随时进行调整,将潜在的失败转化为成功的交付。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →