STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration
本文提出了 STEP,这是一个状态感知框架,它利用多模态大语言模型来显式地估计系统状态并预测状态转移,从而克服人机协作中的幻觉和歧义问题,显著提高工业组装任务中的动作可执行性并减少最终状态误差。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代工业繁忙的世界中,人机无缝协作的梦想正逐渐成为现实,但这一梦想仍受困于一种根本性的误解。要让机器人真正协助人类,它不能仅仅是执行一系列指令,它必须理解人类的意图并预判下一步要做什么。这一挑战正是被称为“长期动作预测”(long-term action anticipation)领域的内核,在该领域中,计算机试图根据刚刚观察到的内容来预测未来事件的序列。近年来,能够同时处理图像和文本的强大人工智能系统已成为这项任务中极具前景的工具。这些系统可以观看一个人工作的视频,并猜测他们正试图建造什么。然而,一个显著的差距仍然存在:尽管这些智能系统在语言和模式识别方面表现出色,但它们往往缺乏对物理世界的真实理解。它们无法自然地追踪当一个物体被移动时房间状态的变化,这导致它们会构想出不可能实现的动作,或者丢失对最终目标的关注。
为了弥补这一差距,本田研究中心(Honda Research Institute)与北卡罗来纳大学教堂山分校的研究人员开发了一种名为 STEP 的新方法,其全称为“状态感知任务估计与规划”(State-Aware Task Estimation and Planning)。该团队专注于一个常见的工业场景:一名人类操作员正在工作台上使用木块组装一个结构,而机器人则在一旁观察并等待接手。在实验中,人类开始搭建特定的形状(例如桥梁或塔楼),然后停止,将规划责任交给机器人。研究人员希望测试是否可以教会机器人不仅能猜出最终结构应该长什么样,还能在规划下一步动作时,不断更新其对工作空间的心理地图。与以往仅仅要求机器人用语言描述下一步动作的方法不同,这种新系统强制要求机器人明确描述当前每个木块的排列情况,预测该排列在每次动作后将如何变化,然后利用更新后的描述来规划后续步骤。
STEP 的核心创新在于它坚持维护一份结构化的、数字化的物理世界记录。当机器人观察工作台时,它不仅仅生成一个模糊的概念,如“正在建造一座塔”;相反,它会创建一个关于场景的详细且有序的事实列表:五个木块中每一个的位置、某个木块是直立还是平放、以及它相对于摄像头和其他物体的精确方向。随后,系统利用这种精确的描述来模拟未来。它会自问:“如果我把这个木块移到这里,场景接下来会变成什么样?”然后针对下一个动作重复这个问题。通过不断地将自己的预测与目标进行比对,系统可以衡量自己距离完成任务还有多远。如果规划的动作序列导致了死胡同或偏离目标的状态,系统会识别出这一错误并缩短其计划,选择一条能更接近预期结果的不同路径。这种“规划、模拟结果、修正路径”的过程会重复多次,以确保机器人不偏离轨道。
研究人员在模拟环境中测试了这种方法,使用的是一个由人类操作员远程操控两只机械臂组装木块的数据集。他们将自己的方法与一种并未以这种结构化方式追踪环境状态的领先现有技术进行了对比。结果显示,新系统具有明显的优势。STEP 生成的计划显著更具实用性;研究人员发现,相比于基准方法,该方法预测的动作能更成功地被机器人执行,成功率高出 32.8%。此外,当机器人完成任务时,它所建造的最终结构比旧方法产生的结构更接近预期目标 14.8%。研究还表明,虽然旧方法有时会产生与人类原始序列相匹配的较长动作列表,但那些额外的步骤通常是多余或错误的,而新方法则能产生更短、更高效且能可靠达到目标的计划。
团队发现,这种方法的成功在很大程度上取决于初始步骤的准确性。如果系统正确识别了人类试图建造的目标,并准确描述了木块的当前状态,那么随后的规划将会非常有效。然而,如果系统在猜测目标或判断木块位置时出现错误,这些错误就会在整个计划中产生连锁反应。这一发现强调了系统不断重新评估工作空间物理现实能力的重要性。研究人员指出,虽然目前该方法是专为这种特定的木块搭建场景设计的,但其“显式追踪状态变化”的底层原理可以被推广到其他工业任务中,例如组装机械设备或构建模块化装置。他们也承认,目前的系统需要大量的计算时间来运行这些多次规划循环,因此比简单的方法运行速度慢,但他们相信随着技术的进步,这些延迟是可以减少的。最终,这项工作证明,通过赋予人工智能一种记录物理世界运行情况的能力,我们可以创造出不仅仅是响应式,而是真正能够与人类协作、胜任复杂任务的合作伙伴型机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。