Ludi: An Agentic System for Socially Intelligent Robots
本文介绍了 Ludi,这是一个结合了经过微调的视觉语言模型与专门的导航和操作工具的智能体系统,旨在使具有社交智能的机器人能够通过具备上下文感知推理和自适应行为的能力,来处理具有歧义的多轮人类交互。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,实现一个有用的机器人的梦想一直受限于一个简单的现实:机器擅长遵循严格的指令,却极不擅长理解人类对话中那种混乱且多变的状态。如果你告诉传统的机器人“给我拿那个红色的罐头”,它会找到红色的罐头并把它拿来,即使你在过程中改变了主意。它缺乏社交智能,无法意识到你的意图已经发生了演变,从而停下动作并根据新的信息调整其行为。这种僵化的编程与流动的交互之间的差距,正是研究人员目前正试图解决的核心挑战。该领域正在超越仅仅教机器人如何观察和移动;新的目标是教它们如何倾听、记忆、推理,并像人类在协作时那样实时改变主意。
Ludo Robotics 的一个团队通过一个名为 Ludi0.1 的新系统,在实现这一目标方面迈出了重要一步。这并不是一个试图同时处理所有事情的单一软件,而是一个在中央“大脑”指导下协同工作的专门工具团队。这个大脑是一种经过训练、能够理解图像和语言的人工智能,它被专门教授了如何处理真实对话中的来回互动。研究人员构建了一个系统,使这个大脑能够观察它所看到的,倾听人类所说的,记住刚才发生的事情,然后决定是说话、移动、拿起物体还是等待。其核心创新在于,该系统旨在处理中断和修正。如果一个人开始要一罐可乐,机器人正准备去拿,但那个人突然说:“其实,她更喜欢百事可乐。”Ludi0.1 会理解旧计划不再有效。它会停止伸手拿可乐,将注意力转向百事可乐,并根据新指令继续执行任务,而不会破坏互动的流畅性。
为了构建这个系统,研究人员并没有依赖一个试图从零开始学习一切的庞大单一模型。相反,他们创建了一个中央推理模型充当管理者的结构。这个管理者接收一系列的信息流:来自机器人眼睛的实时视频流、人类刚刚说了什么文本,以及关于机器人此前所做或所想的所有记录。基于这一全貌,管理者决定下一步使用哪个工具。这些工具是针对特定任务的专门程序,例如检查物体是否在手臂触及范围内、导航到如卧室之类的命名房间,或者实际抓取物体。管理者可能会决定提出澄清性问题,或者决定走向书桌。至关重要的是,该系统设计为在连接到机器人的现场 GPU 工作站上本地运行,这意味着它不需要等待互联网连接来进行思考或行动。这使得机器人能够即时做出反应,甚至在说话或移动的过程中。
团队在 Unitree G1 上测试了这个系统,这是一款像人一样站立和行走的类人机器人。他们创建了一个家庭环境的模拟器来训练机器人,生成了数千个复杂交互的案例。在这些训练场景中,机器人练习处理模糊请求、应对任务中途的修正以及管理多步骤的任务。例如,机器人学会了如果用户说“把中间的那台笔记本电脑拿过来”,它必须先观察场景以识别哪台笔记本电脑在中间,然后才能尝试拿起它。训练数据包含了用户改变主意、中断机器人或在机器人正在行动时提供新信息的情况。研究人员发现,通过在这些特定的交互模式上对中央推理模型进行微调,机器人完成任务的成功率大大提高。在测试中,该系统成功完成了 28 个复杂场景中的 20 个端到端任务,相比未经训练的同类模型有了显著提升。
Ludi0.1 的成功在于其能够将对话与物理动作保持在同一现实中。机器人不仅仅是在说出词汇;它所说的词汇直接与它所见和所做的事情相联系。如果机器人正在走向一个房间,它可以解释它要去哪里。如果它够不到某个物体,它可以诚实地说明。该系统维持着互动的共享历史,使其能够记住用户最初想要可乐,后来又换成了百事可乐。这种记忆不仅仅是事实列表;它是一个塑造机器人每一个新决策的动态语境。研究人员在一次现实测试中展示了这一点:一名用户要求机器人把饮料送到卧室的一个人那里。当用户在机器人正准备伸手拿第一罐饮料时,将顺序从可乐改为百事可乐,机器人立即停止,转向正确的饮料,导航到卧室,并将饮料放在书桌上,同时向用户解释其行为。
尽管该系统令人印象深刻,但研究人员也明确了其目前的局限性。机器人的智能是由一个中央大脑和若干独立的专门工具组成的。大脑决定做什么,工具负责执行,但它们尚未成为一个单一、统一的心智。这种分离有时会导致延迟,或让机器人的行为显得略显支离破碎,仿佛系统的不同部分是在互相交谈而非作为一个整体在行动。团队承认,下一步是超越这种模块化方法。他们正致力于开发未来的版本 Ludi 1.0,那将是一个将感知、语言、记忆和物理控制深度集成到一个凝聚系统中的单一基础模型。目前,Ludi0.1 作为一个工作原型和价值数据源。通过观察机器人如何与人互动,研究人员正在收集训练下一代真正集成的社交机器人所需的现实世界轨迹。
这篇论文展示的工作证明,只要系统能够处理人类意图的不可预测性,流畅的人机协作在今天就是可能的。研究人员表明,通过将推理核心与专门的物理技能以及强大的交互记忆相结合,机器人可以适应任务中途的变化。这还不是一个已解决的问题,目前的系统仍然依赖于一种结构化架构,而非完全学习到的统一智能。然而,结果为前进指明了清晰的路径。暂停、倾听、修正并继续,这不再仅仅是一个理论概念;而是一种现在就可以被构建和测试的能力。随着团队不断完善这些系统,过去那种僵化的机器与未来协作伙伴之间的差距正在不断缩小。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。