← 最新论文
💻 computer science

Embodied Agents Take Control: Minimal-Interface Zero-Shot Agents Rival Industrial-Scale Policies in Vision-and-Language Navigation

本文表明,利用极简接口的通用代理控制技术,零样本具身智能体在视觉-语言导航任务中可以媲美工业级策略,其成功率高达 78%,并强调模型选择是性能提升的主要驱动因素,而非特定的软件框架。

原作者: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Zhou, Xunyi Zhao, Gengze Zhou, Zerui Li, Sihao Lin, Jiajun Liu, Qi Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的烤面包机不仅能烤面包,还能决定烤哪片,检查厨房是否干净,并思考如何把面包送到餐桌上而不至于烧掉房子。这就是**具身智能(Embodied AI)**的梦想:给计算机一个物理躯体(比如机器人),并赋予它们在现实世界中自主导航的脑力。长期以来,科学家们一直试图通过两种方式来教导这些机器人:要么像训练狗一样“训练”它们(重复同一任务数千次直到掌握),要么给它们一个严格的“剧本”(人类编写的规则列表,如“如果你看到一扇门,就打开它”)。但如果,我们只是给一台超级聪明的计算机一个摄像头和几个基础按钮,告诉它“去找厨房”,然后让它自己搞定剩下的事情呢?这正是这篇论文所提出的核心问题:一个通用的 AI,在没有任何专门的机器人训练的情况下,能否接管方向盘并在房屋中自主驾驶?

这项研究背后的研究人员决定通过在模拟房屋中的数字机器人来测试这个想法。他们剥离了所有用于导航的高级工具——没有地图、没有 GPS、没有预设路径,也没有专门的“机器人大脑”训练。相反,他们交给 AI 一个单一的摄像头,只能看到正前方的视野(就像人类通过猫眼观察一样),以及四个简单的指令:前进、左转、右转和停止。然后,他们要求 AI 遵循复杂的口头指令,例如“走过泳池,穿过吧台和椅子之间,然后在拐角处停下”。目标是观察这个 AI 是否能表现得像一个真正的“智能体(agent)”——一个能够观察、思考、行动并自我纠错,而无需人类牵手的决策者。

结果令人感到惊喜,但也让人感到谦逊。团队发现,这些“零样本(zero-shot)”智能体(意味着它们以前从未见过机器人)实际上可以导航得相当出色。通过使用名为 fable-5 的强大 AI 模型,机器人在标准测试中成功到达目标的概率达到了 78%,尽管它既没有地图也没有专门的训练。这是一个巨大的突破,因为这足以媲美那些经过数百万个案例训练的昂贵工业级机器人的表现。这表明,大部分繁重的工作是由“大脑”本身完成的,而不是围绕它构建的特殊软件。

然而,论文也划定了一道清晰的分界线。虽然 AI 在短途旅行中表现出色,但当旅程变长时,它就开始踉跄。如果任务需要穿过许多房间,或者需要记住五分钟前在哪里,成功率就会大幅下降到 26% 至 39% 之间。AI 会感到困惑,因为它必须记住它看到过的每一件事,而它的“记忆”变得过于拥挤。此外,当研究人员尝试将这种方法应用于一个真实的实体机器狗时,AI 的推理非常完美,却不断撞到墙壁,因为它并不理解自己的身体占据了多少空间。它知道要去哪里,但不知道如何穿过那扇门。

最后,论文指出我们正站在一个新时代的边缘。我们并不一定需要为每项任务都构建一个新的、特殊的机器人大脑;我们可能只需要让现有的超级聪明 AI 接管控制权,前提是我们要给它们提供合适的工具来管理自身的记忆并理解它们的物理身体。这是迈向这样一个时代的进步:届时,你的机器人不仅仅是听从命令,而是真正开始主导属于它自己的冒险。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →