← 最新论文
💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

本文介绍了 **In-Context VLA**,这是一个通过利用结构化感知证据和智能体工具使用来取代自由形式思维链生成,从而增强视觉-语言-动作(Vision-Language-Action)模型的框架,进而实现基于具身语言理解的高级低层控制,并在模拟和现实世界的操纵任务中达到最先进的性能。

原作者: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人做家务,比如做三明治或整理凌乱的房间。长期以来,科学家们一直试图通过向机器人展示人类做这项工作的视频,并告诉机器人:“完全模仿你所看到的。”这种方法在处理简单任务时效果尚可,但就像是通过仅仅背诵一个僵化的句子来学习一门新语言一样。如果你要求机器人“拿起那个红色的杯子”,但随后说“抓起那个深红色的杯具”,机器人可能会感到困惑,因为它从未学会理解词语背后的“含义”,而只是学会了匹配它在训练中听到的特定声音。

为了解决这个问题,研究人员最近尝试给机器人加入一个“思考”步骤,类似于人类在行动前对自己说话的方式。他们希望机器人能先写出一个计划,比如:“好吧,杯子在桌子上,我需要把手向左移动,”然后执行动作。这被称为“思维链”(Chain-of-Thought)。但转折在于:对于机器人来说,在行动前话太多反而会让它们表现得更差。这就像是试图一边开车一边写关于这条路的长篇小说;等你写完句子时,你已经错过转弯了。机器人会陷入一种自言自语叙述自己想法的循环中,而不是实际去抓取物体,而且它经常会编造关于物体位置的事实,因为它是在猜测而非观察。

这篇论文介绍了一种教导机器人的新方法,叫做 VLA-Talker。与其强迫机器人写出自己的想法,研究人员为机器人提供了一个“智能助手”,由它来负责观察和汇报。你可以把它想象成一个戴着超强眼镜并配备了得力副驾驶的机器人。当机器人需要知道勺子在哪里时,它不会去猜测或写一段长篇大论。相反,它会立即询问它的副驾驶(该副驾驶使用深度摄像头和物体检测器等特殊工具)来告知:“勺子在你的手右侧 42 个像素处,且位置略低。”机器人随后读取这份清晰、事实性的报告并立即行动。

研究人员发现,这种方法是一个游戏规则的改变者。通过让机器人“消费”来自工具的清晰、有据可查的语言,而不是“生成”自己混乱的喋喋不休,机器人变得更快、更准确。在测试中,这种方法不仅效果更好,而且比旧的“思考”方法快了近 4.6 倍,因为机器人不再浪费时间在行动前写文章。他们在复杂的计算机模拟环境中甚至在真实的类人机器人上进行了测试,结果证明该方法能持续解决其他机器人难以应对的任务,这证明了有时,最好的思考方式是倾听那个掌握事实的人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →