VIA: Visual Interface Agent for Robot Control
本文介绍了 VIA,这是一个利用现成的基础模型作为视觉交互智能体,通过基于浏览器的 3D 界面来控制机器人,而无需进行特定任务的微调,证明了前沿智能体可以通过将机器人控制视为一种交互式软件操作,在复杂的操控任务中实现极高的零样本成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它精通编写代码、玩电子游戏和解决谜题,但它这辈子从未接触过任何实物。现在,想象你想教这个机器人拿起一个碗、打开一个抽屉或堆叠积木。
通常,科学家们尝试通过向机器人喂入数百万小时的机器人手臂运动视频来教导它,并不断调整机器人的“大脑”(即其权重),直到它学会这些动作。但这篇文章——VIA(视觉交互智能体)——提出了一个更酷、更简单的技巧:根本不要把机器人教成一个机器人。相反,只需让它使用电脑鼠标。
核心理念:将机器人视为一款电子游戏
来自斯坦福大学的研究团队意识到,当今最先进的 AI 模型已经是控制软件方面的专家了。它们可以观察电脑屏幕、点击按钮、输入文本,并弄清楚如何修复漏洞或构建网站。
因此,他们提出了一个问题:如果我们把真实的机器人手臂仅仅当作另一件软件来对待会怎样?
他们构建了一个特殊的 3D 界面,看起来就像是一款电子游戏或 3D 设计程序(想想 Blender)。在这个世界里,有一个蓝色的“目标夹持器”(target gripper)在空间中漂浮。AI 智能体并不直接与机器人的电机对话。相反,它观察这个 3D 世界的截图,并使用一套简单的工具来移动这个蓝色目标夹持器,就像人类移动鼠标光标一样。
这就是神奇的循环:
- 观察: AI 获取 3D 场景的截图(其中包括来自机器人摄像头的视角)。
- 思考: 它判断出:“我需要抓取那个红色的方块。”
- 行动: 它使用一个工具将蓝色目标夹持器传送至红色方块附近,将其旋转到正确的朝向,然后点击“执行”。
- 观察: 真实的机器人手臂移动以匹配蓝色目标。
- 重复: AI 获取另一张截图,观察是否成功,并规划下一步动作。
他们的发现(好消息)
团队使用两个强大的 AI 智能体(Claude Code 和 Codex)测试了六种不同的任务,例如堆叠积木、打开抽屉和转动炉灶旋钮。他们没有给 AI 进行任何特殊的机器人训练,只是给了它这个界面和一个简单的目标。
- 效果出奇地好: 使用最强的模型(CC-Fable),在涉及打开抽屉和转动旋钮的任务中,AI 的成功率达到了 96.7%。在完成将七个积木排列成彩虹这一漫长且复杂的任务时,它的成功率达到了 100%。
- 零样本学习(Zero-shot)是真实的: 这个 AI 之前从未见过这个特定的界面。它仅通过观察屏幕和阅读工具描述,就从零开始掌握了操作方法。
- 大脑越大 = 机器人越强: 随着他们使用的 AI 模型变得更强大、更聪明,机器人的表现也随之提升。这表明,随着 AI 在使用计算机方面变得越来越聪明,它也会自动变得更擅长控制机器人。
他们明确表示这“不是”什么
了解这篇文章不是在做什么非常重要,因为它拒绝了一些领域内的常见观点:
- 并非“微调”(Fine-Tuning): 他们没有利用机器人数据重新训练 AI 模型。他们没有调整 AI 的大脑使其理解物理学。他们使用的是这些 AI 模型原本销售时的原始状态。
- 并非“代码即策略”(Code-as-Policies): 他们没有要求 AI 编写调用特定机器人函数(如
grasp_object("red_cube"))的复杂代码。论文认为,依赖预先写好的代码库是一个瓶颈。相反,AI 只是使用简单的视觉工具来移动虚拟夹持器。 - 并非使用“特权”信息: AI 不会获得关于机器人精确坐标或内部状态的“作弊条”。它只看到人类能看到的东西:截图和摄像机画面。
难点(现实检查)
虽然研究结果令人兴奋,但论文非常谨慎,并未称其为适用于所有情况的“已解决”问题。
- 它是在模拟环境中: 所有这些测试都是在计算机模拟环境(RoboSuite)中进行的,尚未在真实的厨房或真实机器人上进行测试。作者认为这是一个充满前景的方向,但需要在真实硬件上进行测试。
- 它很慢且昂贵: 由于 AI 必须进行截图、思考并进行分步规划,所以速度并不快。它非常适合像组装家具这样缓慢、细致的任务,但如果让你去接住一个飞来的球,它可能会失败。
- 它需要“大脑袋”: 该系统目前需要目前市面上最强大、最昂贵的 AI 模型。较小、较便宜的模型可能不够聪明,无法仅凭截图就理解 3D 空间。
总结
这篇论文表明,我们也许不需要从头开始构建一种全新的“机器人大脑”。相反,我们可能只需要为现有的、超级擅长使用计算机的 AI 提供一个观察物理世界的窗口。如果你能给一个编程智能体一个 3D 界面和一只鼠标,它可能就是一个伪装成机器人控制器的 AI,准备好学习如何搭建彩虹积木或打开抽屉,而无需接受任何机器人相关的专门教学。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。