← 最新论文
🤖 AI

Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents

本文提出了一种名为验证器引导动作选择(VeGAS)的测试时框架,该框架通过采样候选动作并利用基于大语言模型驱动的数据合成策略构建的专用训练生成式验证器来挑选最可靠的动作,从而增强基于多模态大语言模型的具身智能体的鲁棒性,在不修改底层策略的情况下,在复杂、长视野任务中实现了显著的性能提升。

原作者: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Nishad Singhi, Christian Bialas, Snehal Jauhri, Vignesh Prasad, Georgia Chalvatzaki, Marcus Rohrbach, Anna Rohrbach

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人打扫你的房子。你给它一个简单的指令:“找一个运动用品,把它放在柜台上。”

在过去,如果你让一个智能机器人执行这个任务,它会快速扫视一眼,猜测下一步该做什么,然后立即抓起它看到的第一件东西。如果它把海绵误认为是球并抓了起来,机器人就会失败,而且它直到整个任务彻底搞砸了,才会意识到自己犯了错。这就像一个学生参加考试,写下脑海中蹦出的第一个答案,然后不检查就交卷。

本文介绍了一种名为VEGAS(Verifier-Guided Action Selection,验证器引导的动作选择)的新方法,旨在解决这一问题。你可以将 VEGAS 理解为在机器人行动之前,给它提供一次“第二意见”。

问题所在:“冲动型”机器人

当前的机器人由非常智能的 AI 模型(称为多模态大语言模型)驱动。它们擅长理解语言和识别图像。然而,它们有点像冲动的天才。当面对棘手的情况时——比如寻找“黄色的弯曲水果”而不是“香蕉”,或者在把苹果放进橱柜前先清洗它——它们往往会急于给出答案。如果它们在早期犯了一个小错误,整个计划就会崩溃,因为它们从未停下来问一句:“等等,这真的对吗?”

解决方案:“三思而后行”策略

作者提出了一种简单但强大的改进:不要只行动;先三思,再行动。

以下是 VEGAS 的工作原理,我们用一个烹饪类比来说明:

  1. 主厨(策略模型):想象机器人是一位试图遵循食谱的主厨。主厨不再只是抓起一种食材就扔进锅里,而是会暂停一下。
  2. 品尝菜单(采样):主厨会构思16 种不同的方法来解决当前的步骤。也许是“拿起番茄”,也许是“拿起洋葱”,也许是“先去冰箱”。主厨会写下一个小笔记(即“思维链”),解释为什么他认为每个选项是好的。
  3. 评论家(验证器):这是神奇的部分。主厨不会直接选择第一个想法。他会将所有 16 个想法交给一位评论家(一位专门训练用来发现错误的 AI)。
    • 评论家会阅读食谱和主厨的笔记。
    • 评论家会说:“选项 1 是错的,因为你抓起的是海绵,而不是球。”
    • “选项 2 是错的,因为你试图打开一个已经关着的微波炉。”
    • “选项 3 完美!”
  4. 最终行动:主厨只执行评论家给予“点赞”的那一个动作。

秘密武器:训练评论家

你可能会想:“难道我们不能直接用超级智能的 AI 作为评论家吗?”作者尝试过,但失败了。通用型 AI 要么太客气,要么太模糊,无法捕捉到机器人具体的错误。

为了解决这个问题,作者发明了一个合成失败工厂

  • 他们收集了数千个成功的机器人任务。
  • 他们利用强大的 AI 故意将这些任务搞砸。他们让机器人抓取错误的物体、跳过步骤或打开错误的门。
  • 然后,他们要求 AI 撰写报告,解释为什么每个错误是糟糕的。
  • 他们利用这些“假错误”和“假报告”来训练他们的评论家。

这就像通过向安全监察员展示一千段人们做危险行为的视频,并精确解释为什么这些行为是危险的,来培训他们。现在,当真正的机器人行动时,评论家就成为了识别这些特定错误的专家。

结果

作者在两个虚拟世界(Habitat 和 ALFRED)中测试了该方法,在这些环境中机器人必须完成家务。

  • 没有 VEGAS:机器人能正确完成约 65% 的任务。
  • 使用 VEGAS:机器人能正确完成约 71% 的任务。
  • 在最难的任务上:改进幅度巨大——比之前提高了36%

该论文表明,通过迫使机器人生成多个选项,并由专门的“评论家”挑选最佳方案,机器人变得更加可靠,特别是在指令棘手或情况陌生时。它将一个“猜测并碰运气”的机器人,转变为一个“计划、检查并执行”的机器人。

总结

该论文并未声称这将治愈疾病或明天就能驾驶汽车。它仅仅声称,对于执行家务任务的机器人来说,放慢脚步检查你的工作(使用经过训练的验证器)会使它们显著变得更聪明,并且在情况变得复杂时更不容易失败。它将一个“猜测并碰运气”的机器人,转变为一个“计划、检查并执行”的机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →