SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models
本文介绍了 SCALE,这是一种针对视觉-语言-动作模型的无需训练、单次推理策略,它利用自我不确定性来动态调整视觉感知和动作执行,从而增强鲁棒性,并在无需额外训练或验证器的情况下,超越了现有的测试时扩展方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做晚饭。你给它一个食谱(语言指令),并向它展示厨房(视觉输入)。机器人需要决定下一步做什么:拿刀、切洋葱,还是打开炉灶。
目前的机器人大脑(被称为视觉-语言-动作模型)很聪明,但它们有一个缺陷:它们有点过于僵化。一旦它们做出决定,就会固执己见,即使感到困惑也是如此。如果机器人看到一个看起来很像西红柿的红辣椒,它可能会抓错东西并毁掉这道菜,同时还自信满满地坚持说:“我很清楚自己在做什么。”
这篇论文介绍了一种名为 SCALE(自我不确定性调节的自适应观察与执行)的新方法。把 SCALE 想象成给了机器人一个“直觉”计量器,告诉它什么时候该大胆行动,什么时候该谨慎行事。
以下是 SCALE 的工作原理,通过简单的概念进行拆解:
1. 问题所在:“自信的傻瓜”
如今大多数机器人就像一个正在参加考试的学生,他们猜出一个答案后就拒绝更改,即使他们意识到自己可能错了。
- 固定视觉: 它们观察世界时的“专注度”始终如一。如果它们被一个闪亮的物体(干扰物)分散了注意力,它们可能会错过真正需要的食材。
- 固定动作: 它们会立即选择那个可能性最高的单一动作。如果它们不确定,它们仍然会选一个并听天由命。
2. 解决方案:“自我不确定性”计量器
SCALE 在机器人采取行动之前会问一个简单的问题:“我现在有多确定?”
它不需要人类老师或第二个机器人来检查它的工作。它通过观察自己的内部数学逻辑(“logits”)来衡量自身的信心。
- 高置信度(低不确定性): 机器人确定那个红色的东西是西红柿。它会像激光束一样收窄焦点,快速且直接地行动。
- 低置信度(高不确定性): 机器人看到两个红色的东西,不确定哪一个是西红柿。与其瞎猜,它会说:“等等,我糊涂了。”
3. 魔法技巧:自适应观察与执行
当机器人意识到自己很困惑时,SCALE 会同时触发两种变化:
- 自适应观察(拓宽镜头): 想象机器人戴着眼镜。当它有信心时,眼镜设置为“放大”模式,以专注于特定任务。当它困惑时,眼镜会自动切换到“广角”模式。这迫使机器人重新观察整个场景,搜寻之前可能错过的线索(比如检查另一个红色物体是否真的是辣椒)。
- 自适应执行(尝试更多选项): 当有信心时,机器人会选择最佳动作并执行。当困惑时,它不再那么死板。它不再只选一个动作,而是“采样”几种不同的可能性(比如尝试稍微不同的角度来抓取物体),看看哪种感觉是对的。
4. 为什么它很特别(“单次通过”的优势)
其他让机器人变得更聪明的方法通常需要:
- 训练一个新的老师: 你必须训练一个单独的 AI 来检查机器人的工作。
- 多次运行测试: 机器人在脑海中尝试任务 10 次以选出最佳方案,这非常缓慢。
SCALE 则不同。 它就像一个本能地知道何时减速并环顾四周的司机,而不需要副驾驶或第二次行程。
- 无需额外训练: 它直接利用机器人现有的“大脑”。
- 无需反复纠结: 它在一次性操作中(一次“前向传播”)做出决策。
- 实时性: 因为它不会浪费时间进行重复计算,所以它足够快,能够应用于现实世界的机器人。
结果
在测试中,使用 SCALE 的机器人能更好地处理棘手情况,例如:
- 挑选那些看起来与其他物体很相似的物体。
- 在绕过障碍物时不会发生碰撞。
- 完成复杂的长任务,其中早期的微小错误可能会毁掉全局。
简而言之: SCALE 教会机器人倾听它们的“直觉”。当它们确定时,行动迅速且专注;当它们不确定时,它们会放慢速度,更仔细地观察周围,并尝试不同的方法。这使得它们在无需任何额外训练或缓慢重复测试的情况下,变得更加安全、聪明且可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。