Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation
本文介绍了 \methodgated,这是一个无需训练的框架,它通过利用零样本几何一致性检查来选择性地应用测试时缩放,从而增强了世界动作模型(World Action Models),在提高任务成功率的同时显著降低了不必要的计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机器人正在学习如何冲泡一杯咖啡。在过去,机器人就像笨拙的幼儿:它们抓起把手,用力一拉,然后听天由命。如果它们弄掉了杯子,它们只会尝试重新开始,希望能从错误中学习。但现代机器人正变得越来越聪明。它们使用一种被称为“世界动作模型”(World Action Models)的技术。可以将这些模型想象成机器人的内部“梦境机”。在机器人实际移动手臂之前,它会在脑海中进行快速模拟,想象如果它抓起杯子、提起并倾倒,未来会是什么样子。它在脑海中预见到了未来。
科学家们提出的核心问题是:我们如何确保机器人的“梦境”是一个好的梦境?在人工智能领域,有一个流行的概念叫做“测试时缩放”(Test-Time Scaling)。这就像给学生更多的时间来参加考试。AI 不仅仅是回答一个问题,而是生成十个不同的可能答案,检查所有答案,然后选出最好的一个。这通常会让 AI 变得更聪明,但也非常昂贵且缓慢,因为它消耗了大量的计算能力。对于机器人来说,在糟糕的想法上浪费时间和精力是危险的;它可能会在“思考”时撞倒一个花瓶。因此,挑战在于如何确定何时值得投入额外的脑力去检查未来,以及如何在不被噪声干扰的情况下选出最好的未来。
这篇论文介绍了一种巧妙且免费的方法来帮助机器人做出这些决策。作者提出了一种名为“Gated GeoBoN”的系统。他们没有强迫机器人检查每一个想法(这很慢),而是构建了一个两步过滤机制。首先,机器人对它的第一个想法进行快速、廉价的观察。它问一个简单的问题:“我计划执行的动作是否真的与我在梦境中看到的动作相匹配?”如果机器人计划提起杯子,但它的梦境显示杯子纹丝不动,这就是一个红旗(警示信号)。机器人随后会触发“门控”(gate)并说:“好吧,这个第一个想法很奇怪。让我们再生成几个选项并仔细检查一下。”
如果第一个想法看起来是一致的,机器人就直接执行它,从而节省时间。但如果触发了门控,机器人就会生成一批新的“梦境”。这里出现了第二步,也是更强大的一步:几何检查。机器人使用一个预训练好的、冻结的几何模型(一个理解 3D 空间的工具)从不同的摄像机角度观察它的新梦境。它会问:“如果我从我的手腕摄像头和主摄像头观察这个未来的场景,它们的 3D 形状是否完美对齐?”如果机器人关于杯子悬浮在半空中的梦境不符合物理学的 3D 规则,系统就会拒绝它。然后,机器人会选择那个看起来在物理上最一致的梦境,并执行该动作。
研究人员在多个机器人基准测试上测试了这种方法,包括开门、冲咖啡和移动物体等任务。他们发现这种方法效果非常好。当他们使用固定数量的检查(例如始终检查 8 个选项)时,机器人的任务完成率提高了。例如,在名为 RoboCasa 的一组任务中,使用一种类型的机器人大脑,成功率从 66.3% 上升到 68.4%,使用另一种类型则从 80.8% 上升到 82.5%。在另一个名为 LIBERO Long 的测试集中,成功率从 97.5% 跳升至 99.3%。
然而,这篇论文也发现了其中的局限性。如果你不断要求更多的选项(比如检查 16 个或 32 个梦境),机器人并不总能变得更聪明。事实上,有时它反而会变差。作者认为这是因为当你拥有大量的选项时,你可能会不小心选到一个“运气好”的坏想法,这个想法仅仅是因为碰巧看起来很一致,而实际上并不是一个好的计划。这被称为“虚假低分选择”(false low-score selection)。
为了解决这个问题,他们使用了这个“门控”系统。通过仅在第一个想法看起来可疑时才进行昂贵的深度检查,他们节省了大量时间。他们发现,这种“门控”方法回收了大约 75% 的全量检查带来的性能收益,但它仅在约 26% 的决策中触发了额外的检查。这意味着机器人大部分时间都保持着快速和高效,只有在真正需要时才会停下来深思熟虑。论文结论指出,使用这些内置的一致性检查是一种强大且免费的方式,可以让机器人变得更聪明,而无需重新训练它们或为它们的大脑添加新的、复杂的部件。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。