Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning
本文介绍了 R&B-EnCoRe,这是一种自监督框架,通过将具身推理视为潜在变量,从互联网规模的知识中蒸馏出动作预测策略,从而在不依赖僵化模板或外部奖励的情况下,显著提升了各类视觉 - 语言 - 动作(VLA)模型在操作、导航和驾驶方面的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教机器人如何执行一项任务,比如把红辣椒放进黄色的篮子里。过去,研究人员曾试图通过强制机器人遵循严格、预先写好的脚本,来帮助它“思考”。他们会告诉机器人:“首先,观察房间里的一切。其次,列出你看到的每一个物体。第三,思考天气情况。第四,规划你的动作。”
问题在于,这种“一刀切”的脚本往往充满了噪声。机器人可能会把脑力浪费在与辣椒无关的盘子和勺子的列举上,或者在室内时担忧天气情况。这会分散机器人对实际目标的注意力,使其速度变慢,失败的可能性增加。
解决方案:R&B-EnCoRe
这篇论文介绍了一种名为 R&B-EnCoRe(针对具身特定性的思维链推理的细化与自举)的新方法。可以将这种方法想象为一位智能编辑,它帮助机器人学习思考什么,而不是告诉它确切地该思考什么。
以下是其工作原理,使用一个简单的类比:
1. “头脑风暴”阶段(预热启动)
想象你正在尝试编写一道菜的完美食谱。与其给你一份固定的食谱,不如给你一大袋食材(推理思路),例如“列出所有物体”、“规划步骤”、“检查夹爪位置”或“思考天气情况”。
R&B-EnCoRe 首先随机混合这些食材。有时它给机器人一份仅包含步骤的食谱;有时给一份列出所有物体的食谱;有时包含天气情况,有时则不包含。这被称为推理丢弃(Reasoning Dropout)。这就像一位厨师尝试成千上万种不同的食材组合,以观察哪些组合能让菜肴味道更好。
2. “品尝测试”阶段(自监督细化)
现在,机器人如何知道哪份食谱最好?通常,你需要一位人类品尝者来说:“这个好,那个不好。”但在机器人领域,我们往往没有人类在观察每一个动作。
R&B-EnCoRe 使用了一个巧妙的技巧,称为重要性加权变分推断。
- 隐喻:想象机器人是一位试图破案(任务)的侦探。它生成了几个不同的“理论”(推理轨迹)来解释发生了什么。
- 测试:机器人随后自问:“如果我使用理论 A,我抓到罪犯(正确执行动作)的可能性有多大?如果我使用理论 B,可能性又是多大?”
- 结果:该方法自动为每个理论计算一个“分数”。有助于机器人预测正确动作的理论获得高分。而那些仅仅是噪声的理论(例如列举无关物体或谈论天气)则获得低分。
3. “最终菜单”阶段(自举)
一旦机器人测试了成千上万个这样的“理论”,它就会创建一个经过提炼的新数据集。它摒弃了低分、具有干扰性的想法,只保留高分、有帮助的想法。
- 对于机械臂:它学会了思考“夹爪在哪里”和“下一步子任务是什么”至关重要,但列出房间里的每一个物体则是浪费时间。
- 对于行走机器人:它学会了思考“湿滑的冰面”(功能可供性)至关重要,但思考“社会规范”或“天气”则是无关紧要的。
随后,机器人利用这份新的、干净的“思维菜单”重新训练自己。它学会了只思考与其特定身体和任务相关的内容。
结果:更少噪声,更多成功
该论文在三种截然不同的机器人类型上测试了这种方法:
- 机械臂(操作):机器人完成任务的能力提高了28%。它不再浪费时间列举无关物体,而是专注于辣椒和篮子。
- 行走机器人(足式导航):机器人的导航得分提高了101%。它们学会了专注于地形(是否湿滑?),而不是无关的细节。
- 自动驾驶汽车:汽车的碰撞率降低了21%。它们学会了忽略干扰性思维,专注于道路和其他车辆。
核心要点
该论文声称,通过将“推理”视为机器人可以自行发现并优化的隐藏变量,我们可以构建出更智能、更快速、更高效的机器人。它们不需要人类为它们编写完美的脚本。相反,它们可以利用互联网上庞大而杂乱的知识,过滤掉噪声,并学会为了完成任务究竟该思考什么。
简而言之:R&B-EnCoRe 教会机器人停止过度思考,转而思考正确的事情。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。