PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
PRTS 是一种视觉 - 语言 - 动作基础模型,它将预训练重构为基于目标的强化学习,利用对比表示从离线轨迹中学习内在的目标可达性感知,从而相较于传统行为克隆,显著提升了机器人在长视野、高接触及零样本任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做家务。目前大多数机器人通过模仿来学习:它们观看人类执行任务(比如拿起杯子)的视频,并尝试复制所看到的精确动作。这就像学生死记硬背一套舞蹈动作。如果音乐变了、灯光灭了,或者舞者换到了另一个位置,学生就会感到困惑并停止跳舞。他们知道如何移动,但并不真正理解为什么要移动,或者要去哪里。
这篇论文介绍了一种新型机器人“大脑”——PRTS(原始推理与任务系统),它采用不同的方式学习。PRTS 不再仅仅复制动作,而是学会理解目标和进展。
以下是其工作原理的分解,使用简单的类比说明:
1. 问题:那个“只会死记硬背的机器人”
目前的机器人就像背熟了剧本的演员。如果剧本写着“拿起红色的杯子”,它们就会照做。但如果你让它们“拿起蓝色的杯子”(即使它们以前见过蓝色杯子),或者杯子在一个奇怪的位置,它们往往会失败。它们缺乏方向感。它们不知道自己是离目标更近了,还是更远了。
2. 解决方案:那个“指南针”(对比强化学习)
PRTS 为机器人的大脑添加了一个“指南针”。它使用一种称为对比强化学习的技术。
- 类比:想象你在黑暗的森林里试图寻找篝火(目标)。
- 旧式机器人:它们只记得上次走过的路径。如果树木移动了,它们就会迷路。
- PRTS:它学会提问:“如果我迈出这一步,我是否离篝火更近了?”它不需要地图,也不需要老师每一步都告诉它“做得好!”相反,它通过比较两件事来学习:
- “如果我执行这个动作,它看起来是否像是在朝着目标前进?”(是/好)。
- “如果我执行另一个动作,它看起来是否像是在朝着不同的目标前进?”(否/坏)。
通过数百万次的这样的练习,机器人构建了一个内部地图,其中每个动作都根据它实现你用文字给出的特定目标的可能性进行评分。
3. 魔法技巧:同时做两件事
通常,教机器人“理解目标”和教它“移动手臂”是两个独立的课程。你先教大脑,再教肌肉。这既缓慢又昂贵。
PRTS 的巧妙之处在于它在同一堂课中同时学习这两者。
- 类比:想象一个学生参加考试,必须在同一张纸上写一篇文章(动作)并解决一道数学题(目标)。
- PRTS 通过在机器人的输入端添加两个微小且不可见的“便利贴”来实现这一点。一张便签追踪动作,另一张追踪目标。
- 机器人的大脑处理整个场景,写出动作,同时检查“数学题”(这个动作是否让我离目标更近了?),而不会减慢速度。它的效率如此之高,以至于所需的计算能力几乎与旧式、更简单的方法相同。
4. 结果:那个能够“思考”的机器人
作者在模拟环境和真实机器人(双臂和单臂)上测试了 PRTS。以下是发生的情况:
- “长视野”测试:当被要求执行一系列长链条任务(例如“泡茶”,涉及烧水、拿杯子、加茶叶等)时,PRTS 没有在中途迷路。它不断检查自己的“指南针”,以确保自己仍在正轨上。
- “新指令”测试:如果你告诉机器人去“拿起蓝色的积木”而不是它训练过的红色积木,它能立即明白。它不只是死记硬背“抓取位置 X 的物体”;它理解了“抓取与单词‘蓝色’匹配的物体”。
- “人类干扰”测试:这是最令人印象深刻的部分。想象机器人正在将一个积木放在桌子上,而一个人突然把积木抢走并放回另一个位置。
- 旧式机器人:它们会感到困惑,试图将积木放在它原本的位置,或者直接停止。
- PRTS:它立刻意识到:“哦,目标仍然是‘把积木放在桌子上’,但积木移动了。我需要再去把它拿回来。”它会恢复并完成任务,就像人类一样。
总结
PRTS 是一个不再仅仅“模仿”而是开始“推理”的机器人大脑。它通过不断提问“这一步是否让我离被要求做的事情更近了?”,学会将词语(目标)与动作联系起来。
因为它利用海量数据从头开始学习这种“方向感”,所以在处理新情况、长任务和错误方面,它比以前的机器人表现得更出色。它将机器人从盲目的模仿者转变为一个以目标为导向的助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。