DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation
DISC 框架通过利用超网络直接从指令生成特定于任务的策略参数,从而在语言条件化操作任务中消除了观测泄露,从结构上将语言 grounding 与视觉状态处理解耦,并相较于纠缠式基线及大规模预训练模型实现了更优越的性能与泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《DISC:通过策略生成解耦指令与状态条件控制》的通俗解释,辅以生动的类比。
核心难题:那个会“作弊”的机器人
想象一下,你正在教机器人做饭。你给它提供两条信息:
- 食谱(指令): “把平底锅放到炉灶上。”
- 视野(观测): 一段摄像头画面,显示着一个带有炉灶、平底锅和盘子的厨房。
在大多数现有的机器人中,“大脑”会同时处理食谱和摄像头画面,将它们混合成一锅大数据汤。论文将这种现象称为**“任务 - 状态纠缠”**。
作弊代码:
因为机器人在训练数据中经常同时看到炉灶和平底锅,它学会了一个捷径。它不再阅读食谱,只是盯着图片看。
- 场景: 你说:“把平底锅放到炉灶上。”机器人看到了炉灶和平底锅,于是就把锅放到了那里。
- 陷阱: 接着你说:“把平底锅放到盘子上。”机器人仍然在图片里看到了炉灶和平底锅。因为它学会了忽略文字、只根据图片做出反应,它可能仍然试图把锅放到炉灶上,或者感到困惑,因为它从未真正学会听从你的具体指令。它从视觉场景中“泄露”了答案,而不是将其扎根于语言之中。
解决方案:DISC(“定制西装”裁缝)
作者提出了一种构建机器人大脑的新方法,称为DISC。与其将食谱和视野混合在一起,他们选择将它们完全分离。
把 DISC 想象成一位定制西装裁缝,而不是提供均码制服的工厂。
- 裁缝(超网络): 这是一个特殊的 AI,它只听从你的声音(指令)。它看不见厨房。它的唯一工作就是听“把平底锅放到炉灶上”,然后编织一个全新的、专门针对该特定任务的定制大脑。
- 西装(生成的策略): 一旦裁缝编织完毕,就会交给你一个定制大脑(一组数学权重)。这个大脑现在被“硬连线”为知道它是一个“炉灶任务”大脑。
- 穿着者(机器人): 机器人穿上这个定制大脑。现在,它看着厨房(视野)并行动。关键在于,它再也听不到你的声音了。它只能根据被赋予的定制大脑来行动。
这如何阻止作弊:
由于机器人的大脑是完全根据你的话语构建的,它别无选择,只能听从你。它无法看着图片猜测该做什么,因为图片不被允许直接与大脑对话。机器人知道该做什么的唯一途径,是因为你的话语构建了它的大脑。
如何制造“定制大脑”(两阶段过程)
仅凭一句话就制造一个全新的大脑是很困难的。如果你只是让计算机“为这句话制造一个大脑”,它可能会制造出一个混乱、破碎的大脑。
DISC 通过两阶段构建解决了这个问题:
- 草稿(权重初始化): 裁缝根据话语快速勾勒出一件粗糙的西装。它大致符合正确的形状(例如,它知道这是一个烹饪任务,而不是清洁任务),但纽扣的位置可能不对。
- 剪裁(迭代优化): 这是论文的巧妙之处。裁缝不只是猜测;他们使用一种“心理模拟”来想象通常如何修改西装。他们审视草稿,想象哪里出了问题,然后进行微小而精确的调整。他们以极快的速度反复这样做,直到西装完美合身。
- 注意: 他们这样做并不需要实际执行缓慢、繁重的真实训练数学运算。他们通过观察大量示例学会了如何修改西装,因此可以在脑海中瞬间完成。
实验中发生了什么?
作者在计算机模拟中的机器人以及真实的机械臂上测试了这种方法。
- “视觉陷阱”测试: 他们设计了一个棘手测试,要求机器人拿起一个红苹果,并将其放入特定的碗中(小灰碗、大红碗或浅灰碗)。视觉场景每次都完全相同;只有文字发生了变化。
- 旧机器人: 感到困惑。它们看到了苹果和碗,但由于依赖视觉捷径,它们经常把苹果放错碗,或者卡住。
- DISC: 几乎每次都做对了。因为它的大脑是专门为“红苹果 -> 小灰碗”构建的,它忽略了视觉干扰并遵循了指令。
- 学习速度: 当仅给出新任务的少量示例(如 1 次或 3 次尝试)时,DISC 的学习速度远快于旧机器人。这是因为它的“裁缝”已经知道了工作的整体形状,只需要稍微调整西装,而不需要从零开始学习。
- 复杂性: 任务越复杂(例如“打开炉灶,然后把平底锅放上去”),DISC 的表现就比其他方法越好。那些“作弊”的机器人在长任务中表现糟糕,因为它们迷失了方向,而 DISC 则保持了正轨。
总结
该论文认为,当前的机器人太擅长根据所见进行猜测,这使得它们难以遵循具体的指令。
DISC 通过改变架构解决了这个问题:
- 旧方法: 将文字和图片混合在一起 机器人学会忽略文字,仅根据图片猜测。
- DISC 方法: 利用文字构建一个定制大脑 机器人使用该大脑来观察图片。
通过迫使机器人仅根据指令构建自己的“特定任务大脑”,它确保了机器人真正理解你要求它做什么,而不仅仅是对场景做出反应。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。