想象一下,你正在试图教一个机器人如何摆放餐具。在过去,如果机器人摔碎了一个盘子,你只会说:“做得不好。”如果它完美地摆好了餐具,你会说:“做得好。”这就像是给机器人一个简单的“点赞”或“踩雷”。
问题在于,“摆放餐具”是一项复杂的任务。你可能希望机器人动作快,但也希望它动作轻柔,以免打碎瓷器。你可能希望它整洁,但也希望它小心,不要把刀尖对着客人。如果你只给出“好”或“坏”的反馈,机器人会感到困惑。是因为它太慢了?是因为它太粗鲁了?还是因为叉子摆歪了?这就像是一个学生考试不及格,老师却只在卷子上写了一个“不及格”,而没有写任何评语一样。
由此,诞生了“自由形式偏好学习”(Freeform Preference Learning,简称 FPL)。
你可以把 FPL 想象成改变了老师的评分风格。不再只是给出一个最终成绩,老师(人类)可以在考试的不同部分写下具体的评语。
旧方法:“总分制”
在传统的方法中,人类观察两个机器人尝试摆放餐具的视频,然后从中选出一个胜者。
- 视频 A: 速度极快,但摔碎了杯子。
- 视频 B: 非常缓慢,但摆放得完美无缺。
- 人类的困境: “哪一个更好?”这是一个很难抉择的问题。人类必须将所有这些不同的特质(速度、安全性、整洁度)压缩成一个单一的“胜者”。这产生了一个模糊且混乱的信号。
新方法:“自由形式”反馈
通过 FPL,人类可以成为一名具体的评论家。他们可以说:
- “在速度这个维度上,视频 A 胜出。”
- “在安全性这个维度上,视频 B 胜出。”
- “在整洁度这个维度上,视频 B 胜出。”
机器人不再仅仅学习“好”或“坏”。它学习的是一张多维度的地图。它明白“速度”是一回事,“安全性”是另一回事,并且它可以平衡这两者。
它是如何运作的(比喻)
想象机器人是一位新厨师。
- 菜单(维度): 不再只是问“食物好吗?”,而是要求厨师根据特定的标准来评判食物:“够咸吗?”“够热吗?”“摆盘漂亮吗?”
- 品尝(训练): 人类品尝两道不同的菜肴。人类不再只是说“我喜欢 A 菜”,而是说“A 菜更咸一些,但 B 菜更热一些”。
- 学习: 机器人建立了一个心理模型,能够理解:“啊,当人类说‘更咸’时,他们指的是这种特定的口味特征。当他们说‘更热’时,指的是温度。”
- 结果: 稍后,人类可以告诉机器人:“今晚,我想要一道非常热的菜,哪怕味道淡一点也没关系。”因为机器人已经学习了独立的“维度”(咸度 vs 热度),它可以立即调整烹饪风格,而无需从头开始重新训练。
研究发现
研究人员在真实的机器人执行任务(如折叠短裤、把吐司放在盘子里和摆放餐具)时测试了这一方法。
- 更好的结果: 使用这种“自由形式”方法训练的机器人,在完成任务方面的表现比使用传统的“点赞/踩雷”方法的机器人高出 38%。
- 更聪明的行为: 机器人学会了组合它们从未见过的技能。例如,如果训练数据展示了“左手动作快”和“右手动作慢”,机器人可以通过结合“快”和“右”的概念,推导出如何进行“右手动作快”。
- 最后一刻的转向: 因为机器人学习了独立的“维度”,你可以在最后一刻改变它的行为。你可以通过改变指令来告诉它,“今天请非常小心”或者“今天请非常快速”,而无需重新教授它新的移动方式。
为什么这很重要
该论文认为,对于复杂的长期任务,要求人类做出单一的“最佳”选择过于模糊。通过让人们能够使用自然语言来讨论他们关心的具体事物(比如“不要打碎盘子”或“动作快一点”),我们为机器人提供了更清晰、更密集且更有用的行为指南。它将一个令人困惑的“不及格”成绩,变成了一份能真正帮助机器人进步的详细成绩单。
技术摘要:面向机器人操控的自由形式偏好学习 (Freeform Preference Learning)
问题陈述
奖励设计仍然是自主机器人策略改进的关键瓶颈,尤其是在长程(long-horizon)操控任务中。现有方法面临显著局限性:
- 稀疏奖励: 二元成功/失败标签对于复杂的任务无法提供足够的信号,而在这些任务中,中间阶段的进展至关重要。
- 模糊的二元偏好: 传统的偏好学习(例如 Bradley-Terry 模型)要求标注者将多个相互竞争的概念(例如速度 vs. 安全性)压缩为单一的“总体”二元标签。这会产生歧义,特别是在比较不同任务阶段的轨迹片段时。
- 僵化的奖励函数: 人工设计的标量奖励往往无法捕捉人类意图的全貌,例如卫生、正式程度或细致程度,从而在优化过程中导致不希望看到的下游行为。
本文认为,保留人类判断的多维特性对于学习能够捕捉用户所有意图维度的鲁棒策略至mathcal{essential}。
方法论:自由形式偏好学习 (FPL)
FPL 引入了一个框架,用于从通过自然语言定义的自由形式人类偏好中学习机器人策略,而不是将反馈压缩为单一标量。该方法由三个核心组件组成:
1. 自由形式偏好采集
与其询问“哪条轨迹总体更好?”,FPL 让标注者观察轨迹对,并要求他们:
- 定义特定的偏好轴(preference axes)并使用自然语言描述(例如“速度”、“安全性”、“设置的正式程度”、“平滑度”)。这些轴可以是预定义的,也可以是标注者在过程中指定的。
- 为每个定义的轴(lk)提供成对的偏好值(yk∈{0,1})。
这产生了一个包含轨迹对、自然语言标签和各轴二元偏好的数据集 P。
2. 语言调节的奖励学习
FPL 学习一个以自然语言轴描述为条件的单一奖励模型 rϕ,并利用预训练视觉语言模型(VLM)的表示。
- 轴调节评分: 对于轨迹对 (τi,τj) 和一组轴 {(lk,yk)},模型通过最小化修正后的 Bradley-Terry 损失进行训练:
LFPL−Reward(ϕ)=−Ek=1∑Kijlogσ((2yk−1)[rϕ(τi∣lk)−rϕ(τj∣lk)])
- 时间建模: 与仅对单个观测值进行评分的标准模型不同,FPL 将奖励条件设定为观测历史。轨迹级奖励定义为各前缀得分之和:
rϕ(τ,lk)=i=1∑Tgϕ(o1:i,lk)
其中 gϕ 是一个多模态 Transformer。这使得模型能够捕捉评估轨迹级偏好所需的时间依赖性。
3. 多维策略提取
FPL 并不将学习到的多维奖励压缩为一个加权标量(这会带来奖励黑客/reward hacking 的风险),而是训练一个同时以自然语言轴和其对应奖励分数为条件的策略 πθ。
- 策略通过在数据集中进行行为克隆(或离线强化学习)来训练,其中动作是以轴集合 L={l1,…,lKπ} 及其关联奖励 rϕ(τ∣lk) 为条件的。
- 迭代训练: 该过程可以是迭代的。随着策略的改进,标注者可以提供更精细的反馈,且轴的集合可以不断扩展,从而形成自然的课程学习。
- 测试时可控性: 在推理阶段,可以通过改变以特定轴为条件的靶向奖励值,来引导策略表现出特定的行为,而无需重新训练。
核心贡献
- 自由形式偏好学习 (FPL): 一种新型方法,用于提取并从多维、自然语言的人类偏好中学习,避免了“总体”二元标签带来的歧义。
- 语言调节的奖励模型: 一个将轨迹和自然语言轴描述映射到标量分数的奖励函数,能够从单一模型中学习多样化的属性(质量、速度、安全性、卫生程度)。
- 组合性与可控性: 该框架使策略能够表现出组合行为(结合数据中未曾共同出现的特征),并允许通过调整奖励调节来实现测试时的行为转向。
- 无需分割的稠密监督: FPL 可以在无需显式子任务分割或人工奖励塑造的情况下,为长程任务学习稠密的进度信号。
实验结果
作者在四个现实世界任务(将方块放入碗中、折叠短裤、摆放吐司、布置餐桌)和两个模拟任务(物体重排、双模态正方形)上评估了 FPL。
- 性能: 在现实世界任务中,FPL 平均比基准方法(包括稀疏奖励、二元偏好学习和加权回归)高出 38 个百分点。
- 模拟环境: 在“双模态正方形”任务中,即使训练数据仅包含针对另一个插销的快速示例,FPL 也成功组合了行为(快速将螺母放在一个插销上)。此外,它通过改变奖励调节,使用相同的策略在“反向”任务(左侧插销)上也实现了高性能,这是基准方法所不具备的能力。
- 奖励密度: 定性分析显示,FPL 的轴调节奖励在特定的子任务事件(如放置杯子)周围具有时间局部性,而二元偏好奖励则会产生模糊的后期峰值。
- 标注效率: 获取自由形式偏好的速度比收集单一二元偏好快约 50%,因为观看视频的成本被分摊到了多个轴特定的判断中。
意义与主张
本文声称 FPL 解决了机器人领域捕捉人类意图“多维性”的根本挑战。通过保留而非压缩人类反馈的结构,FPL:
- 为策略优化提供了更稠密、歧义更少的监督。
- 实现了组合泛化,允许机器人以并非在数据中显式演示的方式组合学习到的行为(例如速度 + 安全性)。
- 提供了测试时可控性,允许用户调整机器人行为(例如优先考虑速度而非细腻度)而无需重新训练。
- 证明了自然语言是一种可行且有效的界面,用于定义奖励轴,超越了僵化的、预定义的奖励结构。
作者总结道,虽然偏好学习比无监督方法成本更高,但 FPL 显著提升了所学策略的质量和灵活性,使其成为现实世界机器人学习的一个极具前景的方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。