长期以来,机器人一直是工厂车间的专家,能够以极高的精准度执行重复性任务。然而,当被要求在人类家庭或动态车间这种混乱且不可预测的环境中导航时,它们往往会步履蹒跚。核心难点在于如何教会机器去适应。传统的编程方法之所以失效,是因为它无法涵盖现实世界中所有可能的变数。相反,研究人员转向了一种让机器人通过实践来学习的方法:尝试动作、失败,并缓慢地摸索出行之有效的方法。这种被称为“强化学习”的过程虽然强大,但极其缓慢且成本高昂。为了加速这一过程,科学家们将人类教师引入了循环之中。当机器人犯错时,人类可以介入、纠正动作,并向机器展示正确的方法。这种“人机协同”(human-in-the-loop)的方法展现出了前景,但也付出了沉重的代价:它需要大量的人力与时间,且往往会让教师因处理不必要的纠正工作而感到精疲力竭。
现在,一组研究人员开发出了一种更智能的管理这种伙伴关系的方法,他们称之为 E2HiL 系统。E2HiL 不再接受人类提供的每一次纠正,而是作为一个敏锐的编辑,决定哪些教训是真正有价值的,而哪些只是干扰。研究人员发现,高效学习的关键在于一个被称为“熵”的概念,在这种语境下,它衡量的是机器人在探索新可能性与固守已知知识之间的比例。如果机器人过快地变得过于自信,它就会停止探索并陷入局部最优解,从而错过更好的完成任务的方式。反之,如果它保持过度的不确定性,则会在漫无目的的徘徊中浪费时间。团队发现,现有方法往往会导致机器人的信心过早崩溃,使其在真正掌握任务之前就放弃了探索。
为了解决这个问题,E2HiL 系统会分析机器人与人类之间的每一次交互,以评估其对机器人学习曲线的影响。它寻找数据中的一种特定模式:即那些导致机器人信心骤降或几乎没有任何影响的交互。系统将这些识别为“捷径”样本(即人类可能通过强行快速修复来阻止机器人理解底层机制)和“噪声”样本(即微小到无法增加任何价值的纠正)。通过过滤掉这些无用的时刻,该系统确保机器人只从那些能带来稳定、可控的不确定性降低的干预中学习。这使得机器人能够在尝试新事物与精炼技能之间保持健康的平衡,从而以更少的人类疲劳实现更快的精通。
研究人员在十种不同的现实任务中测试了这种方法,使用了各种机械臂,涵盖了从简单的拾取与放置操作到复杂的折叠毛巾和插入方块等操控任务。他们将新系统与当前最先进的人类引导学习方法进行了对比。结果令人瞩目:E2HiL 框架将机器人的成功率提高了近 25%,同时将人类干预的次数减少了约 9%。在涉及触摸方块的一个特定任务中,该系统允许机器人按顺序学习两种不同的技能,而标准方法则难以跨越第一个技能阶段。该系统实现这一目标并非通过改变机器人的硬件或其基础学习算法,而仅仅是通过对用于更新其“大脑”的数据进行更具选择性的筛选。
这项发现之所以意义重大,是因为该系统无论针对特定的机器人还是特定类型的任务都能奏效。它作为一个“即插即用”的模块,可以添加到现有的学习框架中,而无需进行彻底的重新设计。研究人员证实,该方法并不依赖于完美的初始猜测或完美无瑕的数据;它会随着机器人的学习而调整,即使在早期数据不完美的情况下也能稳定学习过程。通过关注人机交互的质量而非仅仅是数量,E2HiL 表明,高效机器人学习的路径不在于投入更多的人力,而在于更聪明的筛选。这种方法为在人类时间和注意力作为有限资源的现实环境中部署机器人提供了清晰的前进方向,证明了有时教导机器最有效的方式,是教它学会忽略什么。
技术摘要:E2HiL —— 用于高效现实世界人机回环强化学习的熵引导样本选择
1. 问题陈述
现实世界的机器人操控面临着样本效率低和人力成本高的重大挑战。虽然人机回环强化学习(HiL-RL)利用人类纠正性接管来加速策略学习,但现有的框架存在样本效率低下的问题。它们通常将所有干预样本同等对待,未能区分具有信息量的引导与无用的修正。这导致了:
- 无效的人力投入: 需要大量的专家干预才能实现收敛,从而导致高昂的人力成本。
- 不稳定的熵动力学: 均匀采样往往会导致策略熵过早崩溃(导致次优收敛)或由于噪声样本导致更新无效。
- 探索与利用的不平衡: 在样本层面无法调节熵,阻碍了探索新状态与利用已知技能之间的权衡。
核心要解决的问题是:如何通过主动选择具有信息量的样本,而非平等使用所有可用数据,来实现稳定且样本高效的现实世界 HiL-RL。
2. 方法论:E2HiL 框架
作者提出了 E2HiL,一个将熵引导的主动样本选择集成到 HiL-RL 流水线中的框架。该方法基于这样一个前提:策略熵的稳定下降与提高样本效率以及更好的探索-利用权衡相关联。
A. 样本熵动力学估计
该框架使用**影响函数(influence function)**来量化每个样本 (st,at) 对策略熵的影响。
- 理论基础: 借鉴近期在大语言模型强化学习(LLM RL)中的发现,作者通过动作对数概率与软优势(soft advantages)之间的协方差来近似策略熵的变化 (ΔH)。
- 影响值 (c(st,at)): 样本的影响值估计为:
c(st,at)≈−η⋅Cov(logπθ(at∣st),πθ(at∣st)⋅Asoft(st,at))
其中 Asoft 是软优势,η 是学习率。
- 解读:
- 高正协方差表示会导致熵急剧下降的样本(潜在的“捷径”样本,会导致过早崩溃)。
- 接近零的协方差表示对熵几乎没有影响的“噪声”样本。
B. 熵约束样本选择
为了稳定学习,E2HiL 采用了一种基于估计影响值来剔除无信息样本的选择机制。
- 动态边界: 框架定义了一个用于绝对影响值 ∣c(st,at)∣ 的自适应区间 [ℓ,u]。这些边界是按批次(per batch)计算的(例如,使用第 5 和第 90 百分位数)。
- 剔除策略:
- 捷径样本(Shortcut Samples): 具有极高影响值(导致熵急剧下降)的样本会被屏蔽,以防止策略过早崩溃。
- 噪声样本(Noisy Samples): 具有微弱影响(接近零协方差)的样本会被屏蔽,以防止减慢学习速度。
- 保留(Retention): 只有具有“中等”影响值的样本会被保留用于策略更新。
- 目标函数: Actor 损失函数被修改,包含一个指示函数 I(st,at),当样本落在边界内时为 1,否则为 0:
LE2HiL(θ)=−∑I(st,at)+ϵ∑I(st,at)⋅lt
这确保了梯度仅针对符合熵一致性的样本进行计算。
3. 主要贡献
- E2HiL 框架: 提出了一种高效的现实世界 HiL-RL 框架,通过基于熵动力学主动选择信息量样本,降低了人类干预成本。
- 样本级熵表征: 推导了影响函数,通过动作概率与软优势的协方差来表征单个样本如何影响策略熵。这使得识别并移除“捷径”样本和“噪声”样本成为可能。
- 实证验证: 在涉及多种具身智能体(Lerobot SO-101 和 A1 X 手臂)和学习框架的 10 个现实世界操控任务中进行了广泛评估。
4. 实验结果
论文在现实场景中将 E2HiL 与最先进的基准模型(HIL-SERL 和 ConRFT)进行了对比验证:
- 成功率: 与基准模型相比,E2HiL 将平均成功率提高了 24.9%。具体而言,在 Lerobot 平台上,它在四个任务中的成功率相对提升了 45%。在 A1 X 平台上,它比 HIL-SERL 平均提高了 17.5%,比 ConRFT 提高了 6.6%。
- 人类干预: 该框架将平均人类干预率降低了 9.3%(Lerobot 为 10.1%,A1 X 为 9.4%),显著降低了劳动力成本。
- 熵稳定性: E2HiL 维持了更平滑的熵曲线,避免了基准模型中观察到的过早崩溃。这使得智能体能够更有效地继续探索并习得多种技能(例如,处理不同位置的物体)。
- 消融实验: 与随机丢弃、优势裁剪(advantage clipping)和空间裁剪(spatial clipping)的比较证实,性能提升专门源于熵信息引导的样本选择,而非通用的正则化或数据缩减。该方法对超参数(裁剪边界和蒙特卡洛采样计数)的变化具有鲁棒性,并且不依赖于训练早期阶段完美的 Q 值估计。
5. 意义与主张
作者将 E2HiL 定位为一个与策略和具身智能无关的即插即用模块。其意义在于:
- 泛化性: 它可以在不同的机器人平台和学习框架下有效运行,无需进行特定架构的修改。
- 高效性: 它通过过滤掉无用的干预,解决了现实世界 RL 中人力成本这一关键瓶颈,从而加速了收敛。
- 理论洞察: 它架起了 LLM-RL 发现(关于熵动力学)与机器人操控之间的桥梁,证明了在样本层面调节熵对于稳定的现实世界学习至关重要。
论文得出结论,熵引导的样本选择是实现减少人类监督下的稳健技能获取的一种极具前景的策略,为实现更具扩展性的现实世界多任务 RL 铺平了道路。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。