← 最新论文
🤖 machine learning

E2HiL: Entropy-Guided Sample Selection for Efficient Real-World Human-in-the-Loop Reinforcement Learning

本文提出了 E2HiL,一种用于真实世界人机回环强化学习的熵引导样本选择框架,该框架通过主动过滤掉噪声和捷径样本,仅保留对策略熵具有中度影响的样本,从而提高了样本效率和成功率。

原作者: Haoyuan Deng, Yudong Lin, Yuanjiang Xue, Haoyang Du, Qianzhun Wang, Boyang Zhou, Zhenyu Wu, Ziwei Wang

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyuan Deng, Yudong Lin, Yuanjiang Xue, Haoyang Du, Qianzhun Wang, Boyang Zhou, Zhenyu Wu, Ziwei Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是工厂车间的专家,能够以极高的精准度执行重复性任务。然而,当被要求在人类家庭或动态车间这种混乱且不可预测的环境中导航时,它们往往会步履蹒跚。核心难点在于如何教会机器去适应。传统的编程方法之所以失效,是因为它无法涵盖现实世界中所有可能的变数。相反,研究人员转向了一种让机器人通过实践来学习的方法:尝试动作、失败,并缓慢地摸索出行之有效的方法。这种被称为“强化学习”的过程虽然强大,但极其缓慢且成本高昂。为了加速这一过程,科学家们将人类教师引入了循环之中。当机器人犯错时,人类可以介入、纠正动作,并向机器展示正确的方法。这种“人机协同”(human-in-the-loop)的方法展现出了前景,但也付出了沉重的代价:它需要大量的人力与时间,且往往会让教师因处理不必要的纠正工作而感到精疲力竭。

现在,一组研究人员开发出了一种更智能的管理这种伙伴关系的方法,他们称之为 E2HiL 系统。E2HiL 不再接受人类提供的每一次纠正,而是作为一个敏锐的编辑,决定哪些教训是真正有价值的,而哪些只是干扰。研究人员发现,高效学习的关键在于一个被称为“熵”的概念,在这种语境下,它衡量的是机器人在探索新可能性与固守已知知识之间的比例。如果机器人过快地变得过于自信,它就会停止探索并陷入局部最优解,从而错过更好的完成任务的方式。反之,如果它保持过度的不确定性,则会在漫无目的的徘徊中浪费时间。团队发现,现有方法往往会导致机器人的信心过早崩溃,使其在真正掌握任务之前就放弃了探索。

为了解决这个问题,E2HiL 系统会分析机器人与人类之间的每一次交互,以评估其对机器人学习曲线的影响。它寻找数据中的一种特定模式:即那些导致机器人信心骤降或几乎没有任何影响的交互。系统将这些识别为“捷径”样本(即人类可能通过强行快速修复来阻止机器人理解底层机制)和“噪声”样本(即微小到无法增加任何价值的纠正)。通过过滤掉这些无用的时刻,该系统确保机器人只从那些能带来稳定、可控的不确定性降低的干预中学习。这使得机器人能够在尝试新事物与精炼技能之间保持健康的平衡,从而以更少的人类疲劳实现更快的精通。

研究人员在十种不同的现实任务中测试了这种方法,使用了各种机械臂,涵盖了从简单的拾取与放置操作到复杂的折叠毛巾和插入方块等操控任务。他们将新系统与当前最先进的人类引导学习方法进行了对比。结果令人瞩目:E2HiL 框架将机器人的成功率提高了近 25%,同时将人类干预的次数减少了约 9%。在涉及触摸方块的一个特定任务中,该系统允许机器人按顺序学习两种不同的技能,而标准方法则难以跨越第一个技能阶段。该系统实现这一目标并非通过改变机器人的硬件或其基础学习算法,而仅仅是通过对用于更新其“大脑”的数据进行更具选择性的筛选。

这项发现之所以意义重大,是因为该系统无论针对特定的机器人还是特定类型的任务都能奏效。它作为一个“即插即用”的模块,可以添加到现有的学习框架中,而无需进行彻底的重新设计。研究人员证实,该方法并不依赖于完美的初始猜测或完美无瑕的数据;它会随着机器人的学习而调整,即使在早期数据不完美的情况下也能稳定学习过程。通过关注人机交互的质量而非仅仅是数量,E2HiL 表明,高效机器人学习的路径不在于投入更多的人力,而在于更聪明的筛选。这种方法为在人类时间和注意力作为有限资源的现实环境中部署机器人提供了清晰的前进方向,证明了有时教导机器最有效的方式,是教它学会忽略什么。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →