← 最新论文
⚡ electrical engineering

Density-Ratio Weighted Behavioral Cloning: Learning Control Policies from Corrupted Datasets

本文介绍了密度比加权行为克隆,这是一种鲁棒的离线强化学习方法,它利用少量干净参考集来估计并应用密度比权重,从而在无需预先了解污染机制的情况下,从受对抗攻击或低质量样本严重污染的 datasets 中学习近优控制策略。

原作者: Shriram Karpoora Sundara Pandian, Ali Baheri

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Shriram Karpoora Sundara Pandian, Ali Baheri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人如何驾驶汽车。你拥有一个庞大的驾驶视频库供机器人学习。这被称为“离线学习”——机器人从静态数据集中学习,而不是在现实中四处驾驶并发生碰撞。

然而,这里有一个问题:有人篡改了视频库。

  • 有些视频显示汽车驶下悬崖(坏数据)。
  • 有些视频中方向盘无缘无故疯狂旋转(损坏数据)。
  • 有些视频显示汽车完美行驶,但结尾的“得分”却是"0 分”而非"100 分”(被投毒的奖励)。

如果你将这些视频同等地展示给机器人,它就会学会驶下悬崖或让车轮空转。它会认为这些糟糕的行为是正常的,因为它们存在于数据集中。

本文介绍了一种名为加权行为克隆(Weighted Behavioral Cloning)的新方法来解决这一问题。以下是其工作原理,使用简单的类比进行说明:

1. “受信任的图书管理员”(参考集)

研究人员假设你拥有一个微小的特殊视频文件夹,你确信这些视频是 100% 完美的。也许这些是专业试驾的录像,工程师已验证了每一个动作。他们称之为参考集。与庞大而混乱的图书馆相比,它很小,但它是纯金。

2. “侦探”(判别器)

该方法使用一个智能 AI“侦探”(称为判别器)。它的唯一任务是查看来自混乱图书馆的视频,并问道:“这看起来像受信任文件夹里的视频,还是看起来很奇怪?”

  • 如果视频看起来像受信任的专家驾驶,侦探会说:“是的,这是好的!”
  • 如果视频显示汽车撞向墙壁或方向盘随机旋转,侦探会说:“不,这很可疑。”

3. “加权课程”(魔法技巧)

在常规学习中,机器人将每个视频视为同等重要。在这种新方法中,机器人听从侦探的判断。

  • 好视频:侦探给予它们高权重。机器人会密切关注这些视频。
  • 坏视频:侦探给予它们极低的权重(或几乎为零)。机器人基本上会忽略它们,即使它们仍存在于数据集中。

机器人不需要知道数据是如何被篡改的(无论是传感器故障、黑客攻击还是输入错误)。它只需要知道:“这看起来像我信任的专家吗?”

4. 结果:“坚不可摧的学生”

研究人员在机器人计算机模拟(如奔跑的猎豹或平衡行走的机器人)上测试了这种方法。他们以四种恶劣的方式破坏了数据:

  • 动作投毒:将机器人的动作改为随机。
  • 状态投毒:模糊机器人的“眼睛”(传感器数据)。
  • 转换投毒:使视频跳跃,导致因果关系断裂。
  • 奖励投毒:谎报机器人的表现。

结果
即使**80% 到 100%**的数据被破坏(意味着几乎整个图书馆都是垃圾),使用这种新方法的机器人仍然几乎完美地学会了驾驶。

  • 旧方法(如标准行为克隆)彻底失败,学会了驶下悬崖。
  • 这种新方法保持了机器人的稳定性和效率,忽略了垃圾,只专注于它能找到的少量干净视频。

为什么这很重要

本文从数学上证明,即使数据集中的“垃圾”非常巨大,该方法依然有效。这就像有一个学生,坐在一个满是人大喊胡言乱语的房间里,但因为有一位受信任的老师在低声说出正确答案,他仍然能以优异的成绩通过考试。

简而言之:本文教导机器人如何通过将所有内容与一小部分经过验证的“好”数据进行比较来忽略坏数据,从而确保即使在训练数据遭到破坏的情况下,它们也能学会正确的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →