Corruption Robust Offline Reinforcement Learning with Human Feedback
本文介绍了首个具有可证明鲁棒性的离线人类反馈强化学习(RLHF)算法,该算法通过学习带有置信集的奖励模型,并利用基于抗污染鲁棒 RL Oracle 的悲观优化,能够从包含 比例受损轨迹-反馈对的数据集中识别出近优策略。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人玩一款复杂的电子游戏。通常情况下,你会让机器人去玩,观察它的表现,然后根据它的表现好坏告诉它:“做得好!”或“做得不好!”这就是基于人类反馈的强化学习 (RLHF)。
然而,在现实世界中,你收集到的数据并不完美。有时,提供反馈的人会因为疲劳而犯错(噪声)。有时,恶意的黑客可能会故意调换“好”与“坏”的标签来欺骗机器人(破坏/篡改)。
这篇论文解决了一个特定的、棘手的难题:如何在不让机器人再次参与游戏(离线)的情况下,利用一个部分被投毒或损坏的数据集来教机器人玩得出色?
以下是他们解决方案的简单拆解,使用了富有创意的类比。
核心问题:“被投毒的食谱书”
想象一下,你想学习如何烘焙出完美的蛋糕。你有一本食谱书(数据集),里面有 1,000 个食谱。但是,一名对手偷偷修改了其中的 10%。有些食谱说“加盐”其实应该是“加糖”,有些配料也被写错了。
如果你盲目地遵循这本书,你会烤出一个糟糕透顶的蛋糕。如果你尝试通过烘焙和品尝来学习(在线强化学习),你可能会生病或者浪费大量的食材。作者们想要研究的方法是:如何观察这本被投毒的食谱书,分辨出哪些食谱很可能是真实的,并教机器人最好的烘焙方法,而无需踏入厨房一步。
三步走策略
作者提出了一个三步走的“侦探”流程来解决这个问题:
1. “真相探测器”(鲁棒奖励学习)
首先,机器人需要理解什么是“好”。在论文中,这被称为学习一个奖励模型 (Reward Model)。
- 类比: 想象你正试图根据一份销售清单来猜测房子的真实价格。其中一些条目是假的(例如,一座豪宅被标价为 50 美元)。
- 方法: 作者没有使用平均值(这会被假数据带偏),而是使用了一种叫做修剪最大似然法 (Trimmed Maximum Likelihood) 的技术。你可以把它想象成一个聪明的过滤器,它会说:“我要忽略掉那 10% 最离谱、最可疑的数字,只信任中间 90% 的数据。”这让他们即使在数据存在谎言的情况下,也能得到一个关于人类真实偏好的“干净”估计。
2. “安全网”(置信集)
一旦他们得到了对真实奖励的“最佳猜测”,他们并不会盲目信任它。他们会构建一个置信集 (Confidence Set)。
- 类比: 想象一位侦探说:“我有 95% 的把握确定凶手就在这个特定的社区里。”于是他在那个社区周围画了一个圈。他知道凶手就在这个圈内的某个地方,但他并不确定确切的位置。
- 方法: 他们在奖励估计周围建立了一个数学上的“气泡”。他们知道真实的奖励就在这个气泡之内,即便他们不知道精确的中心点在哪里。
3. “谨慎的规划者”(悲观策略)
现在,机器人需要决定采取哪些行动。由于数据是受损的,机器人应当是悲观的(谨慎的)。
- 类比: 想象你在穿行于一片大雾弥漫的森林,有些路径虽然标着“安全”,但实际上可能是陷阱。一个谨慎的徒步旅行者不会仅仅选择看起来最好的路径;他会选择一条即使在雾气笼罩的最坏情况下也依然安全的路径。
- 方法: 机器人会观察“安全网”(置信集)中的每一条可能路径,并询问:“如果我走这条路,我能得到的最小奖励是多少?”然后,它会选择那条能使这个“最坏情况下的奖励”最大化的路径。这确保了即使数据被轻微篡改,机器人也不会犯下灾难性的错误。
三种不同的“地形”策略
论文意识到,并非所有的数据集都是一样的。有些数据集非常丰富(你有涵盖所有可能动作的数据),而有些则很稀疏(你只有少量动作的数据)。他们根据数据的“地形”设计了三种不同的算法:
均匀覆盖(“丰富的地图”):
- 场景: 你拥有覆盖游戏世界每一个角落的数据。
- 结果: 即使存在破坏,机器人也能几乎完美地学习,误差极小。这就像拥有一张完整的、高分辨率的地图,你可以轻松识别出虚假的道路。
低相对条件数(“粗糙的地图”):
- 场景: 你没有涵盖每个角落的数据,但你拥有的数据在某种程度上是具有代表性的。
- 结果: 机器人使用一个“零阶预言机 (Zero-order oracle)”。你可以把它想象成一个盲目的徒步旅行者,只能通过感受脚下的地面来猜测坡度。这种方式较慢且不够精确,但它仍然是可行的。其误差率稍高(取决于破坏程度的平方根),但在数学上是安全的。
有界广义覆盖(“智能地图”):
- 场景: 数据虽然稀疏,但遵循特定的、可预测的模式。
- 结果: 机器人使用一个“一阶预言机 (First-order oracle)”。这就像一个不仅能感觉到地面,还能看到前方坡度(梯度)的徒步旅行者。这使得机器人能够更高效地工作,以更少的样本量实现更好的误差率(与破坏程度的平方根成比例)。
核心总结
该论文的主要成就证明了:只要使用这些特定的“谨慎”和“过滤”技术,你可以从数学上保证机器人能从受损的数据中学习到优秀的策略。
他们不仅仅是说“这可能有效”。他们构建了一个数学盾牌,证明了:“即使你的数据中有 10% 在撒谎,我们的方法也能找到一个几乎等同于使用完美数据时的优秀策略。”
这是首次针对离线学习中存在人类反馈且面临对抗性攻击的情况,做出如此严密的数学保证。这就像是给机器人戴上了一副“真相眼镜”,让它能够看穿训练手册中的谎言。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。