RENEW: Towards Learning World Models and Repairing Model Exploitation from Preferences
该论文提出了 RENEW,这是一个利用人类对想象展开(imagined rollouts)的偏好来直接修复离线强化学习世界模型中模型利用(model exploitation)问题的框架,通过使用认知不确定性(epistemic uncertainty)来指导高效微调,从而在不需要额外专家演示的情况下提高样本效率和泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人玩电子游戏,但你不能让它触碰真实的控制台。于是,你给了它一堆旧的游戏录像,并要求它构建一个“梦境机器”——一个关于游戏运作方式的精神模拟。这就是离线强化学习(offline reinforcement learning)的世界,在这里,AI 完全从一个固定的数据集中学,而从未与真实世界进行过交互。其目标是构建一个世界模型(world model),一种能够预测如果机器人采取特定行动后会发生什么的“内在水晶球”。
然而,这个梦境机器中存在一个危险的故障。由于机器人仅从一组有限的旧录像中学习,它的水晶球存在盲点。如果机器人试图规划一个经过“盲点”的动作,模型可能会产生幻觉,创造出一个捷径——比如一个并不存在的墙壁,或者一个变成蹦床的地板。机器人作为一个聪明的优化器,会发现这个虚假的捷径并在模拟中利用它来获胜,结果却在现实中撞得头破血血。这被称为模型利用(model exploitation)。传统上,科学家们试图通过收集更多现实世界的数据(这既昂贵又缓慢),或者告诉机器人要害怕任何它不理解的事物(这会让它变得过于胆小而无法学习新事物)来解决这个问题。
这篇论文介绍了一种巧妙的新方法,可以在不需要更多现实世界素材的情况下修复机器人的梦境机器。作者 Logan Bhamidipaty、Mykel Kochenderfer 和 Subramanian Ramamoorthy 提出,我们可以利用人类直觉作为一种修复工具。他们意识到,虽然知道玩游戏的“最佳方式”需要博士学位,但几乎任何人都能一眼看出物理规律是否被破坏了。如果机器人在模拟中穿过了实心墙,或者让一辆车漂浮了起来,人类可以立刻说:“那是假的!”论文建议使用这些简单的“真实 vs 虚假”的判断,来教机器人的世界模型如何停止产生幻觉。
“梦境修复”项目
研究人员将他们的新框架称为 RENEW(通过诱导的世界模型偏好进行修复,Repairing ExploitatioN with Elicited World-model preferences)。以下是它是如何运作的步骤,使用一个简单的类比:
想象机器人的世界模型是一个试图通过阅读几页规则书来学习棋盘游戏规则的学生。这个学生很有信心,但在某些地方是错误的。
旧方法(朴素的 DLHF): 你可以让一个人观察两个不同的学生想象出的游戏动作,并问:“哪一个看起来更真实?”如果你随机地进行提问,人类可能会花费数小时去纠正那些学生已经做对的动作,却忽略了那些学生最困惑的、疯狂且不可能发生的动作。这被称为朴素的动力学人类反馈学习(naive Dynamics Learning from Human Feedback, DLHF)。论文表明这种方法有效,但效率极低。为了达到与仅仅 1,000 个真实样本同等的准确度,这种朴素方法需要 100 万个人类偏好标签。这就像是要求一个人批改一百万篇论文,仅仅是为了修正几个错别字。
RENEW 的方法: RENEW 不会随机提问,而是扮演一名聪明的导师。它首先检查学生的“不确定性计数器”。它会问:“学生在哪里最困惑?”然后,它只要求人类去比较那些特定且令人困惑的区域中的动作。它将人类的注意力精确地集中在机器人最可能犯危险错误的地方。
他们的发现
团队在多个数字环境中测试了这个想法,包括迷宫、滑块拼图(类似于 15 拼图)以及一个名为 Sokoban 的推箱子游戏。他们使用了一个计算机程序来充当“完美人类”来生成偏好标签,模拟了如果真实的人在进行判断时会发生的情况。
以下是他们实验的关键结论:
- 偏好可以直接教授物理知识: 他们证明了,仅仅通过询问“这两条路径中哪一条看起来更真实?”,你就可以教会世界模型物理规则。你不需要向机器人展示正确答案,也不需要告诉它目标是什么。仅仅是“真实 vs 虚假”的信号就足以修复模型。
- 智能定位节省时间: 当他们将“随机”方法(朴素 DLHF)与“智能定位”方法(RENEW)进行比较时,结果非常清晰。在 3x3 滑块拼图中,在拥有相同数量人类标签的情况下,RENEW 将错误率降低到了随机方法的一半。
- 修复“失忆”问题: 一个令人惊讶的发现是,随机方法有时会让情况变得更糟。在 Sokoban 游戏中,朴素方法实际上导致机器人“忘记”了如何正确移动箱子,这是一个被称为**灾难性遗忘(catastrophic forgetting)**的问题。RENEW 完全避免了这个问题,因为它只微调了模型中真正损坏的部分,而保留了正确的部件。
- 现实世界的潜力: 在迷宫环境中,他们发现,仅凭 1,600 个偏好标签,RENEW 就能修复一个容易被利用的预训练模型,显著降低了错误率。即使拥有相同的预算,朴素方法仍然留下了许多错误和不确定性。
核心结论
论文表明,我们不需要成为专家来修复 AI 模型;我们只需要擅长识别荒谬的事物即可。通过要求人类简单地指出机器人的想象何时违反了物理定律,我们可以高效地修复机器人的“梦境机器”。
然而,作者谨慎地指出,这仍处于早期研究阶段。他们的实验使用了计算机生成的“完美”标签和小型、简单的网格世界游戏。他们尚未在复杂的、高维度的世界(如驾驶真实的汽车)中测试过真实的、会犯错的疲惫人类。但结果展示了一条充满希望的新路径:我们不需要强迫机器人害怕未知,而是可以用我们的常识温和地引导它们回归现实,使它们变得更安全、更可靠,而无需无穷无尽的昂贵数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。