← 最新论文
🤖 machine learning

Intrinsic Vicarious Conditioning for Deep Reinforcement Learning

本文介绍了内在替代性条件反射,这是一种受心理学文献启发的基于记忆的内在奖励机制,它使深度强化学习智能体能够在无法获取演示策略或奖励函数的情况下从演示中学习,从而在具有稀疏或非描述性终止条件的环境中促进低样本和持续学习。

原作者: Rodney A Sanchez, Ferat Sahin, Alex Ororbia, Jamison Heard

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Rodney A Sanchez, Ferat Sahin, Alex Ororbia, Jamison Heard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人走在繁忙的人行道上。在传统的机器人学习中,机器人必须尝试行走、摔倒、被计算机评分“惩罚”、站起来,然后再次尝试。它必须通过试错来学习。但如果摔倒意味着机器人会永久损坏(即“单次生命”场景)呢?它无法承受通过撞毁来学习。

本文介绍了一种名为内在替代性条件反射(Intrinsic Vicarious Conditioning)的机器人学习新方法。机器人不再通过撞毁来学习,而是通过观察他人,并根据他人的遭遇产生一种“直觉反应”来学习。

以下是其工作原理,分解为简单的概念和类比:

核心理念:从朋友的错误中学习

想象一个孩子看着父母触摸滚烫的炉子。孩子并没有自己去摸炉子。相反,他们看到父母把手缩回,并听到一声痛苦的尖叫。孩子立刻学会了“烫炉子=坏”,而从未被烫伤过。

在强化学习(AI 通过为良好行为获得积分来学习)的世界中,这通常很难实现。大多数 AI 方法要求机器人看到专家所做的确切动作,或者了解专家评分背后的确切数学原理。这种新方法表示:“我们不需要专家的 playbook 或记分卡。我们只需要看到他们做了什么,并知道结果是好是坏。”

“替代性条件反射”的四个步骤

作者借用了心理学框架(人类如何通过观察来学习),并将其转化为包含四个步骤的计算机程序:

  1. 注意(眼睛): 机器人观看一段“演示者”(另一个智能体)的短视频片段。它不需要知道演示者为什么移动;它只需要看到他们做了什么
  2. 保持(记忆): 机器人将这种行为的“快照”保存在其记忆库中。它还会记住结果的“判决”。结果是好的(正面)还是坏的(负面)?
    • 类比: 想象机器人在日记中写道:“我看到一辆车撞上了墙。判决:坏。”
  3. 再现(镜子): 当机器人尝试独自行走或驾驶时,它会不断将当前的动作与其记忆库进行核对。
    • 类比: 机器人看着自己的路径问道:“这看起来像我之前看到的‘坏车’吗?”如果答案是“是”,它会触发内部警报。
  4. 强化(直觉): 这是神奇的部分。如果机器人看到自己正在做与“坏车”类似的事情,它会给自己一个负向内部奖励(恐惧感)。如果它看到自己正在做与“好车”类似的事情,它会给自己一个正向内部奖励(兴奋感)。
    • 这种内部感觉充当指南针,引导机器人远离危险或走向安全,即使主要游戏没有因为它避免撞毁而给予任何积分。

“抑制”门控(刹车)

本文引入了一种巧妙的安全开关,称为抑制阈值

  • 想象机器人的记忆是一个嘈杂的房间。如果机器人太敏感,它可能会认为每一步都看起来像“坏车”并僵住不动。
  • “阈值”就像一个音量旋钮。只有当机器人非常确定(高置信度)其当前动作与坏记忆匹配时,它才会接收到“恐惧信号”。这防止了机器人因误报而瘫痪。

他们是如何测试的

研究人员在两个类似视频游戏的环境中测试了这种方法:

  1. 人行道(回避):

    • 设置: 一个机器人走在人行道上。如果它踏出边缘,它会立即死亡,得零分(没有警告,没有分数)。
    • 问题: 如果没有帮助,机器人只是随机游荡并掉下去,因为它直到为时已晚才收到“惩罚”信号。
    • 结果: 通过观察几个人掉下去的例子,机器人学会了在靠近边缘时感到“恐惧”。即使游戏从未告诉它“不要掉下去”,它在人行道上停留的时间也大大延长了。
  2. 赛车(接近与回避):

    • 设置: 一辆车在赛道上行驶。游戏根据在道路上快速行驶并击中每一块地砖来给予积分。
    • 转折: 游戏鼓励鲁莽驾驶(快速击中地砖),但赛道两侧有草地。如果你撞到草地,就会撞毁。
    • 结果:
      • 当展示一位“好司机”保持在中间车道时,机器人学会了保守驾驶。它开得较慢,击中的地砖较少(获得的比赛积分较少),但它存活的时间比那些试图通过鲁莽行为获胜的机器人长了三倍
      • 当展示一位“坏司机”撞到草地时,机器人学会了避开草地。

为什么这很重要

大多数 AI 学习就像一个学生必须失败 1000 次考试才能掌握材料。这种方法就像一个学生看着朋友失败一次考试,然后立即学会。

该论文声称,这是迈向**“单次生命学习”**的一大步。在现实世界中,机器人(或自动驾驶汽车)往往无法承受撞毁并从中学习。它们需要通过观察他人的少数几次观察来学习,利用内部的“直觉”来保持安全,而无需了解专家司机思考的复杂数学原理。

简而言之: 这篇论文教导机器人通过观察他人来培养对危险和安全的“第六感”,使它们能够在危险环境中生存,而无需先撞毁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →