← 最新论文
📈 economics

A Lecture Note on Offline RL and IRL, Part II: Foundations of Inverse Reinforcement Learning and Dynamic Discrete Choice Models

本讲义建立了结构化计量经济学动态离散选择模型与熵正则化逆强化学习之间的理论等价关系,系统地比较了经典识别与计算方法与现代机器学习方法,以阐明它们在离线奖励恢复方面的各自目标、局限性及识别保证。

原作者: Enoch Hyunwook Kang

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Enoch Hyunwook Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是讲义内容的中文翻译,采用了日常语言并保留了所有的类比。

大局观:关于“为什么”的谜团

想象你是一名侦探,正试图弄清楚为什么一位名厨会那样烹饪特定的菜肴。

  • 前向强化学习(标准方式): 你被给予了食谱(奖励)和食材。你的任务是学习如何完美地烹饪这道菜。
  • 逆强化学习 (IRL) 与 动态离散选择 (DDC):得到了一段名厨烹饪的视频。你没有食谱。你的任务是通过观察视频,找出解释他们为何做出这些特定选择的隐藏食谱(奖励)。

这份讲义是一本指南,面向两组几十年来一直在解决同一个谜题、但使用不同语言和工具的侦探。作者 Enoch Kang 展示了他们实际上是在解决完全相同的谜题,并随后引入了一个新的统一工具来更好地解决它。


第一部分:两种语言,一个谜题

论文首先证明了两个看似不同的领域实际上正在研究同一件事:

  1. 经济学家 (DDC): 他们研究人们如何做出选择(比如挑选工作或汽车)。他们假设人们拥有隐藏的“效用”(幸福感得分)以及一些随机噪声(糟糕的一天或突然的渴望)。他们使用数学方法来推算隐藏的效用。
  2. 人工智能研究员 (IRL): 他们研究机器人或智能体。他们假设智能体试图最大化奖励,但也喜欢保持“随机性”(探索性),以避免陷入停滞。这种随机性在数学上看起来与经济学家的“噪声”完全一致。

类比: 想象两个人描述一朵云。一个人说:“它是一个蓬松的白色形状。”另一个人说:“它是一个水蒸气形成物。”他们在用不同的词汇描述同一个物体。这篇论文证明了“蓬松的形状”(经济学)和“水蒸气”(AI)在数学上是完全等同的。

第二部分:“锚点”问题(缺失的一块)

这里是棘手的地方:如果你只观察厨师,你无法判断他是因为热爱盐而加盐,还是为了平衡酸度,亦或是为了掩盖错误。有无数种方式可以解释同一种行为。

  • 问题: 仅通过观察行为,你无法唯一地确定“真实的”奖励。你只能确定选择之间的差异(例如,“厨师比起米饭更喜欢意面”),但无法确定绝对值(例如,“厨师到底有多喜欢意面?”)。
  • 解决方案(锚点): 为了解决这个问题,论文建议在每一步中选择一个特定的动作,并声明其价值是已知的。
    • 类比: 想象厨师在制作“食谱 A”时,总是放入特定量的盐。如果我们知道“食谱 A”总是恰好加入 1 克盐,我们就可以把这个作为一把尺子(即锚点),来测量他在“食谱 B”中放入了多少盐。
    • 在论文中,这被称为锚点动作假设 (Anchor-Action Assumption)。它固定了规模,使数学计算得以进行。

第三部分:旧工具(为什么它们很难)

论文回顾了侦探们尝试解决此问题的旧方法,并指出了它们的缺陷:

  1. 嵌套循环法 (Rust 的方法):
    • 运作方式: 猜一个食谱,模拟厨师烹饪的过程看他们会做什么,然后与视频进行对比,如此循环往复。
    • 缺陷: 这就像试图通过走入迷宫,然后退回来,再走进去一次来解开迷宫。这极其缓慢且计算成本高昂,尤其是当迷宫非常庞大(高维)时。
  2. 条件选择法 (Hotz-Miller):
    • 运作方式: 他们不直接猜测食谱,而是猜测厨师下一步动作的概率,并反向推导。
    • 缺陷: 要做到这一点,你需要确切知道世界是如何变化的(转移模型)。如果你不知道厨房是如何运作的(例如,炉灶是如何升温的),这种方法就会失效。它需要估计一个巨大的世界地图,这在复杂的环境中在统计学上是不可能的。
  3. “致命三元组” (时序差分法):
    • 运作方式: 尝试直接从视频片段中学习,而不模拟整个世界。
    • 缺陷: 当你结合了近似(猜测)、自举(利用自己的猜测来更新自己的猜测)以及离策数据(从与你要模仿的厨师不同的厨师那里学习)时,数学往往会爆炸。数值会趋向无穷大,导致系统崩溃。

第四部分:现代 AI 技巧(对抗式与匹配式)

论文随后研究了现代 AI 方法,如 AIRLGAIL

  • 核心思想: 使用一个“判别器”(裁判)来玩一场游戏。裁判试图分辨一个动作是来自专家还是学生;学生则试图欺骗裁判。
  • 局限性: 论文认为,虽然这些方法很酷,但它们往往无法真正找到真实的奖励。它们可能只是找到了模仿行为的方法,而没有理解背后的“为什么”。它们通常依赖于一些假设(比如世界是确定性的),而这些假设在现实生活中并不成立。如果世界是随机的(随机过程),这些方法会对“哪些行为是奖励”以及“哪些行为仅仅是运气”感到困惑。

第五 part:新方案 (GLADIUS)

最后,论文介绍了一种名为 GLADIUS 的新方法(基于梯度的样本逆效用学习上升-下降法)。

它是如何运作的(类比):
想象你正在尝试寻找淋浴的最佳水温。

  1. 似然损失 (Likelihood Loss): 你观察专家的视频。你不断调整温度,直到专家的选择与视频相匹配。这让你得到了相对的偏好(热 vs 冷)。
  2. 锚点损失 (Anchor Loss): 你使用“锚点”(已知的盐量)来固定绝对规模。
  3. 偏差修正(神奇的技巧):
    • 问题: 如果你只看一段视频片段,你可能会因为下一个状态(例如水压波动)而感到运气好或运气差。如果你仅根据一个片段来计算“误差”,你会得到一个有偏差的结果(即“双重采样”问题)。
    • 解决方法: GLADIUS 使用第二个“辅助”网络(称为 ζ\zeta)。这个辅助网络扮演着统计学家的角色。它观察所有数据并预测下一步的平均结果,从而有效地抵消掉单个片段中的运气成分或倒霉成分。
    • 它通过玩一场游戏来实现这一点:主网络试图最小化误差,而辅助网络试图预测平均值。它们轮流更新彼此。

为什么它更好:

  • 无需地图: 它不需要知道转移模型(世界是如何移动的)。它直接从视频片段中学习。
  • 无需嵌套循环: 它不需要模拟整个未来。它使用梯度(数学斜率)一次性解决所有问题。
  • 稳定: 它避开了会导致其他方法崩溃的“致命三元组”。

总结

这篇论文是一座桥梁。它将经济学家严谨的数学与 AI 强大的工具连接起来。它表明,虽然我们有很多方法可以从行为中推测奖励函数,但大多数方法要么太慢,要么太不稳定,或者需要不可能实现的假设。

提出的解决方案 GLADIUS 是一种解决谜题的新方法。它使用一个“尺子”(锚点动作)来设定规模,并使用一个“统计学家助手”(偏差修正)来忽略数据中的噪声。这使我们能够直接从视频中恢复真实的“食谱”(奖励函数),而无需模拟世界或预先知道游戏的规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →