← 最新论文
🤖 machine learning

Task-Induced Representational Invariances Depend on Learning Objective in Deep RL

本文表明,深度强化学习算法,特别是基于价值的方法(DQN)和策略梯度方法(PPO),尽管性能相当,但分别学习到了与 MDP 同态和动作对称性相一致的、由任务诱导的不同表征不变性,从而为比较模型和获取神经编码方面的见解提供了一个原则性的框架。

原作者: Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教两个不同的学生如何通过一个复杂的迷宫去寻找隐藏的宝藏。这两个学生都极其聪明,他们使用完全相同的地图,并且每次都能完美地找到宝藏。然而,研究表明,他们在思考迷宫的方式上完全不同。

这项名为《任务诱导的表征不变性取决于深度强化学习中的学习目标》(Task-Induced Representational Invariances Depend on Learning Objective in Deep RL)的研究调查了人工智能(AI)智能体在学习解决问题时是如何“看待”世界的。作者发现,AI的学习方式(其“学习目标”)决定了它如何组织其内部知识,即使最终结果是相同的。

以下是利用简单的类比对他们研究结果的解读:

1. 两个学生:“价值”学生 vs. “动作”学生

研究人员比较了两种著名的 AI 学习方法:DQNPPO

  • “价值”学生 (DQN): 这个学生痴迷于得分。他们会问:“这个特定的位置有多好?”他们学习将那些在价值感上感觉相似的位置归为一类。

    • 类比: 想象一张城市地图,这个学生不是按你在那里能做什么来分组社区,而是按房地产的“昂贵”或“价值”程度来分组。如果两条不同的街道具有相同的物业价值,这个学生就会将它们视为相同的,即使建筑看起来完全不同。
    • 论文的发现: 这个学生学习了 MDP 同态对称性 (MDP Homomorphism Symmetries)。用通俗的话说,他们学会了理解迷宫底层的数学结构。他们意识到:“嘿,左边的这个角落和右边的那个角落在数学上是完全一样的,因为迷 never 迷宫的规则是对称的。”他们将世界压缩成了一个更小、更简单的版本。
  • “动作”学生 (PPO): 这个学生痴迷于下一步该做什么。他们会问:“我在这里应该做哪个动作?”他们学习将那些“最佳动作相同”的位置归为一类。

    • 类比: 这个学生观察城市时,是根据交通灯来分组社区的。“如果灯是绿色的,我就走;如果灯是红色的,我就停。”他们不在乎建筑是否不同,他们只在乎所需的动作是否相同。
    • 论文的发现: 这个学生学习了 动作对称性 (Action Symmetries)。他们根据最优动作对状态进行分组。如果状态 A 的最佳动作是“向左转”,而状态 B 的最佳动作也是“向左转”,那么他们就会把 A 和 B 视为同一个,而不论其背后的深层数学结构如何。

2. 证明:目标相同,大脑不同

研究人员在一个导航任务(数字迷宫)中测试了他们。

  • 结果: 两名学生都完美地解决了迷宫。但当研究人员观察他们的“大脑”(内部数据表征)时,看到了明显的差异。
    • “价值”学生 (DQN) 在数学对称(如迷宫的镜像)的状态之间表现出高度的相似性。
    • “动作”学生 (PPO) 在需要相同动作的状态之间表现出高度的相似性,即便这些状态背后的数学原理不同。

这就像两位厨师制作完全相同的蛋糕。一位厨师按食材(面粉、糖、蛋)来组织厨房,而另一位则按步骤(混合、烘焙、抹霜)来组织。两者的蛋糕味道一样,但他们的内部组织方式完全不同。

3. 为什么这很重要?(迁移测试)

论文提出了一个问题:当学生面对一个问题时,这种“思考风格”的差异是否重要?

  • 实验: 他们让在一种游戏(如《打砖块》/ Breakout)中训练的学生去玩另一种类似的游戏(如《乒乓球》/ Pong)。
  • 结果: “价值”学生 (DQN) 在向新游戏迁移技能方面表现得更好。因为他们学习了环境的深层结构规则(即“对称性”),所以他们能够快速适应。
  • “动作”学生 (PPO) 则表现得更为吃力。因为他们过于专注于具体的动作,所以很难意识到新游戏其实只是旧游戏的旋转或翻转版本。

隐喻: 如果你通过背诵特定转弯(“在红色的谷仓处左转”)来教一个人开车,如果谷仓不见了,他们可能会迷路。如果你教他们驾驶的原则和道路几何学,他们就能应对一个拥有不同地标的新城市。“价值”学生学习的是原则,“动作”学生背诵的是转弯。

4. “聊天机器人”的惊喜 (大型语言模型)

研究人员还在同一个迷宫任务中测试了一个大型语言模型(LLM)——一种驱动聊天机器人的 AI 类型。他们并没有训练这个聊天机器人,只是在对话中给了它迷宫的描述。

  • 发现: 聊天机器人的“思考风格”会根据迷宫被描述的方式而改变。
    • 如果迷宫被描述为一个简单的连接列表,聊天机器人的行为就像**“动作”学生**(专注于动作)。
    • 如果迷宫被描述为视觉化的 ASCII 艺术树状图(清晰展示了结构),聊天机器人突然开始表现得像**“价值”学生**,识别出了深层的对称性。
  • 核心要点: 与那些固定的 AI 学生不同,聊天机器人是灵活的。它可以通过改变提示词(指令)来切换“思考风格”。

总结

论文得出结论:AI 如何学习决定了它如何看待世界。

  • 如果你想要一个能够理解环境深层结构规则(非常适合适应新情况)的 AI,你应该使用基于价值的方法(如 DQN)。
  • 如果你想要一个极度专注于眼前最优动作的 AI,你可能会使用基于策略的方法(如 PPO)。

这不仅仅是关于数学;这关乎理解两个系统可以实现完全相同的完美结果,却构建了完全不同的现实内部地图。这有助于科学家理解,不仅是 AI 如何运作,还包括动物的大脑如何根据其试图实现的目标来以不同的方式组织学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →