← 最新论文
🤖 machine learning

From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs

本文表征了在仅从最优动作出发时,折扣马尔可夫决策过程中的转移核的可辨识性,并证明了虽然状态-动作奖励会留下一个高维且不可分辨的动力学族,但依赖于下一状态的奖励通常允许完全恢复转移核,而仅依赖状态的奖励提供的信息则更少。

原作者: Neal Batra

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Neal Batra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何通过迷宫。你并没有向它展示地图;相反,你只是观察它在面对不同目标时会做出什么反应。也许你告诉它,“去找奶酪”,它就向左跑。然后你又说,“去找电池”,它就向右跑。这就是**强化学习(Reinforcement Learning)**的世界——这是人工智能的一个分支,智能体通过试错来最大化其获得的“奖励”。

在这个世界里,智能体需要了解两个核心要素:做什么(策略)以及接下来会发生什么(世界的物理规律)。“做什么”的部分很容易观察:你只需要观察机器人的选择。而“接下来会发生什么”的部分是转移模型(transition model)——这是一个关于概率的秘密地图,它会告诉你:“如果我在这里按下这个按钮,有70%的概率我会掉进坑里,有30%的概率我会找到宝藏。”通常,我们假设如果我们知道了机器人在每种可能目标下的完美策略,我们就能反向推导出它的秘密地图。但如果机器人表现得如此出色,以至于它把地图隐藏了起来呢?如果两个完全不同的地图会导致完全相同的完美选择呢?这篇论文提出了一个棘手的问题:仅仅通过观察赢家的动作,我们真的能了解游戏的真实规则吗?


伟大的地图之谜

想象你是一名侦探,试图弄清楚一款电子游戏是如何运作的,但你无法查看代码。你只能观察一名速通玩家(speedrunner)如何完美地玩这款游戏。这位速通玩家非常清楚在每一时刻应该按下哪个按键以获得最高分。

论文提出了这样一个问题:如果你在每一种可能的奖励场景下(寻找金币、躲避岩浆、收集钥匙)都观察这位速通玩家进行游戏,你能弄清楚游戏的物理机制吗?你能确定按下“跳跃”会让角色向上跳 5 英尺还是 10 英尺吗?

根据这项研究,答案是一个令人惊讶的**“不一定”**。

作者 Neal Batra 证明了,你可以拥有两个完全不同的游戏引擎(两个不同的“转移核”,即描述世界运作方式的地图),它们会对你设想的每一个奖励场景产生完全相同的完美动作。这就像有两个不同的迷宫,尽管墙壁和陷阱的布置不同,但通往出口的路径看起来却一模一样。

三种线索

论文测试了三种给机器人提供奖励的不同方式,每种线索揭示的真相程度各不相同。

1. “动作”线索(状态-动作奖励 / State-Action Rewards)
这是最常见的情景。你告诉机器人:“如果你在厨房并拿起勺子,你将获得 10 分。”
研究发现,即使你知道机器人在每间房里针对每个勺子、叉子和刀片的完美选择,你仍然无法确定确切的地图。存在着一整个由不同地图组成的家族,它们在表现上看起来完全一致。

  • 魔术技巧: 作者展示了这些不同的地图是通过一个数学上的“魔术透镜”(一个被称为 L 的矩阵)连接在一起的。如果你透过这个透镜看世界,概率会发生变化,但机器人的最佳选择却保持不变。
  • 谜团的规模: 如果机器人有 nn 个不同的位置,那么就存在一个庞大的、平滑的隐藏地图家族——具体来说,是一个具有 n(n1)n(n-1) 个自由维度的家族。这就像是在说,只要你保持门的位置不变,就有无数种方法可以为房间粉刷墙壁。机器人的选择越多(动作越多),它就越难隐藏真相,但隐藏真相依然是可能的。

2. “下一步”线索(转移相关奖励 / Transition-Dependent Rewards)
现在,假设你可以根据机器人的“最终落点”来给予奖励。“如果你按下按钮并落在红色瓷砖上,你将获得 100 分。”
这是一个更强大的线索。因为你可以直接对“目的地”进行奖励,所以你可以更严格地测试游戏的物理机制。

  • 结果: 如果机器人在一个房间里至少有两个选择,你通常可以推断出确切的地图。只有当机器人在一个房间里只有一个可能的移动路径时,你才无法确定。在这种情况下,机器人没有选择,因此你无法测试物理机制是否不同。但只要存在选择,“下一步”线索通常能揭示真实的地图,除非游戏被设计成了一种非常特殊且罕见的陷阱。

3. “状态”线索(状态奖励 / State Rewards)
最后,假设你只能说:“如果你在厨房,你就会得到 10 分”,而不论你做了什么。
这是最弱的线索。这就像是告诉机器人:“只要你在厨房,就保持开心”,但并不说明你应该按下哪个按钮。

  • 结果: 这揭示的信息最少。两个完全不同的地图在这些规则下看起来可能是一样的。论文证明,仅凭这些简单奖励所获知的机器人选择,不足以区分许多不同的世界。

真相的阶梯

论文将这些发现组织成了一个清晰的知识阶梯:

  1. 转移奖励(奖励目的地)是最强的。它们通常可以揭示确切的地图。
  2. 动作奖励(奖励选择)处于中间水平。它们告诉你动作之间的比较关系,但会留下一个由许多可能地图组成的“迷雾”。
  3. 状态奖励(奖励位置)是最弱的。它们留下的迷雾最多,使得许多不同的地图看起来都一样。

为什么这很重要

你可能会问:“那又怎样?如果机器人做出了正确的动作,我们为什么要关心地图呢?”

论文认为,地图的重要性不仅在于赢得比赛。如果你想预测接下来会发生什么、模拟灾难,或者询问“如果我当时做了不同的事会怎样?”(反事实推理),你需要的是真实的地图,而不仅仅是那个看起来适合当前游戏的地图。

这项研究证明了:知道最佳动作并不保证你了解世界的规则。 你可以拥有一个行为表现得像天才一样的完美智能体,但其内部对现实的理解却是完全错误的。这提醒我们,在人工智能的世界里,做正确的事并不总是意味着你理解了为什么它是正确的,或者在表面之下,世界实际是什么样子的。

作者不仅仅是在猜测,他们提供了数学证明。他们展示了如何构建这些欺骗机器人的“假”地图,并计算了这些假地图存在的精确数量。这是一个坚实的、经过证实的结论:通往宝藏的路径可能是一样的,但你脚下的地形却可能是任何样子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →