← 最新论文
🤖 AI

Toward Learning POMDPs Beyond Full-Rank Actions and State Observability

本文提出了一种通过利用谱方法和在温和秩假设下的张量分解,从序列数据中学习部分可观测马尔可夫决策过程(POMDP)的显式转移矩阵和观测矩阵的方法,使智能体能够为多样化目标进行规划,同时证明了学习超出特定状态划分范围的内容在理论上是不可能的。

原作者: Seiji Shaw, Travis Manderson, Chad Kessens, Nicholas Roy

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Seiji Shaw, Travis Manderson, Chad Kessens, Nicholas Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人在一座阴森、漆黑的豪宅中导航。你看不见房间,只能听到吱呀声、感觉到气流,或者撞到家具。每当机器人走一步,它都会得到一个关于自己可能身处何处的微小线索。这就是“部分可观测”(Partially Observable)系统的世界:智能体(机器人)知道它可以采取哪些行动以及它能感知到什么,但它并不知道这座房子的真实地图,也不确切知道自己在任何时刻的具体位置。为了聪明地行动,机器人需要建立一个关于这个隐藏世界的心理模型。几十年来,科学家们一直在开发各种方法来猜测这个模型,但他们经常会撞上一堵墙:他们构建的模型就像是“黑箱”。它们可以预测下一步会发生什么,但却无法解释为什么,或者在目标改变时(比如从“寻找猫咪”切换到“寻找宝藏”)无法轻松改变计划。

这篇论文解决了这个黑箱问题。研究人员来自麻省理工学院(MIT)和陆军研究实验室(Army Research Laboratory),他们希望教会智能体学习真正的“游戏规则”——即从一个隐藏房间移动到另一个房间的具体概率,以及每个房间所发出的特定线索。他们关注的是一种特殊的数学谜题,叫做 POMDP(部分可观测马尔可夫决策过程)。把 POMDP 想象成一个你看不见棋盘,只能看到骰子点数和棋子落点位置的棋类游戏。目标就是通过一遍又一遍地玩这个游戏,来推导出棋盘的布局。核心问题在于:即使有些房间从外面看起来完全一样,我们能否学会这个精确的棋盘布局?

团队的主要发现是一种学习这些隐藏地图的巧妙新方法,但有一个非常重要的前提。他们发现,如果机器人的动作是“满秩”的(这是一个高级说法,意指动作足够多样化,能够搅动系统而不至于陷入循环),机器人就可以学习在不同房间组之间移动的真实概率。然而,他们证明了,如果两个不同的房间对于所有可能的动作都发出完全相同的线索,那么机器人无论如何走动也无法区分它们。这就像试图分辨一对穿着同样的衣服、说着同样声音的孪生兄弟;无论你问多少次问题,你也无法确定其中哪一个是哪一个。

那么,他们究竟做了什么呢?他们结合了两种现有的数学技巧。第一个技巧叫做预测状态表示(Predictive State Representations, PSR),它擅长预测未来,但在解释过去方面表现不佳。第二个技巧涉及“张量分解”(tensor decomposition),它像是一个高科技侦探,可以从混合的信号中分离出原始来源。作者意识到,如果他们先使用 PSR 方法得到一个世界的粗略草图,然后再使用张量方法对这个草图进行“旋转”,直到它与真实世界的布局相匹配。

这里是神奇之处:在许多现实世界的场景中,比如一个机械臂尝试抓取杯子,机械臂有时会失败(打滑),有时会成功。这些“混乱”的动作实际上是有帮助的,因为它们创造了足够多样化的数据,让数学逻辑得以运作。作者表明,通过使用这些满秩动作,他们的方法可以学习到移动和观察矩阵(即游戏的规则),直到达到一个“划分”(partition)的程度。这意味着机器人学会了“房间 A 和房间 B 因为看起来一模一样而属于同一组”,并且学会了在这些组之间移动的规则。如果每一个房间都有独特的指纹,机器人就能完美学习到整个地图。如果有些房间是双胞胎,它就会学习到这些组的地图。

论文还明确排除了这样一种观点,即仅凭单条行走轨迹就能学到两个“孪生”房间之间的确切区别。他们构建了一个数学证明,显示两个完全不同的房屋布局可能会产生完全相同的吱呀声和碰撞序列。如果机器人无法在提供的线索中分辨出差异,它就无法分辨地图上的差异。这并不是他们算法的失败,而是宇宙的一个基本限制。

在实验中,他们在几个数字世界中进行了测试,包括一个“老虎”游戏(老虎在其中两扇门后)和一个“感知-漂浮-重置”(Sense-Float-Reset)领域(机器人在一条线上移动)。他们发现,该方法成功学习了在不同“组”之间移动的正确概率。更重要的是,由于他们学习的是游戏的实际规则而非仅仅是一个黑盒预测器,因此他们可以在学习完成后改变机器人的目标。例如,他们可以告诉机器人:“现在,去那个有噪音的中间房间”,然后机器人就能利用它已经建立好的地图找到路径。而之前的方法则需要从头开始学习一个新目标。

作者认为,这种方法对于需要灵活性的机器人来说是向前迈出的重要一步。它允许机器人学习一个可解释且可重复使用的世界模型。然而,他们也谨慎地指出,这在机器人拥有多样化动作集时效果最好。如果机器人太笨拙,或者环境太静态,数学逻辑可能无法分离隐藏状态。他们还指出,目前的方法最适用于具有少量隐藏状态的系统,因为对于庞大复杂的系统,数学计算会变得非常沉重。但就目前而言,他们已经展示了我们可以窥探隐藏状态背后的帷幕,只要我们接受某些“双胞胎”将永远无法被分辨的事实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →