← 最新论文
🧬 biology

Probabilistic Recurrent Intention Switching Model

本文介绍了 PRISM,一种新颖的逆强化学习框架,它利用轻量级循环网络对非马尔可夫意图切换进行建模,实现了精确的闭式优化,并在网格世界、迷宫以及大规模机器人操作任务中展现出在恢复时间连贯目标方面的卓越性能。

原作者: Wenyuan Sheng, Hao Zhu, Joschka Boedecker

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenyuan Sheng, Hao Zhu, Joschka Boedecker

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在观看一部关于某人执行复杂任务的电影,比如一只老鼠在迷宫中奔跑,或者一只机械臂在堆叠盘子。对计算机而言,这只是一长串动作列表:向左移动、向前移动、抓取、向右移动

但对人类来说,我们了解这些动作背后的故事。那只老鼠并不只是在“移动”;起初,它是在寻找水源,然后它累了,转而回家,也许后来它只是为了探索而四处游荡。那只机械臂也不只是在“移动手臂”;它是在接近一个杯子,抓住它,搬运它,然后暂停

问题在于,试图理解这些行为的传统计算机程序通常假设行为者在整部电影中只有一个单一目标。它们试图寻找一个能够解释每一个动作的“奖励”(例如“到达出口”)。当行为者在行动中途切换目标时,这种方法就会失效。

解决方案:PRISM

这篇论文的作者创造了一种新工具,称为PRISM(概率循环意图切换模型)。你可以把 PRISM 想象成一位超级聪明的电影导演,它观看原始素材,并实时推断出剧本。

以下是它的工作原理,使用简单的类比来说明:

1. “循环”记忆(笔记本)
旧方法试图仅通过观察即时过去(就像只有 3 秒记忆的金鱼)来猜测下一个目标,或者通过手动将固定数量的过去步骤添加到数据中(这会迅速变得混乱且庞大)。

PRISM 使用循环神经网络,这就像角色在保持一本笔记本。随着老鼠或机械臂的移动,这本笔记本会更新,总结迄今为止发生的所有事情。

  • 示例: 如果一只老鼠撞墙 10 次,这本笔记本看到的不仅仅是“撞墙”。它看到的是“挫败感正在累积”。这使得模型能够理解,老鼠可能会因为这段历史而切换目标,而不仅仅是因为当下的所见。

2. “软切换”(调光开关)
PRISM 不使用那种非此即彼的硬“开/关”开关(即行为者要么是“目标 A",要么是“目标 B"),而是使用一个调光开关。在每一刻,它都会计算一个概率:“有 70% 的把握行为者正在寻找水源,有 30% 的把握它只是在探索。”这使得目标之间的过渡变得平滑且符合现实。

3. “魔法分割”(拼图求解者)
这类问题最困难的部分通常是你必须同时猜测目标和奖励,这就像是一个巨大且纠缠不清的数学谜题。

作者证明了一个数学技巧(使用称为“期望最大化”的方法),使他们能够分割这个谜题

  • 步骤 A: 他们利用笔记本来猜测目标。
  • 步骤 B: 一旦猜出了目标,他们便分别求解每个目标的奖励。
  • 步骤 C: 他们重复这一过程。
    因为他们可以使用已知且快速的公式(称为逆动作价值迭代)来求解奖励部分,所以整个过程 incredibly 快速。这就像拥有一支专家团队,其中一个人负责构思情节,然后另外三个人瞬间就能推断出每个角色的动机,而不是让一个人试图同时完成所有工作。

他们的测试

团队在三部截然不同的“电影”中测试了 PRISM:

  1. 网格中沮丧的老鼠: 他们创造了一个虚拟世界,老鼠在撞墙后会感到沮丧。旧模型在这里失败了,因为它们无法记住撞击的次数(即历史)。PRISM 记住了这种挫败感,并正确预测了老鼠何时会放弃并切换到不同的行为。
  2. 迷宫中的真实老鼠: 他们使用了老鼠在黑暗迷宫中寻找水源的真实数据。PRISM 成功识别出了三种不同的“模式”,这与生物学家已知的情况相符:寻水归巢(返回巢穴)和探索。它比以前的方法做得更好,并自动找出了“切换点”。
  3. 机械臂(BridgeData V2): 这是最大的测试。他们输入了数小时的人类控制机械臂进行厨房任务的视频。PRISM 事先并不知道什么是“抓取”或“搬运”。然而,它观察原始视频,并自动将视频分解为四个清晰的章节:接近(移动到物体)、抓取(闭合手)、搬运(移动物体)和空闲(等待/调整)。

为什么这很重要

该论文声称,PRISM 是第一种成功将此类“多目标”分析应用于大规模真实世界机器人数据的方法。

  • 它很快: 它在普通笔记本电脑上只需几分钟即可运行,而旧方法可能需要永远,或者会崩溃。
  • 它具有可解释性: 它不仅仅给出一个数字;它提供了一张地图,显示行为者在每一刻想要什么。你可以查看输出并说:“啊,就在那里,机器人正试图抓住杯子。”
  • 它对两者都有效: 它表明生物大脑(老鼠)和人工大脑(机器人)切换目标的方式在根本上是相似的:它们都依赖记忆和历史来决定何时改变主意。

简而言之,PRISM 是一个工具,它将漫长、令人困惑的动作流转化为具有清晰章节的故事,揭示了“做什么”背后隐藏的“为什么”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →