MATE: Solving Contextual Markov Decision Processes with Memory of Accumulated Transition Embeddings
本文提出了 MATE,一种通过用聚合求和的记忆替代不可处理的后验信念来解决上下文马尔可夫决策过程的记忆架构,从而在避免 Transformer 和循环神经网络计算与梯度限制的同时,实现了与标准序列模型相当的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一台试图学习如何行走的机器人,但每次你开始一个新的“回合”(即一次新的尝试)时,脚下的地面都会发生变化。有时是滑溜的冰面,有时是厚重的泥浆,有时则是崎岖的道路。你无法直接看到这些变化;你只能通过迈步时脚底的感觉来感知它们。这就是论文中所称的上下文马尔可夫决策过程(CMDP)。这里的“上下文”就是隐藏的地面类型,而你的任务就是仅通过回顾你迈步的历史来推断出它是什么。
这篇论文为机器人(或人工智能体)引入了一种记忆这些步骤的新方法,称为MATE(累积转换嵌入记忆)。以下是其工作原理的简化概念分解:
问题:如何记忆而不被压垮
为了推断地面类型,机器人需要审视其过去所有步骤的完整历史。
- 旧方法(RNN): 想象一台机器人试图通过一次一个字地对自己低语一个故事来回忆过去。随着故事变长,记住开头变得越来越难,而且低语可能会变得含糊不清(这就是论文中提到的“梯度不稳定性”)。
- 流行方法(Transformer): 想象一台机器人在每次需要做出新决策时,都要重读其完整的历史书。如果书很短,这没问题。但如果机器人已经行走了很长时间,这本书就会变成一部庞大的百科全书。每一秒都重读整本书极其缓慢且昂贵(这就是“二次方成本”问题)。
解决方案:MATE(记忆的“桶”)
作者们发现了一个巧妙的点:你迈步的顺序实际上对于推断地面类型并不重要。 无论你是先滑倒然后踩进泥里,还是先踩进泥里然后滑倒,这两个事件的组合告诉你的关于地面的信息是一样的。这个“上下文”是置换不变的(它不关心顺序)。
MATE 利用这一洞察构建了一个像桶一样简单的记忆系统:
- 嵌入: 每当机器人迈一步,它就将该体验转化为一个小的“令牌”或数字鹅卵石。
- 求和: 机器人不再撰写故事或阅读书籍,而是直接将鹅卵石丢进桶里。
- 记忆: 机器人的记忆 simply 就是桶里鹅卵石的总堆。
为什么这很重要
- 抗顺序干扰: 由于机器人只是将鹅卵石添加到堆中,无论它是按 A-B-C 还是 C-A-B 的顺序丢入,最终的堆看起来都是一样的。这完美契合了该问题的数学现实。
- 速度快:
- 更新: 向桶中添加新鹅卵石所花费的时间极短且恒定,无论桶里有 10 颗还是 10,000 颗鹅卵石。这比“重读整本书”的方法快得多。
- 并行处理: 因为机器人只是在添加鹅卵石,它可以一次性计算整个历史(就像一群工人同时丢下鹅卵石),这是“低语故事”方法无法做到的。
- 能力强: 论文从数学上证明,尽管这种“桶”方法看似简单,但它实际上足够聪明,可以完美地解决问题。它不会丢失任何必要信息;只是以不同的方式组织了信息。
“归一化”技巧
这里有一个小陷阱:如果机器人行走了百万步,鹅卵石桶就会变成一座山,机器人的大脑会被这堆东西的巨大规模压垮。为了解决这个问题,作者添加了一个“筛子”或归一化步骤。他们将鹅卵石堆缩小到标准尺寸(就像将其投影到球面上),这样机器人的大脑就能保持冷静和专注,而不会丢失信息的形状。
结果
研究人员在三个不同的“训练场地”上测试了 MATE:
- MuJoCo: 模拟机器人在不同表面上行走。
- Meta-World: 机器人尝试打开不同类型的门或拾取不同的物体。
- T-Maze: 机器人在迷宫中导航,它必须记住之前看到的线索才能找到出口。
在所有这些测试中,MATE 的表现与复杂的“读书”(Transformer)和“低语”(RNN)方法一样好,但它所需的计算资源更少,训练时间更快。
简而言之: MATE 是一个聪明且高效的记忆系统,它认识到“一堆经历与一段经历的故事同样有效”,从而使人工智能能够在变化的环境中更快、更高效地学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。