← 最新论文
🤖 machine learning

MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings

本文介绍了 MapFormer,这是一种新颖的基于 Transformer 的架构,它利用源自李代数生成元的输入依赖型位置嵌入来学习无监督认知地图,从而在多种认知任务中相比现有 AI 模型实现了更优越的分布外泛化能力和可扩展性。

原作者: Victor Rambaud, Salvador Mascarenhas, Yair Lakretz

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Victor Rambaud, Salvador Mascarenhas, Yair Lakretz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你正在一座新城市中行走。你并非死记硬背所见到的每一栋建筑,而是构建一张心理地图。你理解“向左转”总会改变你相对于街道的位置,无论你在巴黎还是东京。这种将“你在何处”(结构)与“你看到什么”(内容)区分开来的能力,正是科学家所称的“认知地图”。

当前的 AI 系统,例如你可能正在与之对话的大型语言模型,在记忆模式方面表现出色。然而,它们往往非常“脆弱”。如果你要求它们解决一个与训练数据略有不同的问题,它们往往会失败。它们难以理解情境背后的规则,而是依赖基于表面相似性的猜测。

本文介绍了一种名为MapFormers的新型 AI 架构。可以将 MapFormers 想象为赋予 AI 一个“心理 GPS",使其学习道路规则,而不仅仅是记忆风景。

核心理念:将“何处”与“何物”分离

作者认为,要变得真正智能,AI 需要解开两件事:

  1. 内容:它看到的具体事物(例如,一个红苹果,一辆蓝车)。
  2. 结构:事物如何移动或相互关联的规则(例如,“向右移动”总是让你向右移动一步)。

标准 AI 模型将这两者混合在一起。MapFormers 的设计旨在将它们保持分离。它们利用涉及李群(一种描述平滑旋转和运动的复杂方式)的数学技巧来实现这一点。AI 不是硬编码规则,而是学习根据输入生成“移动矩阵”。

两种类型的 MapFormers

本文展示了该系统的两个版本,作者将其比作人类的记忆类型:

  1. MapEM(情景记忆):这就像一本日记。它保存一份独立的、专门的清单,记录“我在哪里”和“我看到了什么”。它非常擅长回忆特定的过去事件(例如,准确记得上周二早餐吃了什么),但处理速度稍慢。
  2. MapWM(工作记忆):这就像大脑的活跃草稿纸。它即时混合“何处”与“何物”。它更快、更高效,类似于 RoPE(一种流行的当前 AI 技术)的工作原理,但有一个关键升级:它实际上能够学习在地图中动态移动。

它们是如何学习的(训练场)

为了证明这些模型有效,研究人员在三个特定的“电子游戏”风格挑战中测试了它们,这些挑战中的规则是隐藏的:

  • “忽略噪音”游戏:AI 必须复制一个物品列表,但忽略中间的空白。标准 AI 会被空白搞糊涂;MapFormers 学会了“门控”(屏蔽)噪音,只专注于要复制的物品。
  • “蒙眼导航员”游戏:AI 收到一系列“移动”和“看见”指令,但未被告知哪个是哪个。它必须弄清楚“上”会让你向上移动,而“看见一棵树”只是更新你的视野。一旦它学会了地图,即使序列比它见过的任何序列都要长,它也能准确预测如果回到曾经访问过的地点会看到什么。
  • “嵌套括号”游戏:这测试了处理深层逻辑层的能力(如 ((())))。当序列变长时,标准 AI 难以计算有多少个等待闭合的左括号。MapFormers 将打开括号视为“向前移动”,将关闭括号视为“向后移动”,从而使它们能够完美地跟踪堆栈,即使序列深度远超其训练范围。

结果:为何这很重要

本文声称,MapFormers 实现了近乎完美的泛化能力

  • "OOD"测试:在 AI 术语中,“分布外”(OOD)意味着在模型从未见过的场景上测试模型。当序列变长或环境改变时,标准模型惨败,而 MapFormers 则成功了。它们不仅仅是记忆;它们学习了问题的几何结构
  • 现实世界测试:研究人员还将此应用于一段真实的互联网文本(OpenWebText)。虽然在逻辑游戏上的提升幅度较小,但 MapFormers 的表现仍略优于标准模型,这表明这些原则可能扩展到现实世界的语言任务中。

“秘密武器”:数学作为指南针

本文解释说,MapFormers 使用一种特定的数学方法,将动作(如“向右移动”)视为旋转

  • 想象你在旋转一个拨盘。如果你转动 90 度,再转动 90 度,最终会到达 180 度。
  • MapFormers 学习到“右”是一种特定的旋转,而“左”是相反的旋转。
  • 因为它们使用这种数学框架,所以可以通过简单地将角度相加来计算长旅程(路径积分)的结果,而不必为每一步进行复杂、缓慢的计算。这使得它们能够并行处理信息(非常快),同时仍能理解序列。

总结

简而言之,本文提出,为了使 AI 更加稳健和适应性强,我们应该停止将其视为巨大的模式匹配机器,转而赋予它一张认知地图。通过教导 AI 将移动规则与其所见事物分离开来,MapFormers 能够以当前 AI 系统所缺乏的灵活性,导航新的、未见过的情况。它们不仅仅是猜测;它们理解地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →