Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers
本文介绍了张量记忆,这是一个轻量级模块,通过引入固定大小的循环三维记忆张量来增强 Transformer,在保留空间归纳偏置以改进长程视频理解和遮挡敏感推理的同时,将状态容量与序列长度解耦。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试记住一个漫长而复杂的故事,就像一部拥有数百个场景的电影。
问题:“无限滚动”式记忆
当前的 AI 模型(Transformer)的工作方式,有点像一个人试图通过把看过的每一帧画面都保留在面前一张巨大且不断扩张的桌子上来记住一部电影。
- 问题所在: 随着电影变长,桌子变得巨大无比。管理它变得昂贵,而这个人试图在成千上万张散落的画面中寻找特定细节时,也会感到不堪重负。
- 弱点: 如果电影中的某个角色暂时被树遮挡(遮挡),AI 必须回溯所有那些散落的画面来猜测角色在哪里。它没有一个单一的、有组织的“心理地图”来显示事物此刻的位置。
解决方案:“智能文件柜”
作者提出了一种名为张量记忆(Tensor Memory)的新模块。你可以将其理解为给 AI 配备了一个小型、固定大小的3D 文件柜(体素网格),它位于 AI 大脑的旁边。无论电影或文档有多长,这个文件柜的大小始终保持不变。
以下是其工作原理,分步说明:
写入文件柜(“软性丢弃”):
AI 不再将笔记塞进某个特定的、僵硬的抽屉,而是预测信息属于文件柜 3D 空间中的哪个位置。然后,它像一团柔和发光的云(高斯体积)一样,将信息“投放”到该位置周围。- 类比: 想象将一滴墨水滴入海绵中。它不会只击中一根纤维,而是会稍微扩散开来,填充目标周围的区域。这使得 AI 在放置记忆的确切位置时更加灵活。
更新文件柜(“循环”):
文件柜不是静态的。它拥有一个内置机制(像一阵温和的局部微风),将新信息与已有的信息混合。这使得 AI 能够更新其对场景的“信念”。如果一个角色原本躲在树后,随后走了出来,文件柜会更新以反映这一新现实,而无需重新阅读整部电影。从文件柜读取(“针对性搜索”):
当 AI 需要回忆某事时,它不会扫描整张画面表。它会预测文件柜中的一个坐标(特定的 X、Y、Z 点),并“嗅探”该区域以提取相关上下文。- 类比: 与其翻阅整本书的每一页来查找一个名字,不如直接去索引,找到页码,然后阅读那特定的行。
安全阀(“门控”):
系统拥有一个智能开关(“门”),用于决定是否使用文件柜。如果任务很简单且不需要长期记忆,门就会关闭,AI 会忽略文件柜以节省能量。如果任务很困难(例如跟踪被遮挡的物体),门就会打开,AI 会依赖文件柜。
为何这很重要(根据论文)
作者在三个方面测试了这一想法:
- 语言: 在文本数据集(WikiText-2)上,使用这个文件柜帮助 AI 更好地理解长句,与标准模型相比,显著降低了其困惑度(perplexity)。
- 图像: 在尝试重建图像缺失部分时,带有文件柜的 AI 在保持结构正确性方面做得稍好一些。
- 视频: 在一个类似电子游戏的任务(UCF-101)中,带有文件柜的 AI 在识别动作方面表现更好,特别是因为它能够在物体暂时被遮挡时维持场景的“状态”。
权衡
论文承认存在代价。由于 AI 必须不断更新这个 3D 网格,训练时间更长(对于视频任务,“挂钟时间”要高得多)。然而,好处在于 AI 不再需要一个无限增长的过去 token 表格;它拥有一种紧凑、持久且有条理的方式来记忆世界。
简而言之,张量记忆赋予了 Transformer 一个小型、固定大小的“世界模型”,它们可以向其中写入并从中读取,从而使它们能够在不迷失在数据海洋中的情况下处理漫长而复杂的故事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。