Do You Remember? Toward Memory-Centric Multimodal AI
该论文介绍了“DoYouRemember”,这是一种以记忆为中心的多模态人工智能架构,它通过使用共享矩阵和局部指数移动平均(EMA)更新的重构记忆系统,取代了标准的单次处理模式,并证明了大语言模型(LLM)的隐藏状态会丢弃视觉信息,且将幻觉重新定义为有损记忆解压的一种固有属性而非缺陷。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
你还记得吗?为什么 AI 会“忘记”它所看到的一切(以及我们是如何修复它的)
想象一下,你正在看着一位朋友的面孔。你的大脑并不会在脑海中存储一个完美的、高清晰度的视频文件。相反,你的大脑会捕捉一个快照,将其压缩成几个关键概念(比如微笑的弧度、眼睛的颜色),随后当你试图回忆时,你的大脑会基于这些概念进行“重建”出一幅新的图像。这并非回放,而是一种创造性的重构。
现在,想象一个超级智能的机器人,它看着你的脸,准确地告诉你患有什么皮肤状况,但随后立即从记忆中删除了你脸部的照片。这正是当今最先进的 AI 模型所做的:它们能完美地“理解”图像,却对图像“毫无记忆”。
一项名为 DoYouRemember 的新研究试图通过教授 AI 如何利用模仿人类记忆机制的系统来真正“记住”它所看到的内容,从而解决这个问题。
重大发现:理解 记忆
研究人员从一个简单的疑问开始:如果一个 AI 能够完美地描述一张图像,它的脑海中是否仍然“看”到了这张图像?
他们构建了一个三步走的机器来测试这一点:
- 压缩器(The Compressor): 他们将一张脸的照片压缩成极其精简的数字简写(就像把一部 4K 电影变成几段文本代码)。
- 思考者(The Thinker): 他们将这些代码输入到一个巨大的 AI 大脑(大语言模型)中,以分析皮肤情况。
- 重建者(The Rebuilder): 他们尝试将 AI 的“想法”(其内部隐藏状态)重新转化为图像。
令人震惊的结果:
当他们尝试从 AI 的想法中重建面部时,得到的却是……静电噪声。纯粹的噪声。
AI 非常擅长说出“这个人脸颊上有红斑”,但它的内部记忆中却完全没有关于该红斑的可恢复视觉信息。这就像是一个翻译员能说出完美的英语,却完全忘记了原始的法语单词。AI 理解了“意义”,却破坏了“图像”。
论文证明了对于这些 AI 模型而言,理解并不等于记忆。 AI 消耗视觉数据来生成句子,然后便将视觉数据丢弃了。
失败的尝试:为什么“反向传播”不起作用
在找到解决方案之前,团队尝试了许多方法来强迫 AI 保留记忆。他们尝试了不同的记忆架构,并使用了标准的训练方法——反向传播(backpropagation)(这就像老师通过计算学生错得有多离谱来纠正作业)。
他们尝试了:
- 让 AI 向一个共享记忆板写入内容。
- 使用不同类型的“对比学习”(教 AI 识别相似的事物)。
- 缩短误差与记忆之间的路径。
结论: 所有的尝试都失败了。记忆板始终处于冻结状态。
为什么?论文用一个数学规则解释了这一点,称之为梯度抵消(Gradient Cancellation)。想象一下,有 9 亿个人试图同时在同一块小白板上写字。一个人想画一只猫,另一个人想画一只狗,第三个人想画一棵树。如果他们同时用力推笔,力量就会互相抵消,导致小白板依然空白。论文表明,当你试图用标准方法训练共享记忆时,来自每张图像的“推力”是如此微弱(它会缩小约 倍,其中 是图像数量),以至于记忆永远无法学习到任何新东西。
解决方案:“局部”记忆技巧
由于“全局”老师(反向传播)无法解决问题,研究人员尝试了一种受大脑神经元连接方式启发的方法:局部学习规则(Local Learning Rules)。
他们不再要求整个系统进行自我修正,而是让每张图像仅更新记忆板上 64 个总槽位中最相关的 前 8 个 槽位。他们使用了一种称为**指数移动平均(EMA)**的方法,这就像是在不抹除旧记忆的情况下,温柔地将新记忆平滑地融入其中。
结果:
- 记忆板奏效了: 通过让图像仅更新其特定的“槽位”,记忆板保持了多样性,没有变成一片模糊。
- 重建效果变好了: 当他们尝试从这种新记忆中重建面部时,得到了清晰、可辨认的面孔。
- 在 10 张未见过的测试图像 上,该记忆系统的重建质量得分(LPIPS)达到了 0.123,非常接近理想的最高分(“上限”)0.071。
- 该记忆仅使用了 229,000 个参数(极小的空间)来存储原本需要 16 倍 空间的信息。
“超级记忆”的惊喜:
当他们把记忆板做得更大(扩展到 1,024 个槽位)时,神奇的事情发生了。这个记忆系统实际上变得比原始的“完美”压缩方法还要好!
- 新的记忆系统在未见图像上的得分达到了 0.056(LPIPS),击败了原始压缩得分的 0.071。
- 为什么?因为原始压缩使用的是“块状”的数字阶梯(量化),而新的记忆使用的是平滑的连续数值。有了足够的槽位,平滑的记忆可以比块状的记忆更好地填补空白。
这对未来意味着什么
论文得出结论:幻觉(hallucinations)(即 AI 胡编乱造的情况)并不是一个漏洞,而是有损记忆工作方式的一个特征。就像你可能记得一张脸,但记错了眼睛的具体色调一样,一个会压缩信息的 AI 在尝试回忆时,必然会对缺失的细节进行“猜测”。
作者提出了构建 AI 的新方向:
- 以记忆为中心的 AI(Memory-Centric AI): 我们不应只是将图像喂给大脑并输出文本,而应该构建一个具有持久“记忆矩阵”的 AI,让所有感官(视觉、听觉、触觉)都能向其写入信息。
- 局部规则: 我们应该停止尝试用全局修正(反向传播)来训练这种记忆,转而使用模拟生物大脑学习方式的局部规则(如前 8 个槽位的更新)。
他们在皮肤健康图像(使用能拍摄患者皮肤 20 多种不同类型照片的 3D 皮肤分析仪)上测试了这一点。这个领域非常完美,因为它既需要理解医学状况,也需要记住精确的视觉细节。
简而言之: 论文证明了目前的 AI 在说话的一瞬间就会“忘记”它所看到的。但通过改变训练记忆的方式——使用局部的、温柔的更新而非全局的修正——我们可以构建出能够像人类一样,真正记住、重建并验证所见之物的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。