PReM: Learning What to Preserve and When to Refresh for Context Compression
PReM 是一种新颖的上下文压缩框架,它通过一个专门的记忆层和特殊标记,动态地学习如何保留并刷新内部层级 KV 记忆,从而在不依赖外部压缩器或做出过早保留决策的情况下,实现高效的长上下文推理。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图解决一个庞大且复杂的谜题,但交给你的不是单一的线索,而是一个包含 32,000 页文档的图书馆。你的大脑(或者在这种情况下,一个被称为“大语言模型”的计算机程序)必须阅读所有的内容,才能找到回答问题所需的特定事实。问题在于,试图将整个图书馆同时装进你的“工作记忆”中是非常沉重且缓慢的。这就像是在比赛中背着一个装满图书馆的背包跑步;最终你会感到疲惫,并且可能会丢掉你正需要的那本书。
为了解决这个问题,科学家们到目前为止尝试了两种主要的技巧。第一种是“压缩”,即在你在开始阅读之前,尝试将图书馆缩减为一个微小的摘要。第二种是“缓存”,即保留整个图书馆,但只尝试查看最热门的页面。但两者都有一个缺陷:它们在开始解谜之前就做出了决定。如果谜题在途中发生了变化,而你突然需要书后的一页被扔掉的页面,你就陷入困境了。你无法回头去取它,因为决定做得太早了。这篇论文介绍了一种处理此问题的新方法,它建议我们需要的不是一个静态的摘要,而是一个能够随着故事展开而自我更新的记忆系统。
由此诞生了 PReM(保留并刷新记忆,Preserve and Refresh Memory),这是一个聪明的全新框架,它将模型的记忆视为一个动态的、活生生的笔记本,而不是一个静态的文件柜。其核心思想简单而强大:不要只决定保留什么一次;要决定此时此刻该保留什么,并准备好在故事需要的那一刻进行更换。
以下是 PReM 的工作原理,我们用一个有趣的类比来解释。想象你是一名正在带领团队(AI 的不同层)破案的侦探。在旧的方法中,团队会阅读整个案卷,挑选出他们最喜欢的 10 页,然后将剩下的锁进保险库。如果你稍后需要保险库里的一页,那就太晚了。
PReM 改变了规则。它保留了整个案卷,但将其组织成小的“块”(就像章节一样)。当侦探开始撰写解决方案时,一个特殊的“记忆标记”(我们称之为魔法书签,记作 ⟨m⟩)充当了一个信号。当侦探写下这个书签时,这就像是在说:“等等!我需要重新思考一下我桌子上的东西。”
就在那一刻,一个专门的“记忆管理器”(AI 中的一个特殊层)苏醒了。它观察当前的问题和魔法书签,然后快速扫描所有章节。它决定:“好吧,对于故事的下一步,我们肯定需要第三章和第十二章。我们可以暂时忘记其他的。”然后,它会将桌上的旧章节与新章节进行交换,在保持重要细节清晰锐利的同时,将不需要的部分压缩成一个微小的摘要。这一切都发生在写作过程中,而不是在开始之前。
论文表明,这种“刷新”机制是一个游戏规则的改变者。在针对 32,000 个 token 上下文(那是非常多的文本!)的测试中,PReM 成功地将记忆压缩了 16 倍甚至 32 倍。尽管在任何时刻“桌面上”留存的信息都少得多,但它的回答能力甚至比那些试图保持整个图书馆敞开的模型还要好。例如,在一个 70 亿参数的模型上,与现有的最佳方法相比,PReM 将答案的准确度提高了多达 12.55 个百分点。
研究人员还发现了一些关于这个记忆管理器应该“居住”在哪里有趣的事情。他们测试了将“记忆管理器”放置在 AI 大脑的早期、中期或后期部分的情况。他们发现,中期和后期层在决定保留什么方面表现得更好,而早期层则太慢,无法学会这项技能。这就像是让一名资深侦探(中间层)来做出关于哪些证据相关的决策,而不是让一名新手(早期层)去做。
P-ReM 最令人惊讶的发现之一是,由于它拥有如此出色的“学习型”记忆管理能力,一个较小的模型(30 亿参数)使用 PReM 后,可以超越使用其他压缩技巧的较大模型(70 亿参数)。这表明,知道何时刷新你的记忆与你的大脑有多大同样重要。
论文还排除了一些想法。它表明,仅仅使用 AI 的自然注意力(关注它当前正在思考的内容)不足以决定保留什么;你需要一个专门训练过的系统来进行选择。它还表明,你不能只是在开始时压缩一次文本然后就期望一切顺利;这种“静态”的方法(即在整个回答过程中保持相同的压缩摘要)会导致更差的结果,尤其是在处理复杂的、多步骤的问题时。
简而言之,PReM 表明,高效 AI 的未来不仅仅在于缩小数据,而在于构建一个会呼吸的记忆。它学习如何保留当前对话步骤所需的证据,并准确知道何时按下“刷新”按钮,为下一步换入新的证据。通过这样做,它在保持 AI 快速高效的同时,不会忘记解开谜团所需的线索。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。