← 最新论文
💬 NLP

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

该论文介绍了 PI-Mem,一种并行迭代记忆机制,它同时处理所有上下文块并利用基于强化学习的自适应终止技术迭代优化共享记忆,使大语言模型在长达 360 万个 token 的长上下文推理任务中实现卓越的准确率和显著的推理加速。

原作者: Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图破解一部长达 360 万页的巨型悬疑小说。你拥有一位才华横溢的侦探——一个大语言模型(LLM),他非常聪明,但短期记忆很短。如果你把整本书一次性交给他,他的大脑会被搞崩溃,当他读到第 1,000,000 页时,他可能已经把第 10 页的线索给忘了。这就是人工智能中的“长上下文”问题:如何让计算机在阅读故事结尾时,依然能保持对开头的注意力?

为了解决这个问题,科学家们尝试了两种主要技巧。第一种就像是在拉伸橡皮筋;他们试图强迫模型同时记住所有内容,但橡皮筋往往会断裂,或者变得运行缓慢。第二种更流行的技巧是“循环记忆”(Recurrent Memory)方法。想象一位侦探,他一次只读一章。读完第一章后,他在笔记本上写下一份简短的摘要,然后扔掉这一章,接着读第二章。他读第二章,更新笔记,扔掉第二章,以此类推。问题在于,如果侦探在后面读到了一个令人困惑的章节,他可能会不小心把第一章的重要笔记涂改掉,从而永远抹去了关键线索。这是一个缓慢的、串行的过程,因为侦探必须等待一个笔记完成后才能开始下一个,这使得整个调查过程拖沓冗长。

就在这时,一个全新的想法——PI-Mem(并行迭代记忆)由一组研究人员提出了。PI-Mem 不再让侦探逐章阅读、更新笔记并继续前进,而是赋予了侦探一种超能力:能够同时阅读所有章节,但带有一个巧妙的转折。

以下是 PI-M 在现实论文中的运作方式。想象侦探有一个“共享全局记忆”板。侦探不再按顺序阅读,而是利用当前记忆板的状态作为引导,同时观察所有章节。对于每一个章节,他都会询问:“这一页是否包含一个尚未出现在我板上的线索?”如果答案是肯定的,他就把那个特定的线索提取出来。如果答案是否定的,他就忽略其余的噪音。

一旦他并行扫描完所有章节,他会只提取找到的这些线索,并将它们合并到记忆板上,从而构建出一幅更清晰、更完整的图景。然后,他重复这个过程。他再次查看所有章节,但这一次,他使用更新后的记忆板来引导自己。也许在第五章漏掉的一个线索,因为他在第 200 章找到了匹配的部分,突然变得清晰起来。他不断进行这些“轮次”的扫描,直到没有发现新线索或达到上限为止。最后,他仅利用整合在记忆板上的线索来破解谜题,而不是使用整本 360 万页的书。

研究人员在两个不同的 AI 模型(Qwen3.5 和 Qwen2.5)上测试了这种方法,使用的是名为 HotpotQA 的基准测试,该测试涉及回答需要跨越巨大文档寻找信息的棘手问题。他们将上下文长度推到了惊人的 360 万个 token(大约相当于一座大型图书馆的大小)。

结果令人瞩目。与旧有的“逐一阅读”方法(循环记忆)相比,PI-Mem 不仅能获得更好的答案,而且速度更快。在 360 万 token 的测试中,PI-Mem 比之前的最佳方法在准确率上提升了 6.25 到 7.81 个百分点。更令人印象深刻的是,它在大型模型上快了 6.1 倍,在小型模型上快了 2.1 倍。旧方法之所以如此缓慢,是因为侦探必须等待每一步完成后才能进入下一步。而 PI-Mem 通过并行阅读,将一条缓慢蜿蜒的小路变成了高速公路。

团队还使用了一种特殊的训练技术——强化学习(Reinforcement Learning),来教 AI 何时停止。他们给了 AI 一个“奖金”,如果 AI 在拥有足够证据的情况下能快速完成调查,就会获得奖励,从而防止它进行不必要的额外阅读轮次。这确保了系统不会在已经解决过的章节上浪费时间。

简而言之,这篇论文表明,通过改变 AI 处理长文档的方式——从一个缓慢的、顺序记录者转变为一个并行的、迭代的调查员——我们可以解决海量文本中的复杂问题,而不会丢失开头的线索。它证明了你不需要强迫 AI 同时记住一切;你只需要给它一种更好的方式,在发现碎片的同时将其组织起来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →