← 最新论文
🤖 AI

Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning

本文介绍了 AGCLR,这是一种通过添加门控持久记忆流来增强 CoCoNuT 推理范式的方法,旨在克服因覆盖中间事实而导致的“概念瓶颈”问题,从而在推理深度增加时显著提升多跳推理任务的性能。

原作者: Mujtaba Farhan, Maheep Chaudhary

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Mujtaba Farhan, Maheep Chaudhary

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

问题所在:“模糊的白板”

想象一个大型语言模型(比如一个非常聪明的机器人)正在尝试解决一个复杂的谜题,比如一个多步骤的数学题,或者一个需要寻找多个线索的侦探故事。

这篇论文指出了一种名为 CoCoNuT 的新思维方式中存在的一个特定问题。在这种方法中,机器人不会用文字写下它的想法(例如“第一步:把这些数字相加”)。相反,它在自己的大脑内部(潜空间)进行“无声的低语”。它通过不断地将这些低语传回给自己来构建解决方案。

缺陷: 作者称之为 “概念瓶颈”(Concept Bottleneck)
想象机器人只有一个小小的、单一的白板。每当它产生一个新的想法时,它都会擦掉之前的想法,为新想法腾出空间。

  • 想法 1: “答案是 5。”(写在板上)。
  • 想法 2: “等等,我需要乘以 2。”(机器人擦掉了“5”来写下这个新想法)。
  • 想法 3: “所以答案是 10。”(机器人忘记了它最初是从 5 开始的)。

随着推理过程变得越来越长(步骤越来越多),机器人会忘记在最初几步中发现的关键事实。这就像是在解一道很长的数学题,却在按下下一个按钮之前,不断地把计算器的屏幕擦干净。论文表明,在处理困难的多步任务时,这会导致机器人出错,或者随着任务难度增加而表现变差。

解决方案:AGCLR(“智能笔记本”)

为了修复这个问题,作者创建了一个名为 AGCLR 的新系统。

与其使用一个会被擦除的单一白板,不如想象机器人现在有一个放在白板旁边的 智能笔记本。这个笔记本有三个特殊的“门”(就像保安一样),控制着信息的输入和输出:

  1. 写入门(记录员/The Scribe): 当机器人发现一个重要的事实(例如“答案以 5 开头”)时,这个门会决定:“这足够重要,值得写进笔记本吗?” 如果是的,它就会保存下来;如果不是,它就会忽略。
  2. 读取门(研究员/The Researcher): 当机器人需要解决下一步时,这个门会说:“让我查一下笔记本,看看我们之前学到了什么。” 它将旧的事实重新拉回到机器人的活跃思维中。
  3. 遗忘门(清洁工/The Janitor): 有时,机器人会被无关的细节干扰(例如在解数学题时想到“天空是蓝色的”)。这个门会说:“把那个扔掉,” 这样笔记本就不会被垃圾填满。

实际应用中的运作方式

论文在三类挑战上对该系统进行了测试:

  • 数学 (GSM8K): 解决应用题。
  • 侦探工作 (HotpotQA): 回答需要从多个不同段落中寻找线索的问题。
  • 规划 (ProsQA): 确定实现目标的步骤序列。

结果:

  • 没有笔记本(原生 CoCoNuT): 随着谜题变得越来越长,机器人的表现下降了。它忘记了早期的线索。
  • 有了笔记本(AGCLR): 机器人保护好了它的事实。即使在最难、最长的谜题上,它的表现也变得更好了。
    • 在“侦探工作”任务中,它提升了 3.6%
    • 在“规划”任务中,它提升了 4.0%

一个关键发现:“写一次,读多次”

作者做了一个很酷的实验,观察这些“门”是如何工作的。他们尝试阻止机器人在前两步之后向笔记本写入新的内容。

令人惊讶的是,机器人的表现几乎完美!
这告诉我们,机器人不需要不断地重写整个故事。它只需要在早期阶段(前几步)捕捉到关键事实,然后把剩下的时间花在阅读和记忆这些事实上。“智能笔记本”充当的是一个永久的记忆库,而不仅仅是一个临时的草稿本。

总结

这篇论文认为,目前的 AI 推理方法就像是试图通过只记住最后一句话来记住一个长篇故事。作者通过给 AI 一个持久的记忆流(一个笔记本),让它能够进行写入、读取和清理,从而解决了这个问题。这使得 AI 能够解决更长、更复杂的问题,而不会丢失思路。

该论文 并未 声称:

  • 它不声称这适用于医疗诊断或临床用途。
  • 它不声称这适用于大规模超级计算机(他们仅在名为 GPT-2 的较小模型上进行了测试)。
  • 它不声称这已经准备好用于商业产品;这是一个研究实验。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →