← 最新论文
💬 NLP

Context Recycling for Long-Horizon LLM Inference

本文介绍了 ContextForge,这是一个通过结构化查询生成、外部记忆检索和受控合成来回收任务相关信息,从而增强长周期大语言模型(LLM)推理的系统,旨在无需扩大上下文窗口或重新训练模型的情况下,降低 Token 消耗并保持准确性。

原作者: Derek Thomas

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Derek Thomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图与一位非常聪明但记性不太好的助手进行一场漫长且复杂的对话。这位助手有一个严格的规则:他们的脑海中一次只能容纳大约 100 页的笔记。如果你说话 10 分钟,他们可能还能记得开头;如果你说一个小时,他们就会完全忘记开头的内容,因为他们的“心理笔记本”已经满了。

这篇论文介绍了一个名为 ContextForge 的系统,它解决了这个问题。它不把助手的有限记忆视为一个不断填满的桶,而是将其视为一个可重复使用的工作空间,就像办公室里的一张干净办公桌。

以下是其工作原理的拆解,通过简单的概念进行说明:

1. “可回收的办公桌”(上下文回收)

在大多数 AI 系统中,每当你提出一个新问题时,系统都会将你之前说过的一切内容都倾倒进助手的记忆中,希望它们能装得下。最终,办公桌会被旧笔记堆得杂乱无章,导致没有空间放置新笔记。

ContextForge 改变了规则:

  • 办公桌的大小是固定的: 助手始终拥有相同大小的办公桌空间(即“上下文窗口”)。
  • 清理小组: 在助手回答新问题之前,系统会清理掉与前一个话题相关的特定笔记。
  • 新话题: 然后,它会立即引入当前问题所需的确切新笔记。
  • 结果: 无论对话持续多久,助手永远不会耗尽空间。这就像一位图书管理员,始终准备着一张小巧、干净的桌子。当你询问“历史”时,他们会收起“历史”书籍,并换上“生物学”书籍。桌子的尺寸从未改变,但信息始终是最新的。

2. 五层图书馆(层级化记忆)

为了让这个办公桌系统发挥作用,作者构建了一个包含五层结构的图书馆,信息在其中以不同的速度和成本存在:

  • 第 -1 层(大脑的本能): 可选。 如果你拥有该 AI 模型,你可以通过调整其大脑权重来永久地“教导”它特定的术语或技能。这就像助手天生具备医学或编程的天赋,而无需每次都阅读书籍。这不占用任何“办公桌空间”。
  • 第 0 层(永久标牌): 这是系统的身份标识和高层规则。它会永久留在桌面上,就像一个“欢迎”标牌。它不需要被重新阅读。
  • 第 1 层(活跃书架): 这是“可回收”的部分。当你提出问题时,系统会抓取你需要的特定章节(或“分支”)知识,并将其放在桌面上。当你完成任务后,它会将书放回书架。
  • 第 2 层(超快速索引): 这是一个闪电般的目录。它告诉系统从庞大的图书馆中抓取哪本书,耗时不到一秒。它并不阅读书籍,只是指向正确的那一本。
  • 第 3 层(大型仓库): 这是实际的存储空间(硬盘),你的所有数据都存储在这里。它可以容纳数 TB 的信息(实际上是无限的),但访问速度较慢。系统仅从中提取所需内容。

3. “主动管家”

这个系统并没有等待你请求某本书后再跑去仓库寻找,而是配备了一位能够预判你需求的管家

  • 如果你每天上午 9:00 都会查看“晨会”笔记,管家会在 8:55 就将它们准备在桌面上。
  • 如果你正在查看“数据库”笔记,管家可能会顺便也把“模式(Schema)”笔记拉过来,因为它们通常是配套使用的。
  • 这一切都是自动进行的,使 AI 显得更快速、准备更充分。

4. “无需训练”的魔术技巧

论文还描述了一种巧妙的技巧,可以在无需昂贵训练的情况下赋予 AI 特定知识。

  • 旧方法: 要教 AI 医学知识,你通常需要喂给它数千本医学书籍,并在昂贵的图形卡上运行数天。
  • ContextForge 方法: 他们使用一种数学捷径(SVD)来观察 AI 对医学文本与普通文本的反应。然后,他们创建了一个微小的“适配器”(一个小型的插件),用于教导 AI 医学思维的“模式”。这在普通计算机上仅需约 3 分钟,且不需要专门的训练数据。

5. 数据说明

作者使用一个庞大的医疗保险记录数据集(2.76 亿行),将该系统与一个标准的、高端的 AI 智能体(Azure AI Foundry)进行了对比测试。

  • 准确性: 两个系统的回答正确率大致相当(约为 85% 对 84%)。
  • 速度: ContextForge 系统在 12 轮对话中快了 4.7 倍,在 15 轮对话中快了 8 倍
  • 成本(Token): 在短期测试中,它使用的“Token”(AI 用来衡量文本的货币)少了 4.2 倍;在长期测试中,则少了 13.4 倍

为什么差距会拉大?
随着对话变长,标准 AI 每次都必须重新发送整个聊天历史,这使得它变得越来越慢且越来越贵。而 ContextForge 系统保持了“办公桌”的整洁,只发送新的、相关的信息,因此无论对话多长,它都能保持快速且廉价。

总结

论文认为,与其试图为 AI 构建越来越大的记忆桶,不如将记忆视为计算机中的一个工作集:加载你需要的内容,使用它,然后将其清理掉。通过将知识组织成层级结构并回收工作空间,你可以与 AI 进行长期的、复杂的对话,而不会让它变得缓慢、昂贵或健忘。

该系统是开源的,并且可以与现有的 AI 模型配合使用,这意味着你不需要发明一种新型 AI 就能获得这些好处;你只需要更好地管理记忆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →