← 最新论文
💬 NLP

ReSum: Unlocking Long-Horizon Search Intelligence via Context Summarization

本文提出了无需训练即可通过外部工具压缩交互历史来突破上下文限制的 ReSum 框架,并辅以基于优势广播的 ReSum-GRPO 微调策略,显著提升了大语言模型在长程搜索任务中的表现。

原作者: Xixi Wu, Kuan Li, Yida Zhao, Liwen Zhang, Litu Ou, Huifeng Yin, Zhongwang Zhang, Xinmiao Yu, Dingchu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Minhao Cheng, Shuai Wang, Hong Cheng, Jingren Zhou

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xixi Wu, Kuan Li, Yida Zhao, Liwen Zhang, Litu Ou, Huifeng Yin, Zhongwang Zhang, Xinmiao Yu, Dingchu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Minhao Cheng, Shuai Wang, Hong Cheng, Jingren Zhou

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 ReSum 的新方法,旨在解决大语言模型(LLM)在上网搜索复杂信息时遇到的一个核心难题:“脑子记不住那么多事”

为了让你更容易理解,我们可以把大语言模型想象成一个超级聪明的侦探,而 ReSum 就是给这位侦探配备的**“智能记事本”**。

以下是用通俗语言和生动比喻对这篇论文的解读:

1. 核心难题:侦探的“记忆容量”不够用

想象一下,侦探(AI 模型)要去查一个非常复杂的案子(比如:“找出那个父亲死于心脏病、有三个前妻、五个孩子,且写过一本特定书的人是谁?”)。

  • 传统做法(ReAct 模式): 侦探每查一次资料,就把所有的线索、思考过程、搜索结果全部写在一张无限长的纸上,贴在墙上。
  • 问题所在: 侦探的“脑子”(上下文窗口)容量是有限的。如果案子太复杂,需要查几十次,那张纸就会长得贴满整个房间,甚至把侦探的视线都挡住了。结果就是,侦探还没查完,纸就写满了,后面的线索根本看不到了,案子就破了。
  • 现有的笨办法: 以前的解决方案像是给侦探换个大点的脑子(修改模型架构),但这需要重新训练,而且让侦探变得不兼容以前的工具,成本极高。

2. ReSum 的解决方案:定期“写摘要”

ReSum 的核心思想非常简单:“定期把长纸卷起来,只保留精华。”

  • 怎么做? 当侦探查了一会儿,发现纸快写满了,ReSum 就会叫来一个**“超级秘书”**(ReSumTool-30B)。
  • 秘书的工作: 秘书快速阅读侦探之前写的所有杂乱笔记,提炼出最关键的线索(比如:关键人物、时间线、已排除的选项),然后写一张**“精华摘要”**。
  • 重启侦探: 侦探把那张长长的旧纸扔掉,只拿着这张“精华摘要”重新开始查案。
  • 效果: 侦探的“脑子”永远只装着最新的线索和最重要的摘要,空间永远够用,可以无限期地查下去,直到破案。

比喻: 就像你在玩一个超长 RPG 游戏,传统做法是你要记住从游戏开始到现在的所有对话(内存爆炸);而 ReSum 的做法是,每过一章,系统自动帮你生成一份“剧情回顾”,你只需要带着这份回顾继续玩下一关,既不会迷路,也不会卡死。

3. 两个关键升级

为了让这个“记事本”更好用,论文还做了两件事:

A. 训练了一个“超级秘书” (ReSumTool-30B)

普通的秘书(通用大模型)可能只会把笔记抄一遍,分不清重点。

  • 创新: 作者专门训练了一个 300 亿参数的“超级秘书”。它非常擅长从一堆乱七八糟的搜索记录中,一眼看出哪些是破案关键,哪些是废话,还能指出“这里还缺什么线索,下一步该查哪”。
  • 效果: 这个秘书虽然个头不大(30B),但写摘要的能力比那些几百亿参数的“巨无霸”还要强,而且速度更快、更省钱。

B. 教侦探“适应新习惯” (ReSum-GRPO)

刚开始,侦探习惯了“把所有东西都记下来”,突然让他看“摘要”,他可能会懵,不知道该怎么基于摘要继续推理。

  • 创新: 作者用了一种叫 GRPO 的强化学习方法(有点像教练带队员训练)。
    • 训练方法: 教练把侦探的查案过程切成一段一段的(每段对应一次摘要)。
    • 奖励机制: 只要最后案子破了,教练就给整个查案过程(包括之前所有的段落)发奖金。
    • 目的: 这让侦探明白,“写好摘要”和“基于摘要推理”也是破案的关键。它学会了如何从精简的信息中继续思考,而不是依赖冗长的历史。

4. 实验结果:小模型也能干大事

  • 不用训练也能用: 即使不重新训练侦探,直接给普通侦探配上这个“摘要系统”,破案率也比传统方法提高了 4.5%。
  • 训练后更强: 如果让侦探经过少量的“摘要特训”(只用 1000 个样本),它的表现会突飞猛进,甚至能打败那些花了巨大成本训练出来的顶级商业模型。
  • 性价比之王: 相比于其他需要修改模型架构的复杂方案,ReSum 就像是一个**“即插即用”的插件**,不需要大动干戈,就能让现有的 AI 拥有无限探索的能力。

总结

ReSum 就像给 AI 侦探装了一个**“智能记忆压缩器”
它不再让 AI 死记硬背所有历史,而是教会它
“抓重点、做总结、带着精华继续干”**。这不仅解决了 AI 记不住长任务的痛点,还让中小规模的模型也能通过“聪明地总结”,完成那些原本只有超级大模型才能完成的复杂搜索任务。

一句话概括: 别试图把整个图书馆塞进脑子里,学会写“读书笔记”,你就能读遍天下书。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →