← 最新论文
💬 NLP

AgentCPM-Report: Interleaving Drafting and Deepening for Open-Ended Deep Research

AgentCPM-Report 是一个轻量级的本地深度研究系统,它利用类人的“以写促思”(Writing As Reasoning)策略来动态交替进行草拟与深化,使 8B 参数量的小型模型能够通过生成洞察力深刻的报告,超越领先的闭源系统。

原作者: Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yishan Li, Wentong Chen, Yukun Yan, Mingwei Li, Sen Mei, Xiaorong Wang, Kunpeng Liu, Xin Cong, Shuo Wang, Zhong Zhang, Yaxi Lu, Zhenghao Liu, Yankai Lin, Zhiyuan Liu, Maosong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对 AgentCPM-Report 论文的解释,通过日常语言和类比进行了翻译。

核心问题:“僵化蓝图”陷阱

想象一下,有人要求你写一篇关于“人工智能的未来”这样你几乎完全不了解的主题的长达 50 页的百科全书条目。

目前大多数 AI 系统的工作方式就像一个僵化的建筑师。在写下第一个字之前,他们试图画出一张完美、详细的整座建筑蓝图。他们在动工铺第一块砖之前,就决定了每一个房间的具体样子。

  • 缺陷: 如果建筑师在蓝图中犯了错误(在不知晓全局的情况下很难做到完美),那么整座建筑就注定失败。一旦开始施工,他们就无法轻易更改计划。
  • 后果: 为了做出好的蓝图,你需要一位天才建筑师(一个庞大、昂贵、闭源的 AI)。如果你使用较小、较便宜的 AI,蓝图通常很糟糕,最终生成的报告也会显得肤浅且乏味。

解决方案:“雕塑家”方法

该论文的作者创建了一个名为 AgentCPM-Report 的新系统。他们不再把 AI 当作建筑师,而是将其视为一名雕塑家

雕塑家不会预先计划好雕像的每一处曲线。他们从一块粗糙的石料(一个简单的轮廓)开始,凿去一些部分,观察形状,然后意识到:“噢,我还没考虑到这个细节,我需要在这里深挖一下。”他们在工作的过程中改变计划。

这被称为 WARP(写作即推理策略)。这意味着写作的行为本身就是思考的行为。AI 写完一个章节后,意识到内容太浅显,于是停下来,去寻找更多信息,更新计划,然后再继续写。

工作原理:两步舞步

AI 在两种模式之间交替切换,就像舞者变换舞步一样:

  1. 基于证据的起草(记录员): AI 选择大纲中的一个章节,在互联网上搜索事实,并写下一个段落。这就像是一个记录员在抄录他们发现的内容。
  2. 驱动推理的深化(侦探): 写完之后,AI 会退后一步并自问:“这足够好了吗?我是不是遗漏了什么?”
    • 如果答案是,它就会扮演侦探的角色。它会找出故事中的缺口,将该章节拆解为更小、更具体的问题,并更新大纲。
    • 如果答案是,它则继续进行下一步。

这种循环让 AI 能够在写作过程中发现新想法,而不是被困在最初那个糟糕的计划中。

训练过程:教一只小狗狩猎

该论文使用了一个相对较小的 AI 模型(仅有 80 亿参数,这在 AI 世界里属于“小规模”)。通常情况下,小模型不擅长复杂的规划。为了解决这个问题,团队采用了多阶段训练策略

  1. 冷启动(基础知识): 他们教 AI 字母表。它学习如何搜索、如何写句子以及如何遵循基本规则。
  2. 原子技能强化学习(专项训练): 他们练习特定的动作。他们教 AI 如何写一段的文字,或者如何提出一个的搜索问题,并针对其完成这些微小任务的表现给予奖励。
  3. 整体流水线强化学习(马拉松): 最后,他们让 AI 跑完整个赛程。他们不仅检查句子是否写得好,还检查整篇报告是否有深度。
    • 关键技巧: 他们使用了一种“轨迹剪枝”方法。想象一位老师在写长篇故事时在随机时间停下来。AI 查看了老师制作的所有草稿,挑选出最好的一个,然后说:“就在这里停止!”这教会了小型 AI 准确知道何时停止挖掘更多信息,以免浪费时间。

结果:小模型,大智慧

论文将该系统与来自 Google、OpenAI 和 Anthropic 等公司的最大、最昂贵的 AI 系统进行了对比测试。

  • 令人惊喜的结果: 这个小型、本地化的 AI(AgentCPM-Report)在生成有洞察力的报告方面击败了那些巨型闭源系统。
  • 原因: 因为“雕塑家”方法(WARP)让这个小 AI 能够随机应变。它不需要一个巨大的大脑来绘制完美的蓝图;它只需要擅长在工作过程中调整自己的计划。

为什么这很重要(根据论文观点)

  • 隐私: 由于该系统足够小,可以在你的个人电脑(或本地服务器)上运行,因此你不需要为了获得深度研究报告而将私密数据上传到大型公司的云端。
  • 成本: 你不需要支付昂贵、庞大的 AI 模型费用就能获得高质量的研究成果。
  • 质量: 报告更具深度和智慧,因为 AI 被允许在工作时改变主意,就像人类研究员一样。

简而言之: 论文表明,进行深度研究并不需要一个巨大的大脑;你只需要一种聪明的运作方式(WARP),让 AI 在写作的同时进行学习和适应。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →