← 最新论文
💻 computer science

OpenResearcher: A Fully Open Pipeline for Long-Horizon Deep Research Trajectory Synthesis

OpenResearcher 提出了一种完全开源且可复现的离线研究轨迹合成管道,通过利用 1500 万文档语料库和 GPT-OSS-120B 教师模型生成 9.7 万条长程轨迹,成功将 30B 模型在 BrowseComp-Plus 基准上的准确率提升了 34 个百分点。

原作者: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuofeng Li, Dongfu Jiang, Xueguang Ma, Haoxiang Zhang, Ping Nie, Yuyu Zhang, Kai Zou, Jianwen Xie, Yu Zhang, Wenhu Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 OpenResearcher 的新项目。为了让你轻松理解,我们可以把“深度研究”想象成在一个巨大的、混乱的图书馆里寻找一本特定的书,并写出一篇完美的读书报告

1. 以前的困境:昂贵的“活体”图书馆

以前,训练 AI 做这种深度研究(Deep Research)就像让 AI 去真实的、24 小时营业的图书馆里找书。

  • 太贵了:每次 AI 问图书管理员(搜索引擎)一个问题,都要付钱。如果 AI 问错了方向,钱也照付。
  • 太不稳定了:图书馆里的书今天有,明天可能就被搬走了;或者管理员今天心情好,明天就换人了。这导致很难重复之前的实验。
  • 太慢了:因为要等真实的网络响应,训练速度很慢。

2. OpenResearcher 的绝招:建造一个“离线模拟图书馆”

OpenResearcher 团队想出了一个聪明的办法:既然去真实图书馆太麻烦,那我们就自己造一个“离线模拟图书馆”吧!

  • 第一步:一次性“进货”(Bootstrap)
    他们先花一次性的功夫,去真实互联网上把那些能回答问题的重要书籍(1 万本“黄金文档”)找出来,复印好。
  • 第二步:建立“模拟书架”
    他们把这 1 万本重要书籍,和 1500 万本普通的“干扰书籍”(来自 FineWeb 数据集)混合在一起,放在一个本地的离线服务器里。这就构成了一个完全可控的、不会变的、免费的“模拟图书馆”。
  • 第三步:给 AI 配备“三件神器”
    为了让 AI 像真人一样研究,他们给了 AI 三个简单的工具:
    1. 搜索 (Search):像去书架目录查书,找到大概在哪。
    2. 打开 (Open):把书从书架上拿下来,翻开看全文。
    3. 查找 (Find):在打开的书里,用 Ctrl+F 快速定位具体的句子或名字。

3. 训练过程:让“老师”带“学生”练手

  • 老师 (Teacher):他们请了一位超级聪明的 AI 老师(GPT-OSS-120B),在这个“离线模拟图书馆”里,针对 6000 个难题,自己摸索着找答案。
  • 学生 (Student):老师在这个过程中走了 9.7 万条不同的“找书路径”(有些路径很长,甚至走了 100 多步才找到答案)。这些路径被记录下来,用来训练一个较小的 AI 学生(30B 模型)。
  • 结果:这个学生只用了几个小时的训练,就学会了如何像专家一样在图书馆里穿梭。

4. 惊人的成绩

  • 省钱又高效:因为是在离线环境里跑,不需要付给谷歌或必应一分钱,而且可以成千上万次地同时运行,速度极快。
  • 实力超群:训练出来的模型,在“深度研究”的考试(BrowseComp-Plus)中,准确率达到了 54.8%
    • 这比它原本的基础能力(20.8%)提升了 34 个百分点
    • 甚至打败了很多昂贵的商业大模型(如 GPT-4.1, Claude-4 等),那些模型在这个任务上只有 30% 多的准确率。
  • 举一反三:最厉害的是,虽然它是在“模拟图书馆”里练出来的,但把它放到真实的互联网上考试,它依然表现优异,说明它真的学会了“找书”的逻辑,而不是死记硬背。

5. 核心发现:不仅仅是“找到书”

通过在这个可控环境里的详细分析,他们发现了一些有趣的道理:

  • 光找到书不够:很多 AI 虽然找到了正确的书(黄金文档),但如果不会“打开”并“仔细查找”里面的细节,还是答不对题。这就好比找到了字典,却没翻到那个字。
  • 失败也有价值:即使是找错答案的路径,也包含了宝贵的信息(比如它是怎么走弯路的),这些“失败案例”对训练 AI 同样有用。
  • 工具很重要:如果只给 AI“搜索”功能,不给它“打开”和“查找”的功能,它的表现会大打折扣。就像只给地图不给望远镜,很难看清细节。

总结

OpenResearcher 就像是为 AI 研究能力建造了一个免费的、可无限复制的“飞行模拟器”
以前训练 AI 做深度研究,就像让飞行员在真实的暴风雨中练习,既危险又昂贵。现在,OpenResearcher 提供了一个完美的模拟环境,让 AI 可以在里面安全、廉价、高效地练习成千上万次,最终练就了一身能在真实世界中“深度搜索、精准推理”的绝技。

这不仅让 AI 变得更聪明,也让整个研究社区能更透明、更公平地探讨如何训练出更好的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →