← 最新论文
💬 NLP

COSEARCH: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

该论文提出了 CoSearch 框架,通过引入语义分组策略和复合奖励机制,利用 GRPO 算法联合优化推理智能体与生成式文档排序模型,从而有效解决了现有方法中检索系统固定导致的性能瓶颈,在多个问答基准测试中显著提升了智能搜索的整体表现。

原作者: Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 COSEARCH 的新系统,它旨在解决人工智能(AI)在回答复杂问题时遇到的一个核心痛点:“找错资料”

为了让你轻松理解,我们可以把整个系统想象成一个**“侦探破案”**的过程。

1. 核心问题:侦探很聪明,但助手很笨

想象一下,你雇佣了一位超级侦探(这就是现在的 AI 大模型,比如 Qwen),他逻辑推理能力极强,擅长分析线索。但是,这位侦探自己不能直接去图书馆查书,他必须依赖一个图书管理员助手(这就是“检索系统”)去帮他找资料。

  • 以前的做法(Search-R1 等): 我们只拼命训练侦探,让他变得更聪明、更会提问。但是,那个图书管理员助手是固定不变的。如果侦探问“那个 1990 年出生的演员是谁”,助手可能因为笨拙,把一本关于"1990 年出生的厨师”的书递给了侦探。侦探再聪明,拿到错误的书,也只能得出错误的结论。
  • 论文发现的真相: 作者做了一个实验,假设有一个“全知全能的完美助手”(Oracle),能直接把正确答案的书放在侦探手边。结果发现,侦探的成绩瞬间提升了 14% 到 26%!这说明,限制侦探发挥的瓶颈,不是侦探不够聪明,而是助手找书太烂了。

2. 解决方案:COSEARCH(让侦探和助手一起“练级”)

COSEARCH 的核心思想就是:别只练侦探了,让侦探和助手一起训练,互相配合!

在这个新系统里:

  • 侦探(主智能体): 负责思考、提问。
  • 助手(生成式排序模型): 负责从一堆候选书籍中,挑出最 relevant(相关)的几本,并按重要性排序给侦探看。

它们是怎么一起训练的?
这就好比侦探和助手在打一场**“团队游戏”**。

  • 如果侦探最后猜对了答案,两个人都加分(因为助手找对了书,侦探推理对了)。
  • 如果侦探猜错了,系统会分析:是侦探推理错了?还是助手给的书不对?
  • 通过这种强化学习(RL),侦探学会了怎么问更好的问题,而助手也学会了怎么根据侦探的问题,更精准地挑书。

3. 两个技术难点(用通俗比喻解释)

把这两个组件放在一起训练,遇到了两个大麻烦,作者用两个巧妙的办法解决了:

难点一:怎么给助手打分?(语义分组策略)

  • 问题: 侦探每次问的问题都不一样(比如一次问“苹果”,一次问“香蕉”)。如果我们要训练助手,通常需要针对同一个问题,让助手给出多个不同的答案来比较谁更好。但侦探每次生成的“子问题”都不一样,没法直接比较。
  • 比喻: 就像教练要训练球员射门。如果球员 A 射的是球门左上角,球员 B 射的是右下角,教练没法直接说“谁射得更好”,因为目标不同。
  • 解决办法(语义分组): 作者发现,虽然侦探问的字面不同,但意思往往是一样的(比如“苹果”和“红富士”)。于是,他们把意思相近的问题自动归为一组。这样,助手在面对“同一类问题”时,就可以比较哪种找书策略更好了。这就像教练把射向“左上角”的所有球员归为一组进行特训,而不需要让每个人都去射不同的角。

难点二:怎么给助手发奖金?(复合奖励机制)

  • 问题: 助手找书好不好,不能只看最后侦探猜没猜对。有时候侦探太笨,书找对了也猜错;有时候书找错了,侦探靠运气蒙对了。
  • 比喻: 就像给快递员发奖金。如果只看“客户是否收到货”,那快递员可能会为了送得快而送错地址。
  • 解决办法(复合奖励): 作者设计了一个双重奖金制度
    1. 即时奖金(相关性): 只要助手把“正确答案”的书放在了最上面,不管侦探最后猜没猜对,助手先拿一部分奖金。这鼓励助手先找对书
    2. 长期奖金(结果导向): 如果书找对了,且侦探最终也猜对了,助手再拿一笔大奖金。这鼓励助手配合侦探把事做成

4. 实验结果:效果拔群

作者在 7 个不同的问答测试集上进行了测试(包括单步问题和需要多步推理的复杂问题):

  • 成绩提升: 相比以前只训练侦探、固定助手的方法,COSEARCH 让整体准确率提升了 6.6% 到 10.8%
  • 效率提升: 因为助手找书更准了,侦探不需要反复问“再帮我找一下”,搜索次数减少了,破案速度更快。
  • 小模型也能赢: 即使侦探是个“小个子”(30 亿参数的小模型),只要配上这个经过训练的“超级助手”,也能打败那些用“大模型 + 笨助手”的组合。

总结

这篇论文告诉我们,未来的 AI 搜索系统,不能只盯着“大脑”(推理能力)练,必须让“大脑”和“眼睛”(检索能力)同步进化

COSEARCH 就像是一个**“师徒结对”**的训练营,让负责找资料的助手和负责思考的侦探在实战中互相磨合,最终实现 1+1 > 2 的效果。这不仅是技术的进步,更是让 AI 从“单打独斗”走向“团队协作”的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →