← 最新论文
🤖 AI

IG-Search: Step-Level Information Gain Rewards for Search-Augmented Reasoning

本文提出了 IG-Search 框架,通过引入基于信息增益的细粒度步级奖励信号,解决了现有搜索增强推理方法中奖励稀疏及梯度消失的问题,在无需中间标注的情况下显著提升了模型在多跳问答等任务上的表现。

原作者: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

发布于 2026-04-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 IG-Search 的新方法,旨在教人工智能(大语言模型)如何更聪明地“上网查资料”来回答问题。

为了让你轻松理解,我们可以把 AI 想象成一个正在参加考试的聪明学生,而“上网搜索”就是他查阅教科书或图书馆的过程。

1. 以前的方法有什么问题?(“一锅端”的奖励)

在 IG-Search 出现之前,训练 AI 查资料就像这样:

  • 场景:老师(训练系统)给 AI 出了一道很难的题,让 AI 尝试 5 次不同的解题过程(这叫“轨迹”)。
  • 旧规则:只要这 5 次尝试中,有一次最终答案是对的,老师就给这 5 次尝试全部发一朵小红花(奖励)。
  • 问题
    • 好坏不分:其中一次尝试,AI 搜了非常精准的问题,直接找到了答案;另一次尝试,AI 搜了一堆废话,最后蒙对了答案。但在旧规则下,这两次搜题过程得到的奖励是一模一样的!AI 学不到“搜得准”比“瞎蒙”更好。
    • 全员挂科就“死机”:如果这 5 次尝试全都答错了,老师就认为这组尝试毫无价值,不给任何反馈(奖励为 0)。这时候 AI 就懵了,不知道哪一步搜错了,完全学不到东西。

比喻:就像你让 5 个侦探去破案。侦探 A 找到了关键线索但最后抓错了人;侦探 B 乱跑一通却误打误撞抓到了真凶。如果只奖励“抓对人”的结果,侦探 A 会觉得“我找线索没用”,侦探 B 会觉得“乱跑是对的”。这显然不合理。

2. IG-Search 是怎么做的?(“按步计分”的奖励)

IG-Search 的核心思想是:不要只看最后结果,要看每一步搜索有没有带来“新信息”。

它引入了一个概念叫信息增益(Information Gain, IG)

  • 核心逻辑
    想象 AI 在思考时,心里有一个“猜测答案的概率”。
    • 步骤 1:AI 搜了一个问题,拿到了几篇文档。
    • 步骤 2:AI 问自己:“看了这些文档后,我对正确答案的把握是不是变大了?”
    • 对比实验:为了公平,系统会假装 AI 搜到的是随机乱码(或者无关的文档)。
    • 计算:如果看了真实文档后,AI 对答案的把握比看乱码时高了很多,说明这次搜索非常有价值,AI 就得到奖励。如果看了文档和看乱码没区别,说明这次搜索是废话,没有奖励。

比喻
这就好比侦探在破案。

  • 侦探 A 搜到了“案发时间”的关键线索(信息增益高),哪怕最后没抓对人,老师也会说:“你刚才那个搜索很棒,继续保持!”
  • 侦探 B 搜了一堆“昨天天气不错”的废话(信息增益低),老师会说:“你刚才搜的没用,下次换个问题。”
  • 即使全员失败:就算最后 5 个侦探都抓错了人,老师也能根据他们谁搜的线索更有用,给那个搜得准的侦探发鼓励奖。这样 AI 就知道:“哦,原来搜‘案发时间’比搜‘天气’更重要”,哪怕最后没破案,它也学会了怎么搜。

3. 这个方法有什么特别厉害的地方?

  1. 不需要额外的人教:以前的方法需要人类专家去标注“哪一步搜得好”,这很贵。IG-Search 不需要,它自己就能算出“这次搜索有没有带来新信息”。
  2. 不怕“全军覆没”:这是最大的突破。以前如果所有尝试都错了,训练就停了。现在,只要 AI 搜到了有用的信息,哪怕最后答案错了,它也能得到反馈,继续变强。
  3. 多步推理更强:对于那种需要“先搜 A,再根据 A 搜 B,最后得出 C"的复杂问题(多跳推理),IG-Search 能精准地告诉 AI 哪一步搜得好,哪一步搜偏了。

4. 实验结果如何?

作者用这个新方法训练了 AI,在 7 个不同的问答测试中(包括简单的单步问题和复杂的多步问题):

  • 成绩更好:比目前最强的其他方法(如 MR-Search)平均高了 1.6 分。
  • 复杂题更强:在需要多步推理的难题上,提升尤为明显。
  • 速度快:虽然计算更细致了,但训练速度只慢了 6.4%,几乎可以忽略不计,而且推理(做题)速度没变。

总结

IG-Search 就像是给 AI 装了一个**“过程评分器”**。它不再只盯着“最终答案对不对”,而是盯着“你刚才搜的那个问题有没有帮你更接近真相”。

  • 如果你搜到了干货,哪怕最后没做对题,你也得到了表扬(因为你的搜索方向是对的)。
  • 如果你搜了一堆垃圾,哪怕最后蒙对了,你也没得到多少表扬(因为运气成分大,搜索没起作用)。

这种方法让 AI 在“思考”的过程中,学会了如何更精准地提问更有效地利用搜索工具,从而在解决复杂问题时表现得更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →