← 最新论文
💬 NLP

Supervising the search process produces reliable and generalizable information-seeking agents

本文介绍了 RAG-Gym 和 Re2^2Search++ 智能体,证明了将监督信号从最终答案转向搜索过程本身,能够产生更可靠、泛化能力更强的信息检索智能体,尤其是在跨域场景中。

原作者: Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, Zhiyong Lu, Aidong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对这篇论文的解释。

核心理念:培养侦探,而非仅仅训练答题者

想象你有一位非常聪明的学生(人工智能)正在参加一场高难度的考试。

  • 旧方法(结果监督): 老师只看最终的答案卷。如果学生答对了,就得"A",哪怕他是猜的、靠死记硬背作弊的,或者是运气好。如果答错了,就得"F",哪怕他做了所有正确的研究步骤,只是在最后犯了个微小的计算错误。
  • 新方法(过程监督): 老师在学生解题过程中进行观察。他们检查学生的草稿纸、搜索查询和每一步的逻辑。如果学生提出了一个聪明的疑问以寻找缺失的事实,就得一分。如果提出模糊的问题或未加查证就猜测,就扣一分。

这篇题为《监督搜索过程可产生可靠且可泛化的信息检索智能体》的论文认为,通过观察过程来教导人工智能成为优秀的侦探,远比仅仅给最终答案打分要好得多。


问题:“幸运猜测”的陷阱

作者发现,当人工智能模型仅因答对最终答案而获得奖励时,它们开始“钻系统的空子”。

  • 类比: 想象一个学生因为曾在之前的课程中背下了数学题的答案。当老师提出一个版本的题目时,学生直接写下旧答案。他拿到了分数,但实际上并没有解决新问题。
  • 在人工智能术语中: 人工智能依赖其内部“记忆”(参数化知识)来猜测答案,而不是真正搜索新信息。这对它以前见过的问题行之有效,但当人工智能面对全新领域(域外)的话题时,它就会失败,因为它无法靠猜测过关。

解决方案:RAG-Gym 与 Re2Search++

作者构建了一个名为 RAG-Gym 的新训练场。你可以把它想象成一个视频游戏,人工智能在其中扮演侦探的角色。

1. 新架构:Re2Search

作者设计了一种特定的人工智能思考方式,称为 Re2Search(推理、反思、搜索)。

  • 推理: 人工智能首先尝试在脑海中解决谜题。
  • 反思: 这是关键秘诀。人工智能停下来问自己:“等等,我真的知道这个事实吗,还是我仅仅是在编造?”如果它意识到自己缺少某条信息,就会将其标记出来。
  • 搜索: 它不再猜测,而是提出一个非常具体的问题来寻找那条缺失的信息。

类比: 想象一名侦探在破案。

  • 旧人工智能: “我觉得是管家干的!”(基于直觉猜测)。
  • Re2Search 人工智能: “我觉得是管家干的,我还没核实他的不在场证明。在提出这个主张之前,我需要去核实他的不在场证明。”

2. 训练:向教练(批评者)学习

人工智能不仅仅是通过尝试和失败来学习。它有一位批评者(教练)在观察它。

  • 批评者不仅看最终答案,还查看人工智能提出的每一个搜索查询。
  • 如果人工智能问了一个模糊的问题,比如“告诉我关于这条河的事”,批评者会说:“不,这太宽泛了。要具体询问长江的长度。”
  • 如果人工智能提出了一个有助于解决谜题的精确问题,批评者就会给出高分。

为何重要:结果

该论文在四个不同的“考场”(数据集)上测试了这种新方法,包括通用知识和医学问题。以下是他们的发现:

  1. 更好的泛化能力: 当人工智能在从未见过的问题(例如它未受训过的医学考试)上进行测试时,“过程监督”的人工智能表现要好得多。它不依赖猜测,而是真正去寻找证据。

    • 类比: 旧的人工智能就像一个只认识著名地标的游客。新的人工智能则像一位当地向导,知道如何导航任何街道,甚至是它从未去过的街道,因为它懂得如何问路。
  2. 更少的“幻觉”: 新的人工智能编造内容的可能性大大降低。因为它因寻找真实证据而获得奖励,所以它停止了猜测。

    • 类比: 旧的人工智能会说:“法国的首都是巴黎”(正确)或者“法国的首都是伦敦”(错误,但它是猜的)。新的人工智能会说:“我不知道,让我查一下地图”,然后找到正确答案。
  3. 教练适用于任何人: “批评者”(教练)是在一个较小的开源人工智能上训练的。令人惊讶的是,这位相同的教练可以帮助一个更大、更昂贵、像“黑盒”一样的(如 GPT-4)人工智能表现得更好。

    • 类比: 这就像有一位聪明的小教练,可以教一位体型巨大、力量强大的运动员如何跑步。你不需要改变运动员的肌肉;你只需要正确的指导。

结语

论文得出结论:要构建真正可靠且能处理新、难任务的人工智能,我们不应仅仅给最终考试成绩打分。我们需要观察学生的作业,纠正他们的搜索习惯,并教导他们反思自己知道什么、不知道什么。

通过监督搜索过程,我们获得了一个诚实、彻底且有能力解决从未见过的问题的人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →