← 最新论文
🤖 AI

Critic-R: Improving Agentic Search using Instruction-tuned Retrievers with Natural Language Introspective Feedback

该论文提出了 Critic-R,这是一个通过引入一个能够提供自然语言内省反馈的评论家模型来增强智能体搜索的框架,从而实现迭代查询优化和自动检索模型优化,且无需人工相关性标注。

原作者: Md Zarif Ul Alam, Alireza Salemi, Hamed Zamani

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Zarif Ul Alam, Alireza Salemi, Hamed Zamani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图解决一个非常棘手的谜题,比如弄清楚一位电影导演的母校名称。你有一位才华横溢的侦探(AI 推理智能体),他懂得如何思考,但他无法看到自己思想之外的世界。为了解决这个谜题,他需要请求一位图书管理员(检索模型)从庞大的图书馆中取回书籍(文档)。

在旧有的处理方式中,侦探会向图书管理员索要一本书,然后直接接收被递过来的任何东西,并立即尝试解决谜题。如果拿到的书不对,侦探通常也会硬着头皮去猜,或者陷入僵局。图书管理员一直被视为一个“黑盒”——你无法真正修复他们,只能寄希望于他们能做对。

这篇论文介绍了一个名为 Critic-R 的新系统,它通过引入第三个角色改变了这种动态关系:评论家(The Critic)

三个角色

  1. 侦探(推理者/The Reasoner): 试图回答问题的聪明 AI。他会想:“我需要先找到导演,”然后询问图书管理员。
  2. 图书管理员(检索者/The Retriever): 系统负责搜索图书馆并递交前几本相关的书。
  3. 评论家(新加入的角色/The Critic): 一位独立的、目光敏锐的编辑,观察着整个过程。评论家不仅看书本身,还观察侦探对这些书的描述。

它是如何运作的:两部分策略

论文提出了两种使用这位评论家来让系统变得更聪明的方法。把它们想象成“即时修复”和“为未来训练”。

1. Critic-R-Zero:“重来一次”按钮(推理时/Inference-Time)

想象侦探向图书管理员索要一本关于“克里斯托弗·诺兰”的书。图书管理员递过来一本关于这部电影情节的书,但其中并没有提到他的学校。

  • 没有评论家时: 侦探可能会感到困惑,并给出一个错误的答案。
  • 有了 Critic-R-Zero 时: 评论家观察到了侦探的内心想法(“我需要导演的传记,但这本书只讲了剧情”),然后说:“停!这本书没用。让我们再试一次。”

随后,评论家重写了给图书管理员的请求,使其更加具体:“寻找克里斯托弗·诺兰的传记,而不是电影情节。”图书管理员再次尝试,找到了正确的书,侦探终于可以解开谜题了。

这发生在 AI 工作期间的瞬间。这就像有一个教练站在球员身边,大喊:“那次传球很糟糕,换个角度再试!”而不需要改变球员本身的训练。

2. Critic-Embed:“训练营”(检索器微调/Retriever Fine-Tuning)

“重来一次”的方法很棒,但每次提问时都会消耗额外的计算时间和资源。为了让图书管理员永久性地变得更好,作者利用这些“重来一次”的环节创建了一个训练营

  • 每当评论家说“那本书不好,再试一次”时,系统都会保存那个时刻。
  • 它将那本“坏书”保存为负面示例(不要选这个!)。
  • 它将最终奏效的“好书”保存为正面示例(选这个!)。

作者随后利用这些保存下来的示例来教导图书管理员如何在第一次尝试时就选对书,而无需人类来对每一本书进行评分。图书管理员从自己的错误和成功中学习,成为了一个更优秀的搜索者。

结果:为什么这很重要

作者在一些需要跨多个文档建立联系的极难问题上测试了这个系统(例如:“谁导演了那部获得过某位演员出演电影之获奖影片?”)。

  • 侦探 + 评论家(Zero): 即使使用标准的、未经训练的图书管理员,加入评论家的“重来一次”循环也显著提高了答案的准确性。它即时修复了错误。
  • 经过训练的图书管理员(Embed): 使用评论家反馈进行训练后的图书管理员变得如此出色,以至于即使没有“重来一次”的循环,其表现也优于其他先进系统。
  • 完整的团队(Critic-R): 当他们将超强训练的图书管理员与评论家的“重来一次”循环结合在一起时,得到了最好的结果。这就像拥有了一位世界级的图书管理员,同时还有一个安全网来捕捉任何残留的错误。

核心结论

该论文认为,在 AI 搜索中,图书管理员(检索器)往往是薄弱环节,而不是侦探(推理者)。通过添加一个检查工作并提供反馈的评论家,你既可以即时修复错误,也可以通过反馈训练图书管理员在未来做得更好。

提到的重要局限性:
论文指出,该系统依赖于侦探足够聪明,能够意识到自己掌握了错误的信息。如果侦探过于简单或容易困惑,评论家就无法获得有效的信号来进行工作。此外,测试是在静态图书馆(维基百科)上进行的,作者尚未在混乱的、实时的互联网搜索中测试该系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →