← 最新论文
💬 NLP

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

本文介绍了 ReaLM-Retrieve,这是一个通过在大推理模型的推理步骤层面检测知识缺口来优化检索时机的框架,与标准和固定间隔方法相比,该框架显著提高了答案准确性和检索效率,同时减少了不必要的检索调用。

原作者: Dongxin Guo, Jikun Wu, Siu Ming Yiu

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongxin Guo, Jikun Wu, Siu Ming Yiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和日常类比对论文《推理时何时检索:面向大型推理模型的自适应检索》的解释。

核心问题:“图书馆访问”的不匹配

想象你是一位才华横溢的侦探(即大型推理模型),正在试图解开一个复杂的谜团。你有一个笔记本,用来一步步写下你的思路。有时,你会因为不知道某个具体事实而卡住,比如证人的名字或事件的日期。

旧方法(标准 RAG):
目前,大多数系统就像一位图书管理员,在你开始在笔记本上书写之前,就递给你一摞书。你读完这些书,然后尝试解决整个谜团。

  • 缺陷: 如果你在长达 20 页的思考过程中途卡住,因为忘记了某个细节,你就无法回头去索取新的书籍。你只能依赖最初获得的信息,即使这些信息不足以支撑后续的步骤。

新方法(ReaLM-Retrieve):
这篇论文介绍了一个名为 ReaLM-Retrieve 的系统。侦探不再一次性拿到所有书籍,而是被允许在书写笔记的中途前往图书馆,但仅限于真正需要的时候。

工作原理:三大“魔法工具”

研究人员构建了一个包含三个主要部分的系统,以实现这种“思考中途的图书馆之旅”完美运作。

1. “信心检查”(步骤级不确定性)

想象侦探在笔记本的每一段之后都会暂停。他们会问自己:“我真的是知道这个,还是只是在猜测?”

  • 旧方法要么检查每一个单词(太频繁),要么检查每一个句子(太僵化)。
  • ReaLM-Retrieve逻辑步骤层面进行检查。它会问:“我刚刚是否完成了一个完整的想法?我对接下来的逻辑跳跃感到不确定吗?”
  • 如果侦探感觉到“知识缺口”(不确定性),系统就会发出标记。这就像汽车的“检查引擎”灯,只有当汽车真正需要燃油时才会亮起,而不是仅仅因为引擎在运转就亮起。

2. “智能经理”(学习到的干预策略)

仅仅因为侦探感到不确定,并不意味着他们应该每次都跑去图书馆。有时他们只是在深入思考,而不是遗漏了事实。

  • 这个系统就像一位坐在侦探旁边的智能经理
  • 经理查看“信心检查”结果和案件历史。它会决定:“好吧,我们确实需要现在就查阅那个具体事实,”或者“不,继续思考,你会想出来的。”
  • 它还能帮助侦探向图书管理员(搜索查询)提出完美的问题,确保侦探拿到的是恰好正确的那一页,而不是一整本无关的信息。

3. “快速配送”(高效集成)

去图书馆需要时间。如果侦探每次需要事实时都停下来花 5 分钟,整个过程就会变得缓慢。

  • 研究人员建立了一个高速配送服务
  • 他们不是递给侦探一整本书,而是只给他们确切需要的段落(压缩信息)。
  • 他们还使用了一种“推测性”技巧:如果侦探接下来很可能需要关于“巴黎”的事实,系统就会在侦探仍在写当前句子时提前抓取该信息。如果需要,它就已经瞬间到位了。
  • 结果: 该系统获取信息的速度比旧方法快 3.2 倍

结果:更聪明、更快速、更经济

团队在三个需要连接多个线索才能找到答案的困难谜题游戏(MuSiQue、HotpotQA 和 2WikiMultiHopQA)上测试了该系统。

  • 更准确的答案: 与标准的“一次性获取所有书籍”方法相比,该系统获得正确答案的频率高出 10%
  • 更少的往返: 它前往图书馆的次数减少了 47%。它不像旧方法(如 IRCoT)那样每隔几句就去查一次图书馆,而只在绝对必要时才去。
  • 最佳平衡点: 在最难的谜题(需要 4 步逻辑推理)上,新方法表现显著更好。它证明了次数更少但时机恰当的图书馆之旅优于频繁且随机的往返

论文中的真实案例

论文给出了一个问题的例子:“柏林墙倒塌的那一年,获得最佳影片奖的电影是由谁导演的?”

  • 侦探的思路:

    1. “柏林墙倒塌于 1989 年。”(有信心,无需去图书馆)。
    2. "1989 年的最佳影片是《为黛西小姐开车》。”(有信心,无需去图书馆)。
    3. “是谁导演了它?”(在这里,侦探感觉到了缺口。系统说:去图书馆)。
    4. 系统瞬间获取了导演的名字。
    5. 侦探完成答案。
  • 旧方法: 会在最开始就获取导演的名字,尽管侦探直到第 3 步才需要它,这不仅浪费了时间,还可能因为过早提供过多信息而让侦探感到困惑。

总结

ReaLM-Retrieve 教导 AI 模型在恰好卡住时停下来寻求帮助,而不是在开始之前就寻求帮助,或者过于频繁地寻求帮助。这就像拥有一个聪明的助手,知道确切何时打开百科全书,从而节省时间并获得更好的结果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →