← 最新论文
🤖 machine learning

Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents

该论文介绍了 SLEUTH,这是一个通过将隐式上下文替换为显式的、结构化的认识论工作记忆(追踪已确认的事实、排序后的假设和开放性问题)来扩展多跳推理能力的语言智能体框架,该框架显著提升了在复杂基准测试上的性能,并揭示了组织推理状态对于克服上下文稀释和证据充分性问题而言,比原始模型能力更为关键。

原作者: Ning Liu

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Ning Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名正在试图通过连接四个不同线索来破解谜题的侦探。你有一个笔记本,但它不是普通的笔记本。每当你发现一个新线索时,你都会把它写在一张纸上,然后把它塞进一个巨大的、不断增长的纸堆里。问题在于,随着纸堆变得越来越高,最底层的线索会被新加入的纸张掩埋。当你到达顶端时,你已经忘记了最初发现了什么。这正是许多 AI“智能体”(agents)在尝试解决复杂的多步问题时所面临的情况:它们迷失在了自己的历史记录中,作者称之为上下文稀释(context dilution)

这篇论文介绍了一种名为 SLEUTH(结构化分层证据更新假设追踪)的新方法来解决这个问题。SLEUTH 不再让 AI 的大脑仅仅是一个巨大且混乱的纸堆,而是强制要求它维持一个非常具体、有组织的“工作记忆”,看起来就像侦探的白板一样。这个白板有三个截然不同的部分,AI 必须在每一步之后都对其进行更新:

  1. 已确认的事实: AI 已经发现并验证的事实,并附带关于其来源的注释(例如来源引用)。
  2. 活跃的假设: AI 正在猜测的可能答案,并根据支持它们的证据程度进行排名(高、中、低置信度)。
  3. 开放性问题: AI 仍需查明以解开谜题的具体事项,这些问题直接告诉 AI 下一步应该搜索什么。

作者在五个不同的棘手问答挑战上测试了该方法,包括 HotpotQAMuSiQue,这些挑战涵盖了从 2 步到 4 步的推理链。他们发现,随着问题的难度增加,SLEUTH 的表现变得越来越好。在最难的 4 步问题上,使用相同的 AI 模型,SLEUTH 比标准方法(ReAct)的成功率提高了 11.1 个百分点

真正酷的部分在于:论文指出,AI 如何组织它的思考,比 AI 模型本身有多“聪明”更为重要。 为了证明这一点,研究人员拿出了一个较弱的 AI 模型(GLM-5),并强制它使用 SLEUTH 的笔记本结构。这个经过组织的较弱模型,实际上击败了一个没有使用该结构的更强大的模型(Claude Sonnet)。这个带有笔记本的较弱模型在最难的问题上得分 48.9%,而那个没有该结构的更强模型仅得分为 42.0%。这表明,一种简单的、结构化的思考方式可以胜过纯粹的计算能力。

然而,论文也指出 SLEUTH 有时会产生一个新的问题:“证据充分性问题”(Evidence Sufficiency Problem)。因为 AI 组织事实的能力太强了,它有时会在已经拥有足够解开谜题的证据后,仍然继续寻找更多的证据。它会陷入“再检查一次”的循环中,在给出答案之前就耗尽了它的时间限制(称为“轮次预算”)。

为了解决这个问题,作者添加了一个“轻推”(nudge)。想象一下,当侦探用完了 70% 的允许时间时,教练吹响了哨子。这个哨声告诉 AI:“停止搜索!你已经有足够的证据了;现在利用你已有的信息来写出答案吧。”这个简单的规则帮助 AI 停止了浪费时间。当他们测试时,AI 在最难问题上的成功率从 49.1% 跳升到了 53.1%

至关重要的是,论文显示这种“轻推”只有在 AI 拥有有序笔记本的情况下才有效。如果他们把同样的“停止搜索”哨声交给一个大脑混乱、无序的 AI,它并不会起作用(得分保持在 42.2%)。有序的状态是必要的前提,而“轻推”只是帮助 AI 利用它。

作者还测试了该方法在不同时间量和不同搜索设置下的表现。他们发现,无论 AI 每次搜索只能找到一段话还是五段话,SLEUTH 的优势都依然存在。他们还注意到,该方法不需要特殊的训练或新的硬件;它只需通过改变给 AI 的指令(即“提示词”)即可实现。

简而言之,论文表明,为了让 AI 智能体更好地解决长期的、复杂的谜题,我们不应该仅仅让 AI 变得更大或更聪明。相反,我们应该教它如何维护一个整洁、有结构的笔记本,记录它所知道的、它所猜测的以及它仍需寻找的东西。这种简单的组织方式的变化,使得即使是较弱的模型也能比那些处于混乱状态下的更强模型解决更难的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →