STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
STAMP 通过引入一种溯源引导的信用分配机制,将支持性文档追溯至其暴露动作并利用保号调制重新分配优势,从而解决了深度搜索智能体中的奖励-信用失配问题,进而显著提升了在多个基准测试中相对于 GRPO 基线的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一名超级聪明的数字侦探,去解决互联网上棘手的谜题。这个侦探被称为“深度搜索智能体”(deep-search agent),它不只是瞎猜;它会寻找线索、阅读网页,并将证据拼凑起来以回答问题。长期以来,我们教导这些侦探的方式有点像根据最后的结局来给整部电影打分。如果侦探在最后得到了正确答案,整部电影都会获得一颗金星;如果最后错了,整部电影都会得到一个红色的“F”。
但问题在于:有时候侦探在电影中间发现了一个精彩的线索,但因为后来搞混了,导致最终答案错误。另一些时候,它可能只是运气好碰巧得到了正确答案,而从未真正找到过真正的证据。旧的方法无法区分这两者。它无法分辨哪些动作是无意义的平庸之举,而是会对侦探做的每一个动作都给予同样的奖励(或惩罚)。作者们称之为“奖励-信用错配”(reward-credit mismatch)。这就像老师仅仅因为学生的结论写错了,就给整篇论文打了个不及格,即便学生在中间部分写了三段完美的调研内容。
核心理念:STAMP
研究人员提出了一种新的训练方法,叫做 STamp(基于溯源的步级轨迹引导优势调制,Step-level Trace-guided Advantage Modulation with Provenance)。把 STAMP 想象成一位观察入微的影评人,它会逐帧观看侦探的电影。
STAMP 不仅仅看最终答案,它还会询问两个具体的问题:
- 侦探是否真的找到了正确的证据?(他们是否找到了正在寻找的特定人物或事实?)
- 哪一个具体的动作首次揭示了该证据?(是在他们输入搜索查询时找到的,还是在点击链接时找到的?)
STAMP 使用了一个“基于参考的验证器”——这本质上是一个聪明的检查员,它会查看侦探找到的文件并询问:“这份文件真的能证明我们需要的事实吗?”如果可以,STAMP 会将该文档追溯到侦探第一次看到它的确切时刻。那个特定的时刻就会获得一次“信用提升”。
如何在不破坏电影逻辑的情况下运作
这里是巧妙之处:STAMP 并不会改变电影的最终成绩。如果侦探最终还是答错了,那么这部电影仍然是失败的。但是,STAMP 使用一种特殊的“保号优势调制”(sign-preserving advantage modulation)来调整训练过程。
想象侦探正在坐过山车。如果这次旅程很成功(正向优势),STAMP 会给那些发现好线索的具体时刻一点额外的动力,让这些动作看起来更有回报。如果这次旅程是一场坠毁(负向优势),STAMP 则不会过于严厉地惩罚那些好的动作。它会说:“好吧,你虽然任务失败了,但你刚才那次搜索查询其实非常出色——让我们不要抹杀这个教训。”这确保了侦探能精准学习哪些搜索动作是有效的,而不会让学习过程与最终结果产生混淆。
关于它“不是什么”的说明
作者们明确指出了这种方法并不是什么。他们反对认为我们需要为搜索的每一步都发明复杂的全新奖励系统。他们也否定了那种靠猜测哪些动作好的想法。STAMP 依赖于“有据可查”的证据:如果文档不存在,或者验证器说该文档不支持该事实,则不给予任何信用。他们明确指出,仅仅给步骤增加随机奖励是行不通的,因为旧系统最终会将它们平均化。
结果:它奏效了吗?
团队在三个挑战集上测试了 STAMP:BrowseComp、BrowseComp-ZH(中文版)以及 xbench-DS。他们使用完全相同的起始模型、训练数据和搜索工具,将其与一种名为 GRPO 的标准训练方法进行了对比。
结果显示,STAMP 持续提升了侦探的表现:
- 在 BrowseComp 上,准确率提升了 +2.0 个点。
- 在 BrowseComp-ZH 上,准确率跃升了 +5.5 个点。
- 在 xbench-DS 上,表现提升了 +3.0 个点。
论文指出,这些收益之所以发生,是因为 STAMP 捕捉到了“隐藏的珍宝”——即那些即使在失败尝试中也产生了有用证据的步骤,而旧方法忽略了这些步骤。事实上,他们发现,在成功的尝试中,83.5% 的步骤实际上并没有产生任何有用的证据;而在失败的尝试中,仍有 7.0% 的步骤确实找到了有用的线索。STAMP 通过无论最终结果如何都奖励这些有用的步骤,解决了这个问题。
他们有多确定?
作者对这些数字充满信心,因为他们进行了受控实验,除了训练方法外,其他一切条件都完全相同。他们还进行了“消融实验”(类似于拆解机器以观察每个部件的功能),并发现 STAMP 的每一个部分——验证器、首次暴露的追踪以及特殊的调制机制——都对成功做出了贡献。
然而,他们也指出了一项局限性:他们仅在一种特定规模的模型(Qwen3-30B)上进行了测试。他们建议,虽然该方法在这一规模下表现良好,但尚未被证实是否在更大型的模型(如 70B+)上也同样有效。因此,虽然他们在所进行的测试中取得了扎实的结果,但对于更大规模“大脑”的完整潜力仍是一个开放性的问题。
简而言之,STAMP 通过给予那些真正揭示真相的动作以信用,教会了 AI 侦探要欣赏过程,而不只是关注终点。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。