← 最新论文
🤖 AI

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

该论文介绍了 ABSeeker,这是一种通过一种新颖的答案回溯式信用分配(ABC)框架进行训练的长程搜索智能体,该框架将稀疏的轨迹结果转化为稠密的步级奖励,以区分有用动作与错误,从而使一个紧凑的 4B 模型能够超越同规模智能体,并在复杂的搜索基准测试中媲美规模大得多的 30B 模型。

原作者: Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人去解决一个庞大且多步骤的谜题。在人工智能领域,这被称为训练一个“搜索智能体”(search agent)。这些智能体就像数字侦探,它们不仅仅是查找单一的事实,而是必须在互联网中穿梭,阅读数十个网站,将各种线索联系起来,并拼凑出一个复杂的答案。这就像一场寻宝游戏,但地图丢失了,机器人必须通过提问、检查线索,有时甚至在意识到自己正在原地打转时,来摸索出正确的路径。科学家们面临的巨大挑战在于,如何教这些机器人变得更擅长这种“狩猎”。通常情况下,当机器人完成一次狩猎后,老师只会根据最终是否找到了宝藏给出一个简单的“做得好!”或“再试一次!”。这就像是仅根据期末考试的分数来评定一名学生的整个学期成绩,而忽略了他们为了考试数周努力学习,却仅仅因为最后犯了一个低级错误而失利;或者忽略了有人虽然没怎么下功夫,却靠运气第一次就猜中了正确答案。

这篇名为《ABSeeker》的论文正是针对这一问题展开研究的。来自上海交通大学的研究人员意识到,要让搜索智能体真正变得聪明,我们需要观察它们采取的每一个步骤,而不仅仅是最终结果。他们提出了一种新的训练方法,称为“答案回溯式信用分配”(Answer-Backtracked Credit Assignment,简称 ABC)。该系统不再只是说“你答对了,所以你走的每一步都是对的”,而是从正确答案出发,反向推导应该在过程中发现哪些特定的线索。然后,它会回到机器人的旅程中,为发现这些线索的行为给予奖励——即使机器人最终迷失了方向;同时,对于那些浪费时间或忽略了优质线索的步骤,即使机器人最后偶然得到了正确答案,也会给予“时间惩罚”。他们在一款相对较小的 AI 模型(40 亿参数)上进行了测试,发现它解决复杂搜索谜题的能力优于规模大得多的模型,这证明了教机器人“如何一步步思考”比单纯把机器人做大更为重要。

“全有或全无”评分的谜团

让我们深入了解其工作原理。想象一下,你正在训练一只狗在巨大的公园里寻找一个隐藏的玩具。在旧的训练方式(论文称之为“轨迹级监督”)中,只有当狗把玩具带回你身边时,你才会给它奖励。如果狗找到了玩具,但在回来的路上掉进了水坑,你不会给它奖励。如果狗迷路了,绕着圈子跑,最后却意外撞到了玩具,你也会给它奖励。这对狗来说非常令人困惑!它不知道找到玩具是好事,也不知道绕圈子是坏事。

本文作者认为,这种“全有或全无”的方法是训练 AI 搜索智能体的一个重大缺陷。他们注意到,即使 AI 未能找到最终答案,它在过程中也往往采取了许多正确的步骤——比如找到了正确的网站或阅读了正确的段落。相反,AI 可能会靠运气或通过某种跳过重要事实的奇怪捷径来得到正确答案。论文指出,我们需要一种方法来对 AI 做的每一次移动进行评分,而不仅仅是看最终得分。

“回溯式”侦探

为了解决这个问题,研究人员发明了一个聪明的技巧,叫做答案回溯式线索恢复(Answer-Backtracked Clue Recovery)。这里有一个类比:想象 AI 是一名刚刚破获案件并知道了罪犯姓名(即“标准答案”)的侦探。论文建议,与其仅仅庆祝胜利,不如让侦探进行反向推理:“好吧,我知道罪犯是约翰。为了证明是约翰,我必须发现了他的指纹、他的不在场证明和他的汽车。”

在 AI 的案例中,系统会获取正确答案,并使用一个强大的 AI 来进行“回溯”,列出为了得出该答案而必须发现的所有中间线索。例如,如果答案是某个特定品牌的洗发露,那么线索可能是“拥有该品牌的公司”、“创始人毕业的年份”以及“成分表”。这些线索成为了衡量 AI 表现的“地图”。

步骤评分

一旦线索地图准备就绪,系统就会进入线索锚定步骤评分(Clue-Anchored Step Scoring)阶段。这是见证奇迹的时刻。AI 的旅程会被重新播放,每一步都会对照线索地图进行检查。

  • 优秀的步骤: 如果 AI 找到了一个线索(如成分表),即使 AI 最终放弃并未能解决整个谜题,它也会获得高分。
  • 糟糕的步骤: 如果 AI 忽略了一个线索或丢弃了一个好的线索,即使它后来通过某种方式偶然得到了正确答案,也会受到惩罚。
  • 中性的步骤: 仅仅是在四处游荡而没有发现任何东西,则会被评为中性分数。

这把简单的“通过/失败”等级变成了一份关于 AI 每一步动作的详细成绩单。论文表明,这种方法能让 AI 更快地从错误中学习,因为它清楚地知道哪一步做错了,而不仅仅是知道整个尝试失败了。

结果:小脑瓜,大胜利

研究人员利用这种方法构建了一个新的搜索智能体——ABSeeker。他们使用的是 Qwen3.5-4B 模型,在 AI 世界里这属于相对较小的模型(可以把它想象成一个聪明的高中生,而不是博士级别的超级计算机)。他们仅用了 8,500 个示例进行训练——这与通常需要的数百万个示例相比,规模极其微小。

结果令人惊喜。在名为 BrowseComp 的高难度测试中(AI 需要在网上寻找复杂、多部分的答案),ABSeeker 取得了 37.3% 的成绩。当他们加入了一个帮助 AI 管理记忆的功能(称为“上下文管理”)时,分数跃升至 55.3%

为了直观对比,论文将 ABSeeker 与规模大得多的 AI 智能体(约 300 亿参数,相当于专业侦探)进行了比较。ABSeeker,这个“高中生”,在几项困难测试中竟然超越或匹配了这些规模大得多的智能体。例如,在中文版本的测试(BrowseComp-ZH)中,它取得了 52.9% 的成绩,表现优于得分较低的大型模型。

这为什么重要

论文表明,核心秘诀不仅在于把 AI 做大,还在于教它如何评估自己的进度。通过使用“答案回溯式信用分配”,AI 学习去重视有用的行动并避免无用的行动,无论它最终是赢是输。作者发现,即使在失败的尝试中,大约有 10% 的步骤实际上是高质量的发现,理应获得奖励。在旧系统中,由于最终答案错误,这些优秀的步骤也会受到惩罚。

简而言之,这篇论文表明,如果你给 AI 一张详细的“优秀旅程”地图,它就能更高效地在互联网中导航,即使它最初只有一个较小的“大脑”。研究人员相信,这种方法可以成为训练未来 AI 智能体解决复杂问题的游戏规则改变者,让它们不仅仅靠猜测,而是通过仔细思考每一步来解决问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →