← 最新论文
💻 computer science

PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization

本文提出了 PAIR,一种前缀感知的内部奖励模型,该模型将冻结的隐藏状态探针与轻量级的基于注意力的头部相结合,为多轮智能体优化生成密集且低成本的步骤级奖励,从而有效克服了稀疏结果奖励的局限性以及探针在前缀污染下的性能退化问题。

原作者: Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Wonjoong Kim, Yeonjun In, Sangwu Park, Dongha Lee, Chanyoung Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一个机器人助手解决一个复杂的谜题,比如一次性完成预订航班、预订酒店和点晚餐。机器人必须采取许多步骤,在此过程中做出决策并使用工具。

当前教学方法的一个大问题是,机器人只有在整个过程的最后才会得到“干得好!”或“再试一次”的反馈。如果机器人在第 1 步出错,它要等到完成第 10 步并导致整个任务失败时才会知道。这就像玩电子游戏,只有到最后才会出现“游戏结束”的画面,却没有任何提示告诉你错过了哪一次跳跃。

本文介绍了一种教导这些机器人的新方法,称为PAIR(Prefix-Aware Internal Reward Model,前缀感知内部奖励模型)。以下是其工作原理,使用简单的类比说明:

问题:困惑的“侦探”

为了在过程中(逐步)给予机器人反馈,研究人员尝试窥探机器人的“大脑”(其内部计算机状态),以查看它是否在做正确的事情。

他们发现了两种类型的“大脑信号”:

  1. “讲故事的人”(隐藏状态):这个信号检查当前步骤是否与之前发生的事相符。它就像一个只关心当前线索是否与其已写好的故事相符的侦探。
    • 缺陷:如果机器人之前犯了错(污染了故事),“讲故事的人”就会感到困惑。它会想:“哦,这个新步骤完美契合了那个错误的故事,所以它一定是好的!”它意外地奖励了机器人继续沿着错误的道路前进。
  2. “结构建筑师”(注意力模式):这个信号观察机器人如何集中注意力。它不关心故事,只关心结构。机器人是否关注了正确的工具?它是否忽略了无关的噪音?
    • 优势:即使故事一团糟,这个信号仍然能判断机器人是否关注了正确的内容。它很稳健。
    • 劣势:在一个完美、干净的故事中,它不如“讲故事的人”敏锐。

解决方案:“两阶段教练”(PAIR)

作者意识到,单独依靠任何一种信号都不完美。“讲故事的人”在事情顺利时很棒,但一旦出错就会失效。“建筑师”很稳健,但在干净的任务上不够精确。

因此,他们构建了PAIR,一个两阶段教练:

  1. 第一阶段:信念检查。教练首先询问“讲故事的人”(隐藏状态探针):“这一步符合当前的故事吗?” 这会给出一个快速、初步的分数。
  2. 第二阶段:现实检查。然后教练询问“建筑师”(注意力探针):“等等,看看你的注意力集中方式,你实际上是在解决问题,还是仅仅在跟随一个破碎的故事?”

它们如何协同工作:

  • 如果故事是干净的:“建筑师”同意“讲故事的人”的看法。教练接受该分数。
  • 如果故事是破碎的(被污染的):“讲故事的人”说:“这看起来很好,因为它符合那个错误!”但“建筑师”说:“不,你关注的是错误的东西!”教练听取“建筑师”的意见并修正分数,告诉机器人:“实际上,那一步是错的,即使它感觉是对的。”

为什么这很重要

在 PAIR 出现之前,为了获得逐步反馈,你必须做以下三件昂贵的事情之一:

  • 运行整个游戏 100 次以观察什么有效(非常缓慢且浪费)。
  • 调用人类或超级智能 AI来评判每一个步骤(非常昂贵且缓慢)。
  • 事先知道确切的答案来给步骤打分(对于许多现实世界的任务来说是不可能的)。

PAIR 改变了游戏规则,因为:

  • 它是免费的:它利用机器人自己的大脑信号。它不需要调用其他人或运行额外的模拟。
  • 它是即时的:它在机器人思考的瞬间发生。
  • 它是诚实的:即使机器人自信地沿着错误的道路前进,它也能捕捉到错误。

结果

当他们在尝试使用现实世界工具(如预订航班或搜索数据库)的机器人身上测试这种方法时,PAIR 帮助它们比其他任何方法学得更快,解决了更多问题。这就像给一个学生配备了一位能在写作过程中就发现错误的老师,而不是等到文章写完后才说“你不及格”。

简而言之,PAIR 是一种智能的、内部的 AI 代理“测谎仪”,帮助它们在无需昂贵外部帮助的情况下实时纠正自己的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →