✨ 要点🔬 技术摘要
想象一下,你正在教导一个机器人助手解决一个复杂的谜题,比如一次性完成预订航班、预订酒店和点晚餐。机器人必须采取许多步骤,在此过程中做出决策并使用工具。
当前教学方法的一个大问题是,机器人只有在整个过程的最后 才会得到“干得好!”或“再试一次”的反馈。如果机器人在第 1 步出错,它要等到完成第 10 步并导致整个任务失败时才会知道。这就像玩电子游戏,只有到最后才会出现“游戏结束”的画面,却没有任何提示告诉你错过了哪一次跳跃。
本文介绍了一种教导这些机器人的新方法,称为PAIR (Prefix-Aware Internal Reward Model,前缀感知内部奖励模型)。以下是其工作原理,使用简单的类比说明:
问题:困惑的“侦探”
为了在过程中(逐步)给予机器人反馈,研究人员尝试窥探机器人的“大脑”(其内部计算机状态),以查看它是否在做正确的事情。
他们发现了两种类型的“大脑信号”:
“讲故事的人”(隐藏状态) :这个信号检查当前步骤是否与之前发生的事 相符。它就像一个只关心当前线索是否与其已写好的故事相符的侦探。
缺陷 :如果机器人之前犯了错(污染了故事),“讲故事的人”就会感到困惑。它会想:“哦,这个新步骤完美契合了那个错误 的故事,所以它一定是好的!”它意外地奖励了机器人继续沿着错误的道路前进。
“结构建筑师”(注意力模式) :这个信号观察机器人如何 集中注意力。它不关心故事,只关心结构。机器人是否关注了正确的工具?它是否忽略了无关的噪音?
优势 :即使故事一团糟,这个信号仍然能判断机器人是否关注了正确的内容。它很稳健。
劣势 :在一个完美、干净的故事中,它不如“讲故事的人”敏锐。
解决方案:“两阶段教练”(PAIR)
作者意识到,单独依靠任何一种信号都不完美。“讲故事的人”在事情顺利时很棒,但一旦出错就会失效。“建筑师”很稳健,但在干净的任务上不够精确。
因此,他们构建了PAIR ,一个两阶段教练:
第一阶段:信念检查 。教练首先询问“讲故事的人”(隐藏状态探针):“这一步符合当前的故事吗?” 这会给出一个快速、初步的分数。
第二阶段:现实检查 。然后教练询问“建筑师”(注意力探针):“等等,看看你的注意力集中方式,你实际上是在解决问题,还是仅仅在跟随一个破碎的故事?”
它们如何协同工作:
如果故事是干净的 :“建筑师”同意“讲故事的人”的看法。教练接受该分数。
如果故事是破碎的(被污染的) :“讲故事的人”说:“这看起来很好,因为它符合那个错误!”但“建筑师”说:“不,你关注的是错误的东西!”教练听取“建筑师”的意见并修正分数 ,告诉机器人:“实际上,那一步是错的,即使它感觉是对的。”
为什么这很重要
在 PAIR 出现之前,为了获得逐步反馈,你必须做以下三件昂贵的事情之一:
运行整个游戏 100 次 以观察什么有效(非常缓慢且浪费)。
调用人类或超级智能 AI 来评判每一个步骤(非常昂贵且缓慢)。
事先知道确切的答案 来给步骤打分(对于许多现实世界的任务来说是不可能的)。
PAIR 改变了游戏规则,因为:
它是免费的 :它利用机器人自己的大脑信号。它不需要调用其他人或运行额外的模拟。
它是即时的 :它在机器人思考的瞬间发生。
它是诚实的 :即使机器人自信地沿着错误的道路前进,它也能捕捉到错误。
结果
当他们在尝试使用现实世界工具(如预订航班或搜索数据库)的机器人身上测试这种方法时,PAIR 帮助它们比其他任何方法学得更快,解决了更多问题。这就像给一个学生配备了一位能在写作过程中 就发现错误的老师,而不是等到文章写完后才说“你不及格”。
简而言之,PAIR 是一种智能的、内部的 AI 代理“测谎仪”,帮助它们在无需昂贵外部帮助的情况下实时纠正自己的错误。
技术摘要:PAIR(面向多轮智能体优化的前缀感知内部奖励模型)
1. 问题陈述
当前的大语言模型(LLMs)在处理需要动作序列(例如 API 调用、工具调用)及环境反馈的复杂、多阶段智能体任务时面临困难。虽然组相对策略优化(GRPO)因其简单性和高效性成为这些任务的首选强化学习(RL)算法,但它存在稀疏结果奖励 的问题。在标准 GRPO 中,仅在轨迹完成时分配单个标量奖励,这使得跨中间步骤进行信用分配变得困难。这种稀疏性导致收敛缓慢且样本效率低下。
现有的尝试增加奖励密度的方法面临显著局限:
完整轨迹展开(Full Rollouts): 将结果奖励向后传播需要完成完整轨迹,从而从已失败的路径生成浪费性的轨迹展开。
外部裁判: 使用外部 LLM(如 GPT-4)评估每一步会产生高昂的 API 成本和延迟,使其在大规模在线 RL 中不切实际。
内在奖励: 依赖真实答案(ground-truth answers)的方法(例如教师强制的对数概率)需要运行时访问黄金标签,这通常不可用或操作成本高昂。
外部奖励模型: 单独训练的过程奖励模型(PRMs)引入了训练和维护的开销。
本工作解决的核心挑战是:我们能否仅利用智能体自身的内部状态生成密集的、步骤级别的奖励信号,而无需外部模型、真实答案依赖或完整轨迹展开?
2. 方法论
2.1 实证动机:朴素探测的失败
作者首先调查了内部正确性探测(训练用于从隐藏状态预测步骤正确性)是否能作为奖励。他们引入了前缀污染 的概念,即智能体生成错误的中间步骤,从而污染后续步骤的前缀。
通过在 Qwen-2.5-7B-Instruct 骨干网络上进行的系统分析,他们发现了三个关键结论:
隐藏状态退化: 隐藏状态探测(例如 Last-Token、Mean-Pooled)在前缀污染下严重退化。它们追踪的是信念一致性 (与污染前缀的连贯性),而非基于事实的正确性 (实际任务效用)。因此,它们经常奖励延续错误的回合,并惩罚修复错误的回合。
注意力鲁棒性: 基于注意力的特征对污染保持相对鲁棒。它们捕捉结构行为模式(例如模型是否关注任务相关的 token),而非与前缀的语义连贯性。
互补性: 隐藏状态在干净前缀上表现优异,但在污染前缀上失效;注意力特征具有鲁棒性,但在干净前缀上表现不佳。将两种信号简单拼接会失败,因为来自隐藏状态的相反信号会抵消来自注意力的正确信号。
2.2 proposed 方法:PAIR
为了利用这些信号的互补性,作者提出了PAIR(前缀感知内部奖励模型) ,这是一种两阶段架构:
阶段 1:信念一致性估计器(冻结): 一个预训练的逻辑回归探测将隐藏状态特征(具体为最后一个 token 的隐藏状态)映射到信念一致性分数(s b c s_{bc} s b c )。该探测在干净数据上训练,并在 RL 训练期间保持冻结。它捕捉了标准探测在前缀干净时检测正确性的能力。
阶段 2:基于注意力的修正: 一个轻量级的逻辑回归头将注意力特征(如峰值幅度、分布、前缀比率和自比率等统计量)与 s b c s_{bc} s b c 拼接后作为输入。它预测最终分数(s f i n a l s_{final} s f ina l )。
机制: 在干净前缀上,修正头学习输出 s f i n a l ≈ s b c s_{final} \approx s_{bc} s f ina l ≈ s b c 。在污染前缀上,注意力特征检测到结构异常,该头学习将 s f i n a l s_{final} s f ina l 从有偏的 s b c s_{bc} s b c 调整向基于事实的正确性。
奖励集成: 最终分数通过温度截断的 Sigmoid 函数转换,并结合基于动量的奖励 机制。该机制将当前步骤的分数与轨迹的运行均值进行对比,以恢复组相对方差,这对于 GRPO 优势估计至关重要。
3. 主要贡献
实证发现: 本文提供了首个系统研究,证明内部正确性探测在多步设置下会因前缀污染而失效,具体表现为追踪信念一致性而非基于事实的正确性。
机制洞察: 它确立了隐藏状态编码信念一致性,而注意力模式编码结构路由行为。这些信号是互补的,这解释了为何简单拼接会失败,并指导了自适应架构的设计。
方法创新: 提出了 PAIR 作为两阶段模型,自适应地结合隐藏状态和注意力信号。它在保持干净轨迹高性能的同时,修正了污染下的偏差。
实际效率: PAIR 无需外部 LLM 调用、运行时真实答案访问或单独的奖励模型训练。它通过重用策略前向传播中已计算出的激活值,实现了可忽略不计的推理成本(探测级别)。
4. 实验结果
作者在两个多步智能体基准测试GTA (通用工具智能体)和ToolBench 上评估了 PAIR,使用 Qwen-2.5-7B-Instruct 作为策略模型。
步骤级别预测: PAIR 在所有内部探测基线中取得了最高的 AUROC(GTA 上为 0.9217,ToolBench 上为 0.8129),优于隐藏状态探测、注意力探测和无监督方法(如 Lookback Lens、Head Entropy)。
RL 性能: 在 GRPO 训练中,PAIR 在两个数据集上均取得了最高的成功率(GTA 上为 0.2489,ToolBench 上为 0.4498),在 ToolBench 上优于第二好的基线(LLM-as-a-Judge),在 GTA 上与其持平。
跨域迁移: 当在 GTA 上训练并在 HotpotQA 上评估(无需微调)时,PAIR 在 16 种方法中排名第一,展示了优于基于轨迹展开或依赖真实答案方法的迁移能力。
效率: PAIR 的运行延迟为探测级别(约 0.2 毫秒/步),比 LLM-as-a-Judge API 调用快约 2,500 倍,比树搜索方法快数个数量级。
5. 意义与主张
本文声称 PAIR 同时解决了现有密集奖励机制的四个主要局限:
无需完整轨迹展开: 奖励在每一步计算,无需等待轨迹完成。
无需外部调用: 它仅依赖智能体的内部表示,消除了 API 成本和延迟。
无需真实答案依赖: 探测在离线训练,并在运行时应用,无需为每一步提供黄金答案。
无需单独的奖励模型: 它不需要训练一个单独的、大规模的奖励网络。
作者将 PAIR 定位为一种实用解决方案,用于在多轮智能体 RL 训练中启用密集的、步骤级别的奖励信号。通过自适应的、经注意力修正的架构解决隐藏状态探测在前缀污染下的失效模式,PAIR 使内部状态分析成为优化复杂智能体行为时替代外部奖励来源的可行且高效的方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。