← 最新论文
🤖 machine learning

Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

本文提出了可恢复性感知干预学习(RAIL),这是一个训练阶段的框架,它将展开生成(rollout generation)视为一个自适应在线上下文多臂老虎机问题,以根据改进信号动态优化干预策略,从而在有限的展开预算下增强大语言模型的训练后效率与性能。

原作者: Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人如何走迷宫。在过去,你可能会直接告诉机器人:“尝试向前走100次,如果撞墙了,就尝试向左转。”这虽然可行,但非常浪费。有时机器人会撞进一个无法逃脱的死胡同;在那里浪费100次尝试是一个巨大的错误。而有时,机器人距离一个绝妙的捷径仅一步之遥,但你只让它尝试一次,所以它错失了发现的机会。这就是我们目前训练大语言模型(LLM)成为智能体时所面临的问题:我们给它们固定的“尝试次数”(称为 rollout/采样),而不考虑这些尝试是否真的有用,或者是否只是在浪费时间。

你即将阅读的这篇论文解决了这种低效问题。它引入了一种名为 RAIL(可恢复性感知干预学习,Recoverability-Aware Intervention Learning)的新方法。把 RAIL 想象成站在机器人身旁的一位超级聪明的教练。教练不再盲目地让机器人跑100次,而是观察机器人的进度。如果机器人陷入了一个无法逃脱的陷阱,教练会说:“停!不要在这里浪费更多的尝试了。”但如果机器人在一个通过一点额外探索就能发现隐藏路径的棘手位置,教练会大喊:“冲!现在立刻尝试三种不同的变体!”教练通过观察什么才是真正有效的,而不是根据僵化的规则进行猜测,从而学会了何时以及如何进行干预。

问题所在:“一刀切”的陷阱

在 AI 领域,特别是当我们教模型进行推理并使用工具(比如让机器人操作数据库或购物网站)时,我们会使用一种叫做强化学习的技术。模型尝试解决任务,如果成功则获得奖励,并从错误中学习。一种流行的技术叫做 GRPO(组相对策略优化),它通过针对单个问题生成一组不同的答案(即一次“rollout”)并观察其中哪一个最好来进行工作。

问题在于,GRPO 通常对每个问题都一视同仁。它会说:“对于每个问题,生成16个答案。”但实际上,有些问题很简单(模型已经知道答案),而有些问题则是不可能完成的(模型陷入了逻辑循环)。为不可能完成的问题生成16个答案,就像是在一个根本不存在针的地方大海捞针;这只会白白消耗计算资源。相反,对于一个难题,16个答案可能不足以找到那个聪明的解决方案。

以往试图解决这一问题的尝试使用了“启发式”规则——即简单的、固定的指令,例如“如果模型看起来很困惑,就再试一次”。但这些规则是静态的。它们不会随着 AI 变得更聪明而改变。当 AI 还是个初学者时适用的规则,到了它成为专家时可能就毫无用处了。这就像是用1990年的地图来导航一座已经完全重建的城市。

解决方案:一位学会干预的教练

论文作者提出了 RAIL,这是一个将“何时以及如何尝试更多”的决策本身转化为学习过程的系统。RAIL 并没有使用固定规则,而是训练了一个“可恢复性控制器”(Recoverability Controller)。

它是如何工作的,我们可以用一个简单的类比来说明:

想象你在玩一款电子游戏,你可以选择“分支”你的路径。有时你会遇到分叉路口。

  1. 影子阶段(训练营): 在 AI 真正开始玩之前,它会经历一个“影子”训练模式。在这里,它尝试不同的策略:“如果我多尝试4条路径会怎样?”“如果我尝试8条呢?”“如果我换一种思考方式呢?”它会记录下这些选择究竟在哪些情况下帮助它找到了更好的解决方案。这就像教练通过进行各种练习,来观察哪些练习能真正提高选手的表现。
  2. 控制器(聪明的教练): 基于这些练习,AI 构建了一个“可恢复性控制器”。这是一个微小且快速的大脑,它观察当前的情况并询问:“如果我现在进行干预,会有帮助吗?”它衡量的是可恢复性(recoverability)——这是一个高级词汇,意为“如果我们现在尝试得更努力,我们能进步多少?”
  3. 实战阶段(真正的比赛): 现在,AI 开始玩真正的游戏。控制器观察每一步。如果 AI 处于一个增加尝试一定会有所帮助的位置(高可恢复性),控制器就会说:“干预!进行分支尝试!”如果 AI 处于一个增加尝试也无济于事的死胡同(低可恢复性),控制器就会说:“跳过。节省你的精力。”

他们的研究发现

研究人员在四种具有挑战性的任务上测试了 RAIL,这些任务要求 AI 代理必须与操作系统、数据库、网络商店和数据分析工具进行交互。

  • 效果更好: RAIL 始终优于所有其他方法,包括标准的“一刀切”方法以及其他使用固定规则的“智能”方法。它实现了更高的任务解决成功率。
  • 节省成本: 或许最令人印象深刻的是,RAIL 在取得更好结果的同时,使用的总尝试次数(rollouts)比其他方法更少。它不仅变得更聪明,而且更高效了。它停止在徒劳的情况下浪费时间,并将精力集中在真正重要的地方。
  • 具备适应性: 论文表明,“如何干预”的最佳方式会随着 AI 的学习而改变。最初有效的策略在后期可能不再适用。因为 RAIL 的控制器会从新的结果中不断学习,所以它能适应 AI 不断增长的技能,而旧的固定规则则会被远远甩在身后。

大局观

这篇论文表明,我们生成 AI 训练数据的方式不应该是固定且枯燥的过程。相反,“尝试各种可能性”的过程应该成为训练本身中一个动态的、可学习的部分。通过教会 AI 识别何时需要深入挖掘、何时应该放弃,我们可以让 AI 训练变得更快、更便宜、更有效。这是一种从“盲目向问题投入更多计算能力”到“智能地将力量引导至精准需要之处”的转变。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →