← 最新论文
💬 NLP

Self-Distilled Agentic Reinforcement Learning

本文介绍了 SDAR,这是一个新颖的框架,它将在线策略自蒸馏作为门控辅助目标整合到强化学习中,为长程智能体任务提供稳定、稠密的 token 级指导,在多个基准测试和模型规模上显著优于标准强化学习及朴素的混合基线方法。

原作者: Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教导一位聪明但缺乏经验的学徒(即学生)如何穿越一个复杂的多步骤迷宫以寻找宝藏。你主要有两种教导方式:

  1. “试错”教练(强化学习): 你让学徒在迷宫中漫游。如果他们撞墙,就会收到“哎哟”的信号;如果他们更接近宝藏,就会收到“干得好”的信号。这种方法非常适合把握大局,但反馈缓慢且模糊。你只能在最后才知道他们失败了,却不知道具体哪一步出错了。
  2. “超级助手”导师(自蒸馏): 你拥有一个拥有秘密作弊条(特权上下文,如地图或技能列表)的学徒版本。这位导师会观察学徒,并在他们说的每一个字旁边低语:“这里别左转,要右转!”或者“干得好!”

问题所在:
论文指出,简单地让导师不停地低语是危险的。

  • 漂移: 随着学徒深入迷宫,他们可能会开始犯错。如果导师继续基于其原始作弊条低语,由于情况已变,他们可能会开始给出错误的建议。学徒会感到困惑,导致整个训练崩溃。
  • 错误的低语: 有时导师会说“别那样做!”,因为作弊条对于这一特定转弯来说是错误或不相关的。如果学徒盲目听从每一个“别做”,他们可能会仅仅因为导师感到困惑而停止尝试正确的事情。

解决方案:SDAR(自蒸馏智能体强化学习)
作者创造了一种名为SDAR的新方法。可以将 SDAR 想象为给学徒配备了一个智能、可调节音量的旋钮,用于控制导师的声音。

系统不再让导师在每一刻都大声发出指令,而是使用一个“门控”(智能过滤器)来决定对于学徒说的每一个特定单词,导师的声音应该有多大。

  • 当导师正确时: 如果导师同意学徒并说“是的,那是很棒的一步!”(正面信号),音量旋钮就会调大。学徒会仔细聆听并从那个特定时刻中学习。
  • 当导师困惑或错误时: 如果导师说“不,别那样做!”,但学徒实际上走在正确的轨道上,或者导师的作弊条在这一刻只是杂乱无章,音量旋钮就会调低到耳语级别,甚至完全静音导师。学徒会忽略错误的建议,继续听从他们自己的“试错”教练。

“智能过滤器”的类比
想象导师是一个广播电台。

  • 旧方法(朴素 GRPO+OPSD): 电台全天候播放。有时播放的是有帮助的音乐,但有时播放的是杂音或错误的歌曲。学徒试图跟着一切跳舞,结果头晕目眩,摔倒在地。
  • SDAR: 电台装有一个传感器。只有当节拍与学徒的舞步完美契合时,它才播放音乐。如果音乐节奏不对(错误建议),传感器就会将其静音。学徒只从音乐真正好的时刻中学习。

论文发现
研究人员在三个不同的“迷宫”(任务)上测试了这种方法:

  1. ALFWorld: 一款文字游戏,你需要打扫房间并将物品放置在特定位置。
  2. WebShop: 一个在线购物模拟,你需要找到并购买特定商品。
  3. Search-QA: 一项任务,你需要搜索互联网来回答棘手的问题。

他们发现:

  • SDAR 是赢家: 与仅使用“试错”教练相比,它学习得更快,得分更高,并且比让导师不停地喊叫要稳定得多。
  • 它能很好地处理糟糕的地图: 即使“作弊条”(技能)是随机的或低质量的,SDAR 仍然有效。智能过滤器会忽略来自随机地图的错误建议,只听取好的部分。
  • 它适用于小脑和大脑: 他们在不同规模的 AI 模型(从小型到大型)上测试了这种方法,结果对所有模型都表现良好。

总结
SDAR 是一种训练方法,它将“在做中学”与“在听中学”相结合,但增加了一个智能过滤器,确保学生只在老师真正有帮助时才听从老师的教导。这防止了学生因错误建议而感到困惑,从而造就了一个更可靠、更智能的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →