← 最新论文
🤖 AI

What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents

本文介绍了 SERL,一种选择性环境重加权学习框架,该框架通过策略性地提炼特定且与行动相关的环境反馈,以解决长视野信用分配挑战,从而增强多轮大语言模型智能体,并在 ALFWorld 和 WebShop 基准测试中实现了最先进的性能。

原作者: Xiaozhe Li, Tianyi Lyu, Yang Li, Yichuan Ma, Peiji Li, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaozhe Li, Tianyi Lyu, Yang Li, Yichuan Ma, Peiji Li, Linyang Li, Qipeng Guo, Dahua Lin, Kai Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人管家打扫一间凌乱的屋子。机器人必须完成一长串任务:走到厨房,寻找一个碗,把它拿起来,清洗它,擦干它,然后把它放到架子上。

问题:“单一整体评分”的困境
在传统训练中,机器人只在一天结束时获得一个单一的评分。

  • 如果碗最终被干净地放在架子上,机器人会得到A+
  • 如果碗碎了,机器人会得到F

问题在于,机器人不知道哪一个具体动作赢得了这个评分。它得到 A+ 是因为正确地拿起了碗?还是因为它走到了水槽边?或者仅仅是因为它运气好?
在长达 20 步的列表中,可能只有 3 步真正重要(拿起、清洗、放置)。其余 17 步只是四处走动或检查冰箱。如果你因为机器人完成了一整天的任务而给它 A+,它可能会想:“太棒了!我应该继续原地转圈,因为正是这个动作让我得到了评分!”这被称为信用分配问题

旧方案:“过度关注”的老师
一些研究人员试图通过聘请一位超级聪明的老师来观察机器人以解决这个问题。这位老师能看到一切:机器人的动作、即时结果(例如,“碗是湿的”),甚至未来(例如,“碗现在在架子上”)。
然后老师告诉机器人:“完全照我看到的做。”

  • 缺陷:老师能看到机器人在做决定时无法看到的东西。例如,老师知道如果掉落碗就会摔碎,但机器人当时还不知道。如果机器人盲目地模仿老师,它就会学会依赖它实际上并不拥有的“魔法知识”。当机器人稍后尝试独立完成任务时,它会失败,因为它之前是通过偷看答案来作弊的。

新方案:SERL(选择性环境重加权学习)
这篇论文介绍了SERL,一种更聪明地利用老师的方法。将 SERL 想象成一位使用非常具体规则集的教练:

  1. 教练设定方向(奖励):
    最终评分(A+ 或 F)是决定机器人应该朝哪个方向移动的唯一因素。如果任务成功,机器人就知道要继续保持它所做的;如果失败,它就知道要停止。这确保机器人始终致力于解决实际问题,而不仅仅是模仿老师。

  2. 老师调节音量(蒸馏):
    老师不告诉机器人该做什么。相反,老师就像一个音量旋钮

    • 如果机器人做出的动作被老师观察到能导致好的结果(基于即时反馈,如“碗是湿的”),老师就会将该特定动作的音量调高。“太好了!再做一次!”
    • 如果机器人做出的动作导致一团糟,老师就会将音量调低。“不,别那样做。”
    • 关键在于,老师忽略机器人的“思考”步骤(如“嗯,碗在哪里?”),只调节动作步骤(如“拿起碗”)的音量。
  3. “选择性”部分:
    研究发现,你并不需要老师看到整个未来也能提供帮助。事实上,看到太多未来信息会让机器人困惑。

    • 最佳反馈:最有用的信号是动作的即时结果(例如,“你拿起了碗,而且它没有掉落”)。
    • 定位:你不需要在机器人输入每一个字后都纠正它。你只需要在它对环境做出有意义的改变时(例如,从客厅移动到厨房)进行纠正。这被称为锚点级反馈。

视频游戏的类比
想象你在玩一款视频游戏,你只在最后才看到“游戏结束”或“关卡完成”的画面。

  • 标准强化学习:你试图猜测是哪一次按键拯救了局面。
  • 旧式蒸馏:一个朋友站在你身后,看到了整个关卡,并低声说:“现在按 X!”但你无法看到他们看到的,所以你感到困惑。
  • SERL:你仍然只在最后获得“关卡完成”画面来告诉你是否获胜。但是,一位教练看着你的屏幕。当你按下按钮并立即有一扇门打开时,教练大喊:“干得好!”(音量调高)。当你按下按钮并掉进坑里时,教练说:“坏招”(音量调低)。教练不告诉你接下来该按什么;他们只是告诉你你刚刚按下的那个按钮有多重要。

结果
研究人员在两个复杂任务上测试了这种方法:

  1. ALFWorld:一个虚拟房屋,机器人必须寻找并移动物体。
  2. WebShop:一个虚拟在线商店,机器人必须搜索并购买特定商品。

SERL 击败了所有其他方法。 它学习得更快,成功率更高,因为它不依赖来自老师的“魔法知识”。它利用老师的即时反应来突出最重要的动作,同时让最终的成功/失败信号来指导整体策略。

核心启示
要训练一个 AI 智能体执行长期、复杂的任务,你不需要一个能预见未来的老师。你只需要一位能立即告诉智能体“你刚刚做的那个具体动作是对的(或错的)”的老师,并让最终结果来决定整体目标。更少的“特权”信息和更多的“基于现实”的反馈效果更好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →