← 最新论文
🤖 machine learning

Latent On-Policy Self-Distillation

本文介绍了潜在在策略自我蒸馏(Latent On-Policy Self-Distillation, LOPD),这是一种新颖的框架,它通过使用从检索经验中获取的可学习潜在标记来取代手工设计的特权人工制品,从而使智能体能够在工具使用和代码生成等自我演进任务中实现卓越的性能和数据效率。

原作者: Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Guibin Zhang, Jiayang Lyu, Ran Sun, Xinlei Yu, Haoyu Zhao, Qibing Ren, Shuicheng Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人玩一款复杂的电子游戏。在过去,你必须坐在那里,手动为每一关编写一份完美的“指南”,精确地告诉机器人该按哪些按钮。但如果机器人可以通过自己玩游戏、观看自己的回放,并弄清楚哪些操作奏效了,从而实现自我学习呢?这就是**在策略自我蒸馏(On-Policy Self-Distillation)*这一领域的核心。把它想象成机器人在扮演自己的老师。它进行一轮游戏(即“学生”),然后一个更聪明的版本(即“老师”)观看回放并说:“嘿,你在这里犹豫了;试着这样做。”神奇之处在于,老师会对学生做的每一个动作*都给出极其详细的反馈,而不仅仅是在最后告诉它赢了还是输了。

然而,这其中有一个难点。要成为一名好老师,机器人需要一个“特权”向导——类似于一个完美的解决方案或某种秘密策略——而这个学生目前还没有掌握。通常,人类必须手工编写这些向导,用纯文本或特定的规则将其写出来。但如果机器人可以自动学习创建自己的向导,从过去的冒险中提取最有用的部分,并将其转化为一种只有老师才能理解的秘密语言呢?这正是本文探讨的大问题:我们能否停止由人类编写规则,让 AI 学习如何将自己的经验总结成一份完美的、隐形的指南?


论文:潜在在策略自我蒸馏 (Latent On-Policy Self-Distillation, LOPD)

本文介绍了一种名为潜在在策略自我蒸馏 (LOPD) 的新方法。与其要求人类设计者为机器人的老师编写特定的“指南”(例如文本答案或特定的技能描述),LOPD 教会机器人学习它自己的指南

以下是其工作原理,使用了一个有趣的类比:

想象一个试图解决迷宫的学生机器人。它撞到了墙,转身,最终找到了出口。

  • 旧方法: 人类会观察迷宫并写下一张便条说:“在红门处左转。”老师机器人会阅读这张便条并告诉学生:“你应该在那个时候左转。”但这张便条是僵化的。如果迷宫发生轻微变化,这张便条可能就没用了。
  • LOPD 方法: 机器人不使用书面便条。相反,它拥有一个“记忆合成器(Memory Composer)”。这个合成器观察机器人通过类似迷宫的过往成功尝试。它抓取最重要的时刻,并将它们压缩成一段微小的、隐形的“秘密代码”(称为潜在标记/latent tokens)。这段代码就像是一个压缩的高科技低语,只有老师机器人能听到。

老师机器人在观察学生机器人玩游戏时会倾听这个秘密低语。因为老师拥有这段秘密代码,它确切知道学生在每一步本该做什么。随后它会教导学生:“不要只是猜测;这是你应该遵循的密集且详细的路径。”

最酷的部分是什么?机器人在学习如何玩游戏的同时,也在学习如何编写这段秘密代码。它会弄清楚过去的冒险中哪些部分是有用的,哪些只是噪音。这就像机器人正在学习用一种它自己发明的语言来做笔记,而不是被迫阅读人类编写的教科书。

研究发现

研究人员在两类截然不同的任务上对其进行了测试:

  1. 智能工具使用 (Agentic Tool Use): 给机器人一套工具(如计算器、搜索引擎或数据库),并要求它解决多步骤问题,例如预订机票或管理日程。
  2. 代码生成 (Code Generation): 要求机器人编写可运行的计算机程序。

他们将 LOPD 与其他需要人类手工构建“指南”(例如给老师提供完美的文本答案或特定的技能摘要)的方法进行了对比。

结果如下:

  • 性能更佳: LOPD 始终优于其他方法。在工具使用测试中,它的表现显著提升。例如,在一次名为 EnvScaler 的测试中,它在较小模型上的得分从 61.8 提升到了 63.7,在较大模型上则从 60.2 提升到了 66.4。在编程测试中,它也名列前茅,击败了表现最好的基于人工设计的方案。
  • 超高效率: 机器人的学习速度更快。论文指出,LOPD 取得这些成果所使用的“展开预算(rollout budget)”(即练习游戏的次数)不到 30%,而像 GRPOSkill-SD 这样的顶尖方法则需要更多的预算。这就像是在只学习了三小时后就拿到了数学 A+,而你的朋友们却学习了十个小时。
  • “秘诀”是可学习的: 论文证明了这段秘密代码(潜在上下文)必须是可学习的。当他们尝试使用一个冻结的、不可更改的版本时,机器人的学习效果并不理想。但当他们允许机器人自行调整这段代码时,效果非常完美。

他们排除了什么

论文明确反对了这样一种观点,即我们需要不断发明越来越多、越来越复杂的、由人类编写的“指南”(如特定的推理轨迹、完美答案或僵化的技能描述)来让机器人变得更聪明。他们表明,这些手工制作的笔记往往会失败,因为它们太僵化了;在一种情况下有帮助的笔记,在另一种情况下可能会让机器人感到困惑。LOPD 表明,未来的最佳途径是让机器人自己去弄清楚该记住什么以及如何进行压缩,而不是强迫它阅读一本预先写好的手册。

他们的结论有多可靠?

作者对这些发现非常有信心,因为他们在三种不同的机器人模型(Qwen3-4B, Qwen3-8B, 和 Olmo3-7B)以及七个基准测试中进行了测试。结果并非偶然;它们表现出了持续的一致性。他们还进行了专门的实验,以证明成功的真正原因是代码的“学习”部分,而非仅仅依靠额外的计算能力。虽然他们并未声称已经解开了 AI 进化的全部奥秘,但数据有力地表明,让 AI 学习自己的“特权上下文”是让智能体实现持续自我改进的一个巨大进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →