← 最新论文
🤖 machine learning

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

本文介绍了通过软提示特权上下文进行多任务在策略蒸馏的方法,该方法利用带有特定任务可学习软提示的冻结骨干模型作为教师,使单个学生模型能够高效地并行吸收来自多个任务的知识,而不会遭受灾难性遗忘或需要进行全权重微调。

原作者: Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一位才华横溢但有些笨拙的学生如何解决复杂的谜题。在人工智能的世界里,这个学生是一个“大语言模型”(LLM)——一个读遍了互联网上几乎所有内容的计算机程序,它能写故事、回答问题并解决数学问题。但有时,即使是这些超级聪明的模型也会陷入困境或犯下愚蠢的错误。为了修复这些问题,科学家们使用了一种叫做“蒸馏”(distillation)的技术。把这想象成一位主厨(老师)正在引导一位初级厨师(学生)完成一道菜谱。学生不仅仅是复制最终的菜肴;他们观察每一次切菜、搅拌和品尝,学习的是烹饪的过程,而不仅仅是结果。

长期以来,教导这些 AI 学生最好的方法是让老师写出完美的答案并展示给学生。但这种方法隐藏着一个陷za:老师有时会先猜出答案,然后再编造一个故事来证明这个答案是合理的,而不是真正通过一步步推理得出结论。学生也会学会这种坏习惯。另一种方法是改变老师的整个大脑(其内部权重)使其变得更聪明,但这往往会导致老师忘记做其他事情的能力,比如写诗或聊天,从而专注于新任务。科学家们一直问的一个大问题是:我们如何创造一个既足够聪明到能展示正确路径,又足够稳定而不至于忘记旧技能,或者不通过偷看答案来作弊的老师?

这篇论文介绍了一个聪明的全新解决方案,叫做 PROMPTSD(基于提示的在策略软蒸馏)。来自美国和新加坡的作者团队提出了一种构建老师的方法,这个老师与学生几乎完全相同,唯一的区别在于其指令前附带了一个微小的、隐形的“魔法笔记”。

以下是它的工作原理,使用一个简单的类比:想象学生和老师是拥有完全相同大脑和性格的双胞胎。通常,要教学生一项新技能,你可能会给老师一副全新的眼镜(改变其大脑)或者一份写有答案的备忘录(给它答案解析)。这两种方法都有问题:新眼镜会让老师看不清其他东西,而备忘录会让老师变得懒惰,只会为答案找理由,而不是去推导答案。

PROMPTSD 采取了不同的做法。它给了老师一个软提示(soft prompt)。把这想象成一张微小的、隐形的便利贴,上面写着:“记住,对于这个特定的数学问题,先考虑分数。”这个提示是由数字组成的,而不是文字,它也是学生与老师之间唯一的区别。老师的大脑保持冻结且完全不变。因为老师没有看答案解析,所以它必须通过思考来生成正确的路径。因为它的脑部没有被重写,所以它不会忘记做其他事情。

研究人员在 Qwen3-1.7B-Base 和另一个名为 Phi-4-mini-instruct 的模型上测试了这个想法。他们教这些模型四种不同的技能:科学、使用工具(如计算器或搜索引擎)、生物学和数学。他们发现,他们的“魔法笔记”老师非常有效。在单一任务中,学生学到的程度与经过全面重训练的水平相当,但学生学习的速度快得多,因为它只需要调整极小比例的参数(大约是总脑容量的 0.05%,而全面重训练需要 100%)。

更令人印象深刻的是,他们尝试同时教学生四种不同的技能。通常,当你试图同时学习太多东西时,你会忘记旧知识(这是一个被称为“灾难性遗忘”的问题)。但由于 PROMPTSD 老师只使用了这些微小的、针对特定任务的笔记,学生可以同时吸收来自四个不同老师的知识,而不会感到困惑或忘记其通用智能。事实上,在 Qwen3-1.7B-Base 模型上,这种多任务方法实现了 56.2 的平均分,击败了所有其他方法。

论文明确排除了几种常见的想法。它表明,仅仅给老师提供答案(比如“金标准答案”老师)实际上会对学生产生负面影响,因为老师只是在进行事后合理化,而不是在推导答案。它还指出,将老师做得更大(比如使用 4B 或 8B 参数的模型)并不总是有效;有时一个与学生规模相同但拥有正确“思考模式”的老师反而更好。此外,他们发现强化学习(一种通过试错来学习的方法)擅长磨练学生已有的技能,但不擅长从零开始教授全新的知识。

作者对这些结果非常有信心,因为他们多次运行了实验并仔细检查了数据。他们精确测量了学生的思考过程与老师的重叠程度,并发现他们的方法创造了完美的重叠量:足以学习,但又不至于让一切都失去了探索的意义。他们还证明了他们的方法避免了“SFT 陷阱”,即重训练模型会导致其失去通用能力。

最后,PROMPTSD 表明,教导 AI 的秘诀不在于把老师变得更大或直接给它答案。相反,在于给老师一个微小的、灵活的推动——一个软提示——在不改变其本质的情况下引导其思考。这使得单个学生可以同时向许多不同的老师学习,成为多种技能的大师,而不会丢失自己的身份。这有点像拥有一位私人导师,每逢不同学科,他都会在你耳边低声传达正确的策略,而无需重写你的大脑,也不必让你偷看考试答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →