← 最新论文
🤖 machine learning

When Context Returns: Toward Robust Internalization in On-Policy Distillation

本文通过提出一种轻量级一致性正则化器,以确保在不同领域中实现鲁棒的内化与上下文可移除性,识别并解决了“上下文诱导退化”现象,即向蒸馏后的学生模型重新引入特权上下文会损害其性能的问题。

原作者: Xun Wang, Ruishuo Chen, Zhuoran Li, Yu Chen, Longbo Huang

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xun Wang, Ruishuo Chen, Zhuoran Li, Yu Chen, Longbo Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在训练一名学生成为一名名厨。

旧的方法(问题所在):
通常,你会通过让学生观察你一边看一本特殊的“秘密食谱书”(即特权上下文/privileged context)一边烹饪来教导他们。这本书会准确地告诉你要如何处理棘手的食材,或者应该追求什么样的风味特征。学生观察、学习,并最终将这些菜肴背得滚瓜烂熟,以至于即使没有了书,他们也能完美地烹饪出来。

然而,这篇论文的研究人员发现了一个奇怪的故障。一旦学生记住了这些食谱,如果你在他们烹饪时再次把“秘密食谱书”递给他们,他们突然就会变得困惑。他们开始过度思考,犯下一些如果仅凭记忆烹饪时绝不会犯的错误,并且最后写出的食谱卡片也变得冗长且啰嗦。

研究人员将这种现象称为**“上下文诱导退化”(Context-Induced Degradation)**。这就像是一个学生已经把教科书背得如此透彻,但如果你在考试时允许他翻开书,他反而会陷入恐慌并忘掉一切,因为信息现在变得冗余且令人困惑。

新的解决方案 (NCA):
作者提出了一个简单的修复方法,叫做无上下文锚定(No-Context Anchoring, NCA)

可以这样理解:在训练期间,老师告诉学生:“先在没有书的情况下做这道菜。写下你做的每一个步骤。这就是你的锚点(Anchor)。”

然后,老师说:“现在,带着书做同样的菜。”但这里有一个规则:你带着书时的输出必须与没有书时的输出完全一致。

如果学生开始偏离或被书本搞糊涂了,老师会温柔地将他们拉回“锚点”(即无书版本)。老师本质上是在说:“这本书现在已经成为了你大脑的一部分;你不需要通过看它来知道该做什么。如果你看了书之后改变了主意,那你就做错了。”

尝试结果如何?
研究人员在 12 个不同的场景中测试了这种方法,范围从回答医学问题到玩文字冒险游戏。以下是他们的发现:

  1. 停止恐慌: 在几乎所有情况下,“恐慌”(退化)都停止了。当上下文(书)被重新引入时,模型并没有变差;它保持了稳定性。
  2. 更好的记忆力: 令研究人员惊讶的是,在训练期间强制模型忽略书本,实际上让它在没有书的情况下表现得更好了。看起来,通过阻止模型被书本分心,它更深刻地学习了核心任务。
  3. 更简洁的回答: 以前,当模型看到书时,它们往往会写出冗长啰嗦的答案。使用这种新方法后,它们不再扩充答案,而是直奔主题。
  4. “大脑”检查: 研究人员观察了模型内部的“大脑”(其隐藏层)。他们发现,使用这种新方法后,无论书是否存在,大脑的内部状态几乎是完全相同的。信息已经真正被吸收到了模型的结构中,使得外部的书籍变得不再必要。

三类学生:
论文还注意到,当重新引入书本时,会出现三种反应类型:

  • A 型(困惑者): 学生在没有书时表现出色,但书的存在让他们变差了。(这是最常见的问题,且新方法修复了它)。
  • B 型(学习者): 学生仍然需要书才能做得好,这意味着他们还没有完全掌握这门课。
  • C 型(大师): 学生已经足够优秀,以至于书的存在对他们而言无关紧要。

底线结论:
这篇论文表明,仅仅教模型去模仿一个使用“小抄”的老师是不够的。为了让模型真正强大,你必须教会它,那份“小抄”现在已经是它思维的一部分。如果以后重新引入小抄,模型的行为不应发生改变。这种新方法是一种轻量级、易于添加的规则,它确保了无论“小抄”是否在场,模型都能保持冷静和一致。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →