← 最新论文
🤖 AI

Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

本文认为,在在策略自我蒸馏(on-policy self-distillation)中,特权标记似然(privileged token likelihood)的变化并不自动构成有效的结局信度(outcome credit),通过形式化分析和实证实验证明,与仅基于结局的对照组相比,此类信号往往无法更好地追踪更优动作或强化预期行为。

原作者: Xuan-Phi Nguyen, Shrey Pandit, Yiran Zhao, Anurag Koul, Zeyu Liu, Shafiq Joty

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuan-Phi Nguyen, Shrey Pandit, Yiran Zhao, Anurag Koul, Zeyu Liu, Shafiq Joty

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人解决一个棘手的数学谜题。你向它展示题目,它开始一步步打出它的思考过程。在最后,你可以轻易地判断机器人的答案是否正确:要么是对的,要么是错的。但是,中间的步骤呢?机器人在第三步时是做出了精彩的举动,还是在第五步时踉跄了一下?在人工智能的世界里,这是一个巨大的谜团。我们知道最终结果,但我们不知道机器人写的哪些特定词汇(或“标记/tokens”)是英雄,哪些是反派。

为了解决这个问题,研究人员尝试了一种被称为“特权自我蒸馏”(privileged self-distillation)的聪明技巧。把它想象成一个学生在参加考试,然后立即得到了一份解释他们本该怎么做的参考页。学生随后查看自己的答案,阅读参考页,并试图弄清楚自己写的哪些词是好的,哪些是坏的。希望通过奖励“好”词并惩罚“坏”词,能让机器人学得更快。但问题在于,仅仅因为一个词在得知答案之后看起来很好,并不意味着它实际上对达成目标有所帮助。它可能只是一个在事后看来听起来很不错的词而已。

这篇来自 Salesforce AI Research 的论文就像是一群怀疑论色彩浓厚的侦探,出现在教室里,检查这种“参考页”方法究竟是真的有效,还是仅仅是一个愚弄老师的魔术。他们设计了一个严谨的实验,以观察这个机器人是在学习正确的教训,还是仅仅在记忆错误的教训。

“事后聪明”大劫案

研究人员决定使用一个拥有 200 亿参数的 AI 模型(一个非常聪明的机器人)和一组困难的数学问题(AIME 2025),来对“特权自我蒸馏”方法进行终极测试。他们的目标是回答三个决定这种教学方法究竟是有用还是浪费时间的问题。

问题 1:“好词”检测器真的能找到正确的词吗?
想象一个侦探试图寻找罪犯。如果侦探指着一名嫌疑人,那名嫌疑人是否真的有动机?研究人员检查了 AI 的“得分”(它给出一个词的分数来表示它有多好)是否真的与正确答案相匹配。他们发现,这个得分基本上是在瞎猜。当他们观察数千次数学尝试时,发现该得分在区分正确解法和错误解法方面,仅比抛硬币好那么一点点。事实上,在根据答案长度进行调整后,该得分对“错误答案”的偏爱甚至略高于“正确答案”!这就像一位老师在批改完试卷后,因为某个学生字迹漂亮就给了那个答错所有题的学生一颗金星。

问题 2:机器人写了自己的成绩单吗?
这是最狡猾的部分。在许多实验中,AI 生成一个答案,然后由同一个 AI(或其版本)对该答案进行评论。研究人员担心这会形成一个自我吹捧的循环。如果你自己写自己的成绩单,你可能会对自己太宽容了。为了解决这个问题,他们尝试了一种“交叉拟合”(cross-fitting)的方法:他们让 AI 为另一个 AI 对同一问题的答案撰写评论。这打破了循环。但即便有了这个修正,得分仍然无法可靠地预测哪些答案是正确的。反馈依然像之前一样混乱。事实证明,仅仅因为你能为一个解法编出一个漂亮的故事,并不代表这个解法本身就是好的。

问题 3:当机器人尝试从这些得分中学习时会发生什么?
最后,他们问道:即便得分很奇怪,但当机器人真正尝试利用它们来改进时,情况会如何?他们使用五种不同版本的“标记信用”(token credit)方法训练了机器人,并将它们与仅通过最终对错进行学习的机器人进行了对比。结果对于“标记信用”的支持者来说是巨大的失望。每一个尝试使用这些高级标记得分的机器人,表现最终都比那个只盯着简单的对错反馈的机器人要差。

  • 简单的机器人大约能答对 64.2% 的题目。
  • 使用标记得分的那些“高级”机器人,答对率仅在 24.2%33.9% 之间。

这就像是那个试图分析自己每一步思考过程的机器人,反而搞混了并彻底忘记了如何解决问题,而那个只看最终结果的机器人却一直在进步。

结论

论文得出结论:一个“标记似然得分”(即一个因为有了参考页而显得更有可能的词)并不自动具有价值。仅仅因为一个词在看到答案后变得更具可能性,并不意味着这个词就是解法的关键。

研究人员发现:

  1. 得分并没有追踪成功;它们基本上是随机噪声。
  2. 反馈是来自同一个答案还是不同的答案,并不能神奇地解决问题。
  3. 使用这些得分进行训练实际上让模型变得更糟了,将其推离了正确答案。

简而言之,论文认为我们不能简单地假设“事后看来很好的东西”就是“实际上有帮助的东西”。在我们开始为 AI 模型写的每一个词给予荣誉之前,我们需要检查三件事:得分是否真的与结果匹配?反馈是否公平且独立?以及训练是否真的让模型变得更聪明?在这次特定的实验中,所有这三个问题的答案都是响亮的“不”。这种给予单个词信用的高级方法失败了,而那种传统的、只检查最终答案的方法才是明显的赢家。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →