← 最新论文
🤖 machine learning

On-Policy Self-Distillation without Any Supervision

本文介绍了无监督在策略自我蒸馏(Unsupervised On-Policy Self-Distillation, U-OPSD),这是一种通过仅利用其自身生成的内部一致性,使大语言模型能够通过自我修正进行提升的新方法,在不依赖外部真值信号的情况下,实现了与监督技术相当甚至更优的性能。

原作者: Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大的数字大脑——被称为大语言模型(LLM)——正在学习解决复杂数学谜题的世界。长期以来,这些大脑需要一位人类老师站在它们身后,指明每一个错误并递给它们正确答案。这就像一个学生在考试时,老师在他们还没做完题目之前就在耳边低声提示正确答案。但如果老师不在了呢?如果大脑必须进行自我教学呢?这就是研究人员正在提出的重大问题:一个模型能否仅仅通过观察自己的工作,在没有任何外部帮助的情况下变得更加聪明?

要理解这篇论文中的新概念,你需要了解两件事。首先,有一种被称为“蒸馏”(distillation)的技术,它就像一个学生试图模仿大师的思想过程。通常,“大师”是一个独立的、更大或更聪明的 AI。其次是“在策略”(on-policy)学习,这意味着学生练习的是它自己生成的准确答案,而不是学习旧的、预先写好的示例。一直以来的巨大障碍在于,即使模型尝试自我教学,它仍然需要一个“金标准”答案来判断自己是对是错。如果没有那个外部的真相,模型可能会只是不断练习自己的错误,一次又一次地自信满满地犯错。

这篇论文引入了一个巧妙的技巧,称为 U-OPSD(无监督在策略自我蒸馏)。研究人员发现,模型实际上并不需要人类老师或“金标准”答案来学习。相反,它可以表现得像一间正在参加同一场测试的、充满一模一样双胞胎的房间。如果一个双胞胎得到了一个奇怪的答案,但其他九个双胞胎都对另一个答案达成一致,那么这个群体就找到了“共识”。论文指出,这种一致性本身就是一个足够强的信号,足以说明:“好吧,这可能就是正确的路径。”

以下是奇迹发生的过程:模型生成许多次不同的尝试(称为“采样路径”,rollouts)来解决一个数学问题。然后,它进行一次投票。如果大多数尝试对一个答案达成一致,那么这个答案就成为了“伪解”(pseudo-solution)——一个完全由模型自身创造的、虚假但可信的答案库。随后,模型会观察那些与多数派意见不一致的尝试。这些就是“错误”的路径。模型扮演自己的老师,向这些“错误”路径展示如何一步步转化为“正确”路径。这就像一个学生写了一篇冗长且混乱的论文,意识到大多数朋友都写了一篇清晰且正确的论文,然后重新改写自己的论文以符合群体的逻辑,但仅针对那些自己跑偏的部分进行修正。

结果非常令人惊讶。研究人员在不同的模型规模(40 亿和 80 亿参数)下,在几项困难的数学竞赛(如 AIME 和 MATH500)上测试了这一方法。他们发现,这种完全不使用外部监督的“自我教学”方法,实际上比依赖人类验证答案的“非思考”模式(即模型快速回答模式)效果更好。在这种模式下,经过自我训练的模型比初始点提升了 8.5%10.7%,甚至超越了使用“金标准”答案的方法。然而,在“思考”模式(即模型花时间进行推理)下,结果则有所不同:自我训练的模型表现出与监督方法持平略微领先,与它们非常接近,而非完全压制。

论文认为,之所以有效,是因为模型的自身一致性是一个强大的信号。当模型能够通过多数票产生信心时,它就知道自己走在正确的轨道上。当它与自己产生分歧时,那正是学习发生的地方。研究人员指出,让这些模型变得更聪明的瓶颈不在于缺乏答案库,而在于识别并修复自身不一致性的能力。通过使用这种“多数投票”策略,模型可以进化并自我改进,将一间充满困惑的双胞胎房间变成一个单一的、更聪明的天才。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →