← 最新论文
🤖 machine learning

Rethinking Reverse KL as Adaptive Entropy Distillation

本文提出了一种名为自适应熵蒸馏(Adaptive Entropy Distillation, AED)的新型知识蒸馏方法,该方法通过分解反向 KL 目标,利用教师模型的熵来动态校准标记级(token-level)的模仿强度,从而在无需显式前向 KL 分支的情况下,实现卓越的性能和更好的分布对齐。

原作者: Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Shizhen Li, Zhiyu Shen, Yuyin Lu, Yunhe Pang, Jielin Song, Yanghui Rao, Fu Lee Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是当今许多最先进人工智能工具背后的引擎,它们能够创作故事、解决问题并进行对话。然而,这些强大的系统通常规模庞大,运行起来需要巨大的计算能力和能源,这使得它们难以部署在日常设备上。为了解决这个问题,研究人员使用了一种称为“知识蒸馏”的技术。想象一下一位大师厨师正在教导学徒;目标是将大师的技能转移给学生,使学生能够以极少的资源实现几乎同样出色的表现。在数字世界中,一个大型的“教师”模型试图教导一个较小的“学生”模型如何生成文本。挑战在于如何有效地传授这门课程。如果学生过于僵化地模仿老师,它可能会变得呆板,无法处理新情况;如果模仿得太松散,它又会失去老师的精准度。在试图让这些小型模型真正变得实用的过程中,如何在严格模仿与创造性灵活性之间找到平衡,长期以来一直是研究人员面临的障碍。

来自中山大学和香港都会大学的一个研究团队提出了一种处理这一教学过程的新方法,摆脱了经常在平衡方面挣扎的标准方法。他们的工作专注于一种用于衡量学生学习效果的特定数学方法,即反向库尔贝克-莱布勒散度(reverse Kullback-Leibler divergence)。简单来说,这是一种检查学生的选择与老师的选择匹配程度的方法。研究人员意识到,现有的方法将这种检查视为一条单一且不变的规则。他们发现,在这条规则本身之中存在着两种相互对立的力量:一种推动学生关注老师最确定的答案,另一种则鼓励学生保持开放的选择空间,避免变得过于狭隘。

研究团队并没有尝试将不同的规则混合在一起,而是决定深入研究这一单一规则,并动态调整其内部设置。他们开发了一种被称为“自适应熵蒸馏”(Adaptive Entropy Distillation)的方法。其核心思想是让老师自身的确定性来引导教学。当老师对接下来的表达非常确定时,学生被指示紧密跟随并模仿那个特定的选择。但当老师不确定,或者当有许多同样好的方式来延续句子时,学生则被允许更加灵活,去探索更广泛的可能性。这并不是在训练开始时给出的静态指令;相反,系统会在对话的每一步检查老师的信心,并据此调整学生的行为。

为了测试这种方法,研究人员在诸如遵循指令和解决数学问题等任务上训练了几组从小型到中型规模的模型对。他们将这种新方法与其他试图平衡模仿与灵活性的流行技术进行了对比。结果显示,他们的自适应方法始终能产生更好的结果。使用这种新方法训练的学生模型不仅在遵循指令方面表现更好,而且在逻辑对齐方面也展现出与老师内部逻辑更强的契合度。在数学推理任务中,即使在给予模型有限尝试机会的情况下,这种新方法也帮助小型模型比以往的方法正确解决了更多问题。

研究人员还仔细观察了模型在训练期间的内部运作情况。他们发现,该方法帮助学生模型更准确地匹配了老师的选择分布。这意味着学生不仅学习了正确的答案,还学习了每个答案应有的置信水平。当老师不确定时,学生也会保持不确定,而不是自信且错误地进行猜测。这种镜像化老师不确定性的能力对于创建可靠的人工智能至关重要,因为它能防止模型在实际是在猜测时表现得过于权威。通过利用老师自身的确定性来校准教学,研究人员发现了一种方法,可以在不改变模型基本架构的情况下,使小型模型更加稳健且更具能力。

虽然这种方法展现出了巨大的潜力,但研究人员指出,它目前在教师和学生模型共享相同词表时效果最好,这在开源模型中很常见,但对于专有系统来说可能是一个障碍。由于计算能力的限制,他们也没有在最大、最复杂的模型上测试该方法,尽管他们的理论表明这在任何规模下都应该有效。这项研究表明,通过重新思考我们衡量教师与学生之间距离的方式,我们可以创造出一个更细致且更有效的学习过程。这项工作表明,提升人工智能的关键或许并不总是构建更大的模型,而是更聪明地教导那些较小的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →