← 最新论文
🤖 machine learning

Wisdom of Committee: Diverse Distillation from Large Foundation Models and Domain Experts

该论文提出了 DiverseDistill,一种利用可学习问答机制将来自多样化基础模型和领域专家的输出有效地对齐到紧凑的学生模型中的交互式蒸馏框架,在无需教师模型协同优化或产生推理开销的情况下实现了卓越的性能恢复。

原作者: Zichang Liu, Qingyun Liu, Yuening Li, Liang Liu, Anshumali Shrivastava, Shuchao Bi, Lichan Hong, Ed H. Chi, Zhe Zhao

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Zichang Liu, Qingyun Liu, Yuening Li, Liang Liu, Anshumali Shrivastava, Shuchao Bi, Lichan Hong, Ed H. Chi, Zhe Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教导一名才华横溢但身材瘦小的学徒(一个小型、高效的计算机模型)去做一项特定的工作,比如推荐电影或在照片中识别猫。你可以接触到两种类型的导师:

  1. “超级天才”(基础模型): 这位导师极其聪明,无所不知,读遍了互联网上的每一本书。然而,他们体型庞大、反应缓慢,且使用的语言非常复杂,让小小的学徒难以理解。
  2. “专家”(领域专家): 这位导师规模较小、速度较快,并且能完美地使用学徒的语言。他们在特定任务上表现出色,但对更广泛的世界知之甚少。

问题所在:
如果你尝试直接让学徒向“超级天才”学习,差距实在太大。学徒会被这种信息量淹没,从而学不到什么东西。如果你只使用“专家”,学徒虽然能掌握这项工作,却会错过“超级天才”那更广博的智慧。

如果你把两位导师都请进房间,并只是要求他们“取长补短”(一种常见的做法),往往会适得其反。超级天才复杂的、令人困惑的建议会与专家的简单建议发生冲突,结果导致学徒的表现甚至比只听从专家建议时还要差。

解决方案:“DiverseDistill”(交互式翻译器)
作者提出了一个名为 DiverseDistill 的新教学方法。与其让导师们只是大声喊出建议,不如在学徒和导师之间引入一个聪明的翻译器(称为蒸馏模块/Distillation Module)。

它是这样运作的,这里用一个创意类比来解释:

1. “问答”游戏

想象学徒正在参加一场测验。

  • 翻译器观察学徒当前的理解程度,然后根据“超级天才”的思维方式,专门为他们设计一个特定的问题;接着,它会根据“专家”的风格设计另一个不同的问题。
  • 导师们回答这些问题。因为问题是用每位导师最容易理解的方式提问的,所以他们能给出高质量的答案。
  • 翻译器随后将这些答案“翻译”回学徒的母语,以便学徒能够真正从中学习。

2. “智能过滤器”(节省能量)

与“超级天才”交流是非常昂贵的(需要消耗大量的计算资源)。翻译器很聪明,它知道:“对于这个特定的问题,专家就是完美的专家,不需要用到超级天才。”
因此,翻译器会跳过针对该特定问题询问超级天才的过程。这在训练期间节省了约 30% 的计算时间,且没有损失任何质量。

3. “幽灵”翻译器

一旦学徒完成了学习,翻译器和导师们就会被丢弃。学徒将独自一人,但此时他们已经变得非常聪明。他们的体积和速度与之前完全一样,但已经吸收了两种模式的精华。在实际工作中,他们没有任何额外的成本

这篇论文的研究发现

研究人员在两个主要任务上测试了该方法:

  • 电影推荐: 他们尝试用一个大型语言模型(超级天才)和一个大型电影推荐模型(专家)来教导一个小型电影推荐模型。
    • 结果: 标准方法失败了,甚至让情况变得更糟。DiverseDistill 让小模型填补了从“差生”到“顶级老师”之间 114% 的差距。它实际上学到的东西比任何单一老师单独能教出的东西都要多。
  • 图像识别: 他们尝试用一个大型视觉模型和一个专家来教导一个小型的图像识别模型。
    • 结果: 同样,标准方法表现挣扎。DiverseDistill 恢复了 73% 到 90% 的性能差距,始终优于所有其他方法。

核心结论

该论文声称,你不能只是把一群不同的专家扔进一个房间,就指望他们能有效地教导一个小的学生。你需要一个交互式系统,它知道如何向正确的专家提出正确的问题,并将答案进行翻译。

通过这种方式,他们成功地将一个拥有 7600 万参数的大型模型压缩到了一个仅有 200 万参数的小型模型(38 倍压缩),同时保留了几乎所有的智能,而且无需更改大模型,也不需要将它们一起训练。这个“翻译器”仅在学习阶段使用,之后便会消失,留下一个精干、强大的学生准备好投入现实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →