Controllable Diversity in Normalization-Based Implicit Ensembles via Softmax-Temperature Modulation
本文介绍了 N-Ens,这是一种具有成本效益的隐式集成方法,它通过使用 Sigmoid 有界缩放器和 Softmax 温度正则化器来在训练过程中动态控制成员多样性和校准度,在多种架构和数据集上实现了与深度集成相当的性能,且参数量显著减少。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在试图解决一个非常棘手的谜题,比如预测天气或者在模糊的照片中寻找一只猫。在人工智能的世界里,获得可靠答案最聪明的方法通常是咨询一整个专家团队,并看看他们是否达成共识。这被称为“深度集成”(deep ensemble)。如果其中一位专家今天状态不佳或产生了困惑,其他专家可以进行平衡,从而让整个团队告诉你:“我们对此很有把握,”或者“我们完全迷失了。”然而,这里有一个难点:雇佣整个团队是很昂贵的。如果你想要一个十人的专家团队,你就必须构建十个独立的、巨大的大脑,这会占用大量的计算机内存和算力。
为了节省成本,科学家们发明了“隐式集成”(implicit ensembles)。他们不是构建十个独立的大脑,而是构建一个巨大的大脑,并给它配备了几种不同的“人格面具”。这些面具会微调大脑的思考方式,使其能同时表现得像十个不同的专家。但问题在于,通常这些面具在脑力开始学习时就已经固定下来了。你无法在训练过程中告诉面具“要更具差异性”或“要更趋于一致”;这就像雇佣一个乐队,乐器的音准在开场时就定死了,之后再也无法调整;如果歌曲需要不同的氛围,乐队也无法改变。这篇论文介绍了一种新的方法,可以在训练过程中实时调整这些面具,让 AI 团队在不需要额外计算机的情况下,找到平衡一致性与差异性的完美境界。
魔法温度旋钮
研究人员 Mihai Suteu 和 Ovidiu Serban 来自伦敦帝国理工学院,他们创造了一种聪明的新方法,称之为 N-Ens。把我们的 AI 模型想象成一个巨大的共享厨房,一位主厨(“骨干网络”)负责切菜和烹饪主菜。在普通的团队中,你会拥有十个不同厨房里的十位不同厨师。而在这种新设置下,你只有一个厨房,但你给了十个不同的“副厨”(集成成员)一副神奇的眼镜。
这些眼镜不会改变食物本身,它们只是改变了副厨们观察食材的方式。一位副厨看一眼西红柿可能会想:“这是主角!”而另一位看同样的西红柿时可能会说:“不,罗勒才更重要。”通过改变每个成员关注共享食谱中不同部分的程度,团队可以产生不同的见解,就像真正的专家团队一样。
这篇论文的重要突破是一个新的“温度旋钮”(称为 softmax 温度,或 ),它控制着副厨们应该在多大程度上产生分歧。
- 调低旋钮(低温度): 系统会强迫副厨们变得非常挑剔。每个人都抓取一组特定的食材并忽略其余部分。他们会变得彼此截然不同,就像一个每个人只专注于单一领域的专业化团队。
- 调高旋钮(高温度): 系统会让副厨们平等地分享一切。他们都以同样的方式看待整道菜肴,并且他们都达成一致。
- 黄金分割点: 作者发现,你既不希望厨师们完全不同,也不希望他们完全相同。你需要一个“金发姑娘原则”(Goldilocks)级别的分歧度。通过调节这个单一的温度旋钮,他们可以让团队沿着一条曲线滑动,从而平衡准确性(得到正确答案)和校准度(知道自己何时不确定)。
为什么这很重要:“调制”技巧
论文解释说,这种方法创造了一种特定类型的确定性,称为调制不确定性(modulation uncertainty)。想象一下,共享厨房是一张非常好的城市地图。副厨们对这张地图都达成了一致。如果有人问:“图书馆在哪里?”他们都会指向同一个地方。但如果有人问:“在一个不存在的城市里,图书馆在哪里?”那么这张地图就没用了。
因为所有的副厨都在观察同一张地图(共享的骨干网络),所以当问题涉及正常城市时,他们非常擅长表达“我们很有信心”或“我们不确定”。然而,如果你问的是一个完全虚构的城市(科学家称之为“分布外数据”,out-of-distribution),他们可能会因为都在看同一张错误的地图,而自信满满地指向错误的地方。论文承认,虽然这种方法在处理正常数据时的校准表现极佳,但在识别完全虚假的数据方面,不如十个完全独立的厨师团队那样出色。
结果:小足迹下的巨大胜利
团队在著名的图像数据集(如 CIFAR-10/100 和 ImageNet)以及文本数据集 SST-2 上测试了他们的想法。他们使用了不同类型的 AI 大脑,包括 ResNets 和 Transformers。
以下是他们的发现:
- 更便宜且更聪明: 他们的这种方法匹配甚至超越了昂贵的“十个独立厨师”(深度集成)的表现,但使用的计算机内存仅为后者的极小部分。例如,在带有 WideResNet 模型的 CIFAR-100 数据集上,他们的方法获得了最佳准确率和最低错误率,但仅使用了约 2400 万个参数,而完整的深度集成则需要 1.46 亿个参数。
- 规模化能力: 通常,当你尝试在这些“隐式”设置中增加团队成员时,由于空间不足,团队的表现会变差。但在这种新方法下,随着成员数量增加(最多到 16 个),团队的表现实际上变得更好或保持稳定,而其他方法则会崩溃。
- 微调魔法: 你可以拿一个预训练好的 AI 模型(已经学到了很多知识的模型),只需添加这些神奇的眼镜并进行一次短时间的“微调”,就能将其转化为这个聪明的团队。你不需要从零开始。
权衡
论文非常诚实地说明了局限性。由于所有人都在共享同一个大脑,这个团队在面对正常事物时非常擅长表达不确定性(校准),但在识别完全奇怪或虚假的事物(分布外检测)方面稍显逊色。这就像一群读过同一本书的朋友:他们会对情节达成共识,但如果你问他们关于书中没有的情节转折,他们可能会都自信满满地编造出相同的错误答案。
然而,对于大多数我们需要 AI 可靠且不会过度自信的现实任务而言,这种方法提供了一种实用且可控的方式,让我们能以极低的成本获得庞大团队带来的好处。它将团队的“多样性”从一个固定的设置变成了一个可以在 AI 学习过程中旋转的旋钮,确保团队始终处于完美的“分歧区间”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。