When More Foundation Models Means Less: Diagnosing and Addressing Multi-View Fusion Failure
本文指出,盲目融合多个基础模型往往会因为冗余和失配而导致性能下降,并提出了 KAGES,一种标签感知的、高效的贪婪选择方法,通过优化视图集组合,以实现具有紧凑且任务对齐的编码器子集下的卓越下游准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的现代时代,研究人员可以接触到庞大的预训练计算机程序库,这些程序通常被称为基础模型。这些是已经通过学习海量数据来识别模式、理解语言或解读图像的大型系统。可以将它们想象成已经磨利但尚未应用于特定工作的专家工具。多年来,利用这些工具解决新问题的标准方法是将尽可能多的模型结合起来,其前提假设是更多的信息总能带来更好的结果。其逻辑很简单:如果一个工具从一种方式观察图像,而另一个工具从另一种方式观察,那么将它们结合起来应该能创造出一个完美且全方位的视角。这种被称为“多视图学习”(multi-view learning)的思想,长期以来一直是科学家试图通过合并不同来源的信息来构建更智能系统的基石。
然而,一项新的研究挑战了这一基本信念。来自北京邮电大学的研究人员发现,当你开始混合大量这类预训练专家时,增加数量并不一定会让最终结果变得更好。事实上,超过某个临界点后,增加另一个工具反而可能使系统变差。研究团队发现,最佳性能通常是通过选择一小组特定的模型而非使用大规模、随机的集合来实现的。他们观察到,虽然加入组合中的前几个模型能提供新鲜且有用的见解,但随后的添加往往会重复系统已有的信息,或者引入与当前任务无关的干扰信号。这种现象创造了一条曲线:性能迅速上升,达到顶峰,然后随着被迫加入更多模型而开始下降。
为了解决这个问题,研究人员开发了一种名为 KAGES 的新方法,它充当了这些 AI 模型的智能选择器。KAGES 不再盲目融合所有可用的工具,而是仔细评估哪些特定的模型应该被组合在一起以及应该使用多少个。它的工作原理是衡量一组模型的组合信息与特定任务正确答案的匹配程度,而无需先训练一个新系统来进行测试。该方法采取贪婪策略,添加下一个能提供最多新颖、有用信息的最佳模型,同时避开那些仅仅是重复已知信息或增加噪声的模型。这种方法允许系统在额外信息不再有帮助时恰好停止添加模型,从而确保最终的组合既精简又高效。
团队在广泛的任务中测试了这一想法,包括识别图像中的物体、识别纹理,甚至理解语言。在每种情况下,他们都发现“越多越好”的假设失效了。在某些任务中,性能在仅组合了三到四个模型后就达到了顶峰,而增加模型则会导致准确率下降。例如,在一项涉及识别交通标志的任务中,系统使用极小的一组模型表现最好;而在一项涉及地理定位的任务中,单个模型已经足够优秀,以至于添加其他模型不仅没有带来收益,有时甚至会损害性能。研究人员还注意到,理想的模型数量取决于可用数据的多少:随着数据的增加,系统可以在性能开始下降之前处理更多的模型,但性能的顶峰总是出现在一个数量惊人的较小数值上。
结果显示,KAGES 的表现始终优于其他方法,包括那些尝试结合所有可用模型的方法,以及那些仅仅挑选彼此互补的模型的方法。通过关注组合的质量而非数量,KAGES 能够找到模型协作最有效的“甜点区”。在许多情况下,它的表现几乎与一个必须测试所有可能的组合才能找到最优解的完美理论选择器不相上下,但它完成得更快,且无需为每次测试训练新系统。这一发现表明,构建强大 AI 系统的未来不在于积累更多的工具,而在于对正确工具的精心、智能的选择。随着可用 AI 模型库的不断扩大,选择完美小型专家团队的能力将变得比以往任何时候都更加重要,这将把管理庞大资源的挑战转化为实现精准与效率的机会。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。