What composition selection buys in heterogeneous ensembles, and why oracle bounds overstate it
本文表明,虽然选择异构集成成员的最优组合比均匀混合能带来微小的收益,但它并不能超越仅仅选择表现最好的单一族群,这揭示了所感知的提升潜力在很大程度上是选择偏差的产物,而非真正的未开发性能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在机器学习的世界里,计算机通过学习来识别模式并做出预测,这里存在一种常见的策略叫做集成学习(ensemble learning)。想象一下,一支专家团队正在试图解开一个复杂的谜题。与其依赖单一的专家,不如将许多不同个体的答案结合起来,以得出更准确的结论。这种方法之所以奏效,是因为一个人的错误往往会被群体的智慧所纠正。有时,这些团队的成员都使用相同的思考方法,比如一群统计学家;而另一些时候,团队则是混合型的,将使用完全不同的工具和方法的专家汇聚在一起。这种不同方法的组合被称为异质集成(heterogeneous ensemble)。长期以来,研究人员的核心问题一直是:当资源有限时,如何最好地构建这样一个团队。如果你有预算来训练三百个计算机模型,你应该在第一种类型的专家上花费多少,在第二种上花费多少,在第三种上又该花费多少?寻找完美的平衡似乎是榨取额外性能的一种逻辑方式,许多研究人员多年来一直致力于开发复杂的算法来搜索这种理想的组合。
特拉布宗大学的穆罕默德·埃尔德姆(Muhamtelp Erdem)的一项新研究挑战了这一搜索的前提。研究人员旨在测试:花费精力去寻找不同模型类型的完美比例,是否真的能产生任何实际收益。为此,他利用三十个涵盖从医疗记录到金融数据的各种公开数据集构建了一个大规模实验,并在每个数据集上运行了十次测试,以确保结果并非偶然。他将计算机模型的总数固定为三百个,并将它们分配给三个截然不同的学习算法家族:随机森林(random forests)、极端随机树(extremely randomized trees)和袋装最近邻(bagged nearest neighbors)。这些都是该领域标准且成熟的工具。该研究比较了六种决定如何拆分这三百个模型的方案。其中一些方法使用简单的固定规则,而另一些则使用复杂的搜索,根据它们在测试集上的表现来寻找最佳组合。
结果清晰且令人惊讶。研究证实,由三种模型类型组成的固定等量混合团队,其表现不如任何尝试选择特定混合比例的方法。平均而言,仅仅是尝试选择一种混合比例,其准确度就比随机、均匀的拆分提高了近百分之零点七。这证明了团队的构成确实至关重要。然而,寻找“完美”构成的尝试却被证明是一个死胡同。没有任何复杂的搜索方法——包括那些试图平滑误差或对许多不同猜测进行平均的方法——能够击败一个更简单的策略:即挑选出表现最好的单一家族,并将全部预算都投入到该种类型的模型中。事实上,最复杂的搜索方法在统计学上与仅仅选择表现最好的单一家族类型并无区别。研究人员发现,寻找不同模型混合比例所付出的额外努力并没有带来可衡量的准确度提升。
论文进一步解释了原因,揭示了所谓的潜在改进空间在很大程度上是由于研究人员衡量成功的方式所创造的一种幻觉。在许多研究中,“最佳可能”的结果是通过查看所有候选混合比例并选取在测试数据上得分最高的那个来计算的。这通常被称为“神谕界限”(oracle bound),代表了一个现实世界的方法应当尝试达到的理论天花顶。埃尔德姆指出,这个天花板被人为抬高了。因为不同的模型混合比例彼此之间非常相似——在数百个模型中仅有几个模型的差异——它们的性能评分具有高度相关性和噪声。当你从一大组具有噪声且相似的估计值中挑选最大值时,你几乎注定会选到一个高于真实潜力的数值。该研究引入了一种更诚实的衡量潜在能力的方法:将测试数据一分为二——用一半用于选择最佳混合比例,另一半用于观察其实际表现。当应用这种更公平的测试时,所谓的“提升空间”完全消失了。寻找完美混合比例的表象优势被揭示为完全是选择偏差(selection bias),这是一种统计伪影,而非真实的机遇。
研究还探讨了增加团队多样性是否会改变结果。研究人员加入了第四种模型类型——线性家族(a linear family),以观察更广泛的组合是否会让寻找混合比例的过程变得更有价值。即使增加了这种多样性,结果依然保持不变。虽然不同混合比例之间的潜在差异略有扩大,但复杂的搜索方法仍然无法击败仅仅选择单一最佳家族的简单策略。事实上,随着可能存在的混合比例数量增加,寻找完美混合比例的“表象优势”也随之增大,但诚实的、现实世界的优势依然是负向的。这证实了问题不在于模型的缺乏多样性,而在于在数据存在噪声时,区分极其相似的选项本身就存在根本性的困难。性能的景观并不是一个特定混合比例脱颖而出的尖锐峰顶,而是一个宽阔、平坦的高原,许多不同的混合比例表现得几乎完全相同,而它们之间微小的差异极易被随机噪声所淹没。
对于任何构建这些计算机模型的人来说,实际的建议是直截了当的。不要浪费时间或工程精力去计算不同模型类型的完美比例。相反,选择现有的单一最佳模型家族,并使用你的全部预算来构建一个仅由该类型组成的大型团队。唯一真正重要的选择是避免使用所有类型的默认等量混合,因为那可靠地是表现最差的选择。这项研究表明,集成学习领域一直在追逐一个幻影。认为有必要进行复杂搜索以寻找理想构成的信念,是基于一种夸大了潜在收益的测量误差。通过使用更严谨的测试方法,研究显示,寻找更好混合比例的信号往往太弱,难以从数据的噪声中被识别出来。最有效的路径不是去寻找复杂的组合,而是选择最强大的单一工具并充分利用它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。