← 最新论文
🤖 machine learning

Flower Hub: A Reproducible Benchmarking Platform for Federated Learning in Simulation and Deployment

本文介绍了 Flower Hub,这是一个可复现的基准测试平台,它能够跨越不同领域和运行时(模拟与部署)发布并执行标准化的、版本化的联邦学习应用,以克服现有评估中存在的临时性、非便携性的局限。

原作者: Yan Gao, Mohammad Naseri, Javier Fernandez-Marques, Dimitris Stripelis, Lorenzo Sani, Davide Eynard, Fan Zhang, Hong Jia, Ting Dang, D. B. Emerson, Fatemeh Tavakoli, Ole Werger, Lars Wulfert, Petros D
发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yan Gao, Mohammad Naseri, Javier Fernandez-Marques, Dimitris Stripelis, Lorenzo Sani, Davide Eynard, Fan Zhang, Hong Jia, Ting Dang, D. B. Emerson, Fatemeh Tavakoli, Ole Werger, Lars Wulfert, Petros Demetrakopoulos, Sofia Tsekeridou, InSeo Song, KangYoon Lee, Honghao Li, Lingjuan Lyu, John P Dickerson, Daniel Janes Beutel, Nicholas D. Lane

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界中,最珍贵的数据往往是最私密的。医院保存着详细的患者健康记录,银行追踪每一笔金融交易,而个人设备则生成着音频和文本流。几十年来,构建智能计算机程序的标准方法是将这些分散的信息收集到一个巨大的中央仓库中。然而,隐私法律、安全顾虑以及海量的数据量,使得这种中心化的方式变得日益困难甚至无法实现。取而代之的是一种新的方法:计算机程序前往数据所在地,在本地进行学习,然后仅将学到的经验传回中央协调器。这种被称为“联邦学习”(federated learning)的方法,让机器能够在无需看到原始、敏感信息本身的情况下实现自我提升。

尽管前景广阔,但测试这些系统却是一个混乱且困难的过程。研究人员通常构建自己的定制工具来运行这些实验,导致形成了一个一个团队的研究结果无法被另一方轻松检查或对比的局面。许多研究依赖于在屏幕上看起来完美的计算机模拟,但在面对真实网络和设备的复杂现实时却会失效。此外,用于运行这些测试的代码往往是不完整的,或者与特定硬件绑定,使得其他人几乎无法复现其工作成果。由于缺乏可靠的测试和比较这些方法的方式,该领域在从理论实验向人们可以信任的实际应用转型的过程中举步维艰。

为了解决这个问题,一个研究小组构建了一个名为 Flower Hub 的新平台。可以将它想象成一个标准化的、开源的工作坊,科学家们可以在这里发布、分享并运行分布式学习系统的测试。其核心思想是将一个基准测试(benchmark)视为一个完整的、自包含的应用程序,而不仅仅是一堆杂乱的脚本。正如移动应用可以下载并在不同的手机上运行,而无需重新构建手机本身一样,这些基准应用程序也可以被下载并在不同的环境中运行。研究人员设计的系统将学习任务的逻辑与底层的计算机基础设施完全分离。这意味着研究人员可以完全专注于他们正在测试的算法,而平台则处理连接不同计算机和管理信息流的复杂工作。

这种方法的强大之处在于,它能够在不修改一行代码的情况下,在两个截然不同的世界中运行完全相同的测试。首先,该应用程序可以在模拟环境中运行,即由一台计算机模仿许多不同用户的行为,以快速测试算法的表现。随后,无需任何修改,该应用程序就可以部署到现实世界中,在由实际的、独立的计算机或设备组成的网络中运行。这种无缝衔接弥合了理论与实践之间的鸿沟,让研究人员能够观察到他们的想法在面对真实的延迟、变化的硬件速度以及不可预测的实时数据时是否依然有效。

为了证明该平台的有效性,该团队创建了五个截然不同且具有现实意义的挑战任务,这些任务模拟了实际的应用场景。其中包括:在五家不同的医院之间训练一个识别脑部肿瘤的系统;在五家模拟银行之间检测欺诈交易;以及在五家不同的律师事务所之间微调一个理解法律文件的语言模型。他们还测试了安全任务,例如在一百个用户组成的网络中识别钓鱼链接,以及设备端音频识别,即五十个不同的设备学习如何识别各种环境声音。这些场景涵盖了从图像、文本到声音和金融记录的广泛数据类型,并反映了现实世界中数据不均衡、不规则的特性,例如某些用户拥有的信息远多于他人。

当研究人员在这些五个挑战任务中运行六种不同的学习策略时,他们发现没有任何一种方法是完美的。有些策略在医学影像和法律文本方面表现出色,而另一些策略在面对数据高度不平衡的金融欺诈检测时则表现得非常吃力。结果表明,最佳方法在很大程度上取决于数据的具体类型和所要解决的问题。例如,一种为学习过程引入稳定力量的方法在大多数任务中表现得非常一致,而其他更复杂的方法有时会变得不稳定或无法取得进步。实验还揭示,训练这些模型的耗时往往不是由计算本身决定的,而是由在计算机之间移动数据以及为使用数据做准备所花费的时间决定的。

除了衡量最终模型的准确性之外,该平台还提供了对系统健康状况的详细观察。它追踪了计算机使用的内存量、每一步骤所需的时间以及往返传输的数据量。这种可见度至关重要,因为一个模型可能很准确,但如果运行起来太慢或成本太高,就无法在真实的医院或银行中使用。通过将这些系统层面的细节与学习结果一同记录,该平台提供了一个关于部署解决方案实际成本的完整图景。团队展示了这些测试可以在跨区域的真实部署中成功运行,证实了这些应用程序在受控模拟环境之外也能可靠运行。

Flower Hub 的终极目标是将联邦学习转变为一个协作生态系统,而非一系列孤立的实验。通过将这些测试打包为标准化的、可执行的应用程序,研究人员使得任何人都可以下载一个基准测试,在自己的硬件上运行,并直接与其他人的结果进行对比。这种转变使该领域从难以复用的临时代码转向了一个可以建立可靠进展的系统。虽然目前的工作侧重于基准性能,尚未涵盖所有可能的场景(如极端的隐私约束或高度个性化的学习),但它奠定了一个坚实的基础。该平台证明了创建一个共享的、可复现的环境来测试去中心化智能是可能的,这为未来构建更强大、更可靠的人工智能系统铺平了道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →