← 最新论文
🤖 machine learning

FDA-Opt: Federated Fine-Tuning via Dynamic Update Schedules

本文介绍了 FDA-Opt,这是一个统一的联邦学习算法家族,它通过动态调度模型更新来克服现有方法(如 FedOpt 和 FDA)中僵化的通信限制,证明了其作为一种无需额外配置、可直接替换的方案,在微调大语言模型方面具有卓越的性能。

原作者: Michael Theologitis, Vasilis Samoladas, Antonios Deligiannakis

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Michael Theologitis, Vasilis Samoladas, Antonios Deligiannakis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数字世界中,大量有价值的信息被锁在私有的孤岛之中。医院保存着敏感的患者记录,手机里存着个人信息,但严格的隐私法律和伦理考量阻止了将这些数据源汇集到单一的大型数据库中进行人工智能训练。为了解决这个问题,研究人员开发了一种称为联邦学习(federated learning)的方法。与其将数据移动到中央计算机,不如让计算机模型前往数据所在地。它访问不同的设备,从本地信息中学习,然后仅将它学到的经验传回中央服务器。这使得强大的人工智能系统能够在不暴露生成数据的个人隐私细节的情况下,从多样化的现实世界数据中进行训练。

然而,随着人工智能模型变得越来越大、越来越复杂,一个显著的瓶um(瓶颈)出现了。目前的联邦学习标准依赖于一种僵化的时间表:模型访问一个设备,进行固定步数的训练,然后立即返回服务器分享其更新。这个循环重复成千上万次。由于现在的模型规模巨大,这种来回发送更新的行为消耗了大量的带宽和时间,往往会拖慢整个过程。挑战在于,如何找到一种方法,让模型在返回之前能在每个设备上更有效地学习,而不至于导致训练变得不稳定或通信成本失控。

一组研究人员通过引入一个名为 Fda-Opt 的新算法家族解决了这一问题。他们的工作重点在于用一种能够倾听训练过程本身的动态机制,来取代那种僵化的、固定的时间表。在传统方法中,无论模型是否仍在学习有用的信息,还是已经开始偏离正轨,都会被迫在预定的步数后停止训练并返回服务器。新方法 Fda-Opt 则实时监测学习过程的稳定性。它观察学习更新是否变得不稳定或产生冲突。只要学习保持稳定且富有成效,模型就被允许在本地设备上继续训练。只有当系统检测到学习变得不稳定或达到了自然的停止点时,它才会返回服务器。

研究人员通过在各种自然语言任务(如理解情感或判断一个句子是否在逻辑上承接前文)上微调大语言模型,测试了这种方法。他们使用完全相同的设置和配置,将这种新的动态方法与标准的固定时间表算法进行了对比。结果显示,这种动态方法明显更加高效。平均而言,新方法达到与传统方法相同的准确度水平所需的通信轮数大约减少了一半。在某些情况下,就模型联系中央服务器的次数而言,它甚至快了近三倍。

除了速度之外,研究还表明,这种动态方法也更加可靠。传统的固定时间表方法有时无法收敛,这意味着如果训练步数没有经过完美调优,模型将永远无法达成理想的解决方案。相比之下,新方法即使在初始设置并非完美优化的情况下,也能始终找到一条通往高质量解决方案的稳定路径。在相同的轮数内,它实现的最终训练误差比传统方法低了五到十倍。至关重要的是,研究人员证明了该系统可以直接作为现有工具的替代品,而无需任何复杂的重新配置。它能够兼容专家为旧方法建立的设置,却能自动提供更卓越的性能。

这种改进的核心在于系统如何决定何时停止。该算法不再是猜测一个固定的步数,而是计算不同设备之间产生分歧程度的一种度量。如果各设备都在朝着相似的方向学习,系统就知道可以继续进行。如果它们开始发生漂移,系统就会介入并在模型迷失方向之前收集更新。这种自适应策略消除了人类专家需要为每个新任务不断猜测正确训练步数的必要性。研究人员发现,通过允许模型在稳定期间进行更长时间的训练,他们可以大幅减少系统暂停和通信的次数,从而有效地解决了长期阻碍大型人工智能模型在私密数据上进行训练的通信瓶颈问题。

这项研究证实,这种动态调度不仅是一个理论上的可能性,更是一个可以立即部署的实际解决方案。研究人员展示了,即使在现有算法获得最有利设置的情况下,他们的方法依然表现优于这些算法。这表明,目前许多联邦学习系统中使用的僵化、固定间隔已不再必要。通过让训练过程决定自己的节奏,这种新方法释放了庞大且此前难以获取的数据源的潜力,使得构建尊重用户隐私的智能系统变得更快、更可靠。这项工作为提高现代机器学习库的效率提供了一条清晰的路径,它提供了一个无需额外调优却能带来显著更好结果的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →