Adaptive Heterogeneous Compression for Resource-Efficient Federated Knowledge Distillation
本文提出了 ASCEND,一种用于联邦知识蒸馏的自适应异构压缩框架,该框架将策略选择建模为一个非平稳多臂老虎机问题,旨在动态优化不同客户端资源下的通信效率与训练时间,同时保持模型精度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,我们的手机和传感器不断产生数据,从健康指标到日常生活的照片。一种被称为联邦学习(federated learning)的强大理念让这些设备能够共同学习,以构建更智能的人工智能,而无需将私密数据发送到中央服务器。相反,设备会在本地训练自己的小型模型,并且只分享它们学到的数学经验。然而,这一过程面临着一个重大障碍:设备并不尽相同。有些是功能强大的智能手机,而另一些则是内存有限、网速缓慢的微型电池供电传感器。此外,它们运行的模型往往具有不同的形状和规模,以适应其特定的硬件。当这些各异的设备试图共同学习时,频繁的信息交换可能会阻塞网络,导致速度变慢甚至导致学习失败。
研究人员开发了一种名为联邦知识蒸馏(federated knowledge distillation)的方法,以帮助这些不匹配的设备进行协作。这种方法不再试图强迫每个设备使用完全相同的模型,而是让它们分享所学知识的“本质”,使得一个小型的传感器即使在内部结构不同时,也能向功能强大的手机学习。然而,一个新的问题出现了:即使有了这种更智能的共享方法,设备仍然需要来回发送大量的数学数据,这在网络边缘会消耗过多的时间和能量。传统的解决方案是对这些数据进行压缩,但现有的方法对所有设备一视同仁,忽略了适用于快速计算机的策略可能会让缓慢的设备不堪重负。
为了解决这个问题,由广东工业大学和重庆邮电大学的刘晨旺及其同事领导的研究团队提出了一种新系统,让每个设备都能选择自己的压缩策略。他们创建了一个框架,使设备可以从一组不同的数据缩减方式中进行选择,例如仅保留最重要的数值、随机挑选数值,或按照设定的模式轮转数据。挑战在于如何确定在任何给定时刻哪种方法最适合哪个设备,因为随着训练的推进和网络状况的变化,最佳选择也会随之改变。
研究人员将这个选择过程比作一场概率游戏,玩家必须决定拉动哪一个杠杆以获得最佳回报。在他们的系统中,每种压缩方法都是一个杠杆,而回报是一个平衡了模型改进程度与耗时程度的分数。他们开发了一种名为 ASCEND 的算法,允许每个设备从自身的经验中学习。起初,设备会尝试不同的方法以观察效果。随着时间的推移,它们开始倾向于那些针对其特定硬件和当前网络速度能带来最佳结果的方法。如果一个设备注意到其学习进程突然倒退或变得不稳定,系统拥有一种安全机制,能立即恢复到稳定且保守的设置,以防止出错。
该团队在一个真实的平台上测试了这种方法,该平台使用十台树莓派设备作为边缘客户端,并在 MNIST 和 CIFAR-10 等标准图像数据集的模拟实验中进行了测试。他们发现,他们的自适应系统始终优于那些强迫所有设备使用相同压缩规则的方法。在设备计算能力不同或连接到不同速度网络的场景下,ASCEND 成功实现了自适应。例如,在较小、较简单的模型上,设备倾向于选择保留最显著数据点的策略;而在处理更大、更复杂的模型时,它们通常会切换到一种计算速度更快、即便精度略低的方法。结果表明,这种灵活的方法降低了训练模型的总时长,减轻了通信负担,且没有牺牲人工智能的最终准确性。
这项研究证实,在联邦网络中,不存在一种适用于所有设备的“最佳”数据压缩方式。相反,最优策略取决于设备硬件、运行模型大小以及当前训练状态的具体组合。通过允许每个参与者动态地选择自己的路径,该系统实现了一种刚性的“一刀切”方案无法比拟的速度与智能之间的平衡。这项工作表明,分布式学习的未来不在于强求统一,而在于构建足够聪明、能够适应每个参与设备独特约束的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。