COSMOS: Model-Agnostic Personalized Federated Learning with Clustered Server Models and Pseudo-Label-Only Communication
COSMOS 是一种模型无关的个性化联邦学习框架,它通过基于伪标签预测对客户端进行聚类、训练特定于聚类的服务器模型并将其蒸馏回客户端,从而解决架构和统计异质性,实现指数级个性化风险收缩并超越现有基线获得更优性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一场规模宏大的全球烹饪大赛,成千上万名厨师(即客户端)正试图学习如何制作完美的菜肴。然而,这里有一个棘手的问题:
- 不同的厨房:每位厨师的厨房配置截然不同。有的拥有高科技烤箱,有的使用柴火灶,还有的仅有一台微波炉。由于隐私规定或商业机密,他们无法分享实际的食谱或食材。
- 不同的口味:东京的厨师 A 能获得的食材,与纽约的厨师 B 能获得的食材完全不同。
- 目标:每个人都希望互相学习以提升技艺,但由于厨房差异过大无法直接比较,他们不能将实际的食谱(模型参数)发送给中央裁判。
这正是联邦学习试图解决的问题。大多数现有方法在此处失效,因为它们假设所有人拥有相同类型的厨房,或者能够共享他们的食谱步骤。
接下来登场的是COSMOS,这是本文提出的新框架。可以将 COSMOS 想象为一位才华横溢、超级聪明的总裁判,他运用一个巧妙的策略来主持这场比赛。
COSMOS 如何运作:“试吃”策略
总裁判并不要求厨师们发送他们的秘密食谱,而是使用一份共享的空白试吃菜单(一个公开的、未标记的数据集)。具体步骤如下:
1. 本地练习(客户端训练)
每位厨师在自己的私有食材上进行练习。他们烹饪几道菜,然后尝试根据共享试吃菜单来烹饪一道菜。他们不发送食物,只是写下他们认为这道菜应该是什么味道(即“伪标签”)。
- 类比:厨师 A 看着一张汉堡的图片,写道:“这应该尝起来像多汁的牛肉饼加奶酪。”
2. 分组(聚类)
总裁判收集所有这些口味描述。裁判不看食谱,而是查看这些描述。
- “嘿,厨师 A、厨师 B 和厨师 C 都将汉堡描述为‘多汁的牛肉加奶酪’。”
- “但厨师 D 说它应该是‘辣味鸡肉加芒果’。”
总裁判将口味相似的厨师归入群组。这一过程是自动进行的;裁判无需事先知道有多少个群组。
3. 主厨(服务器训练)
对于每个群组,总裁判创建一位主厨(一个专门的服务器模型)。这位主厨是专门根据该群组combined的“口味描述”进行训练的。
- 类比:裁判为群组 1 创建一位“多汁牛肉”主厨,为群组 2 创建一位“辣味鸡肉”主厨。这些主厨之所以强大,是因为他们掌握了整个群组的集体智慧,但他们只了解该群组特定的风格。
4. 反馈循环(蒸馏)
总裁判将“主厨” refined 后的口味描述发回给各位厨师。厨师们随后利用这些 refined 的描述来调整自己的本地烹饪。
- 类比:厨师 A 收到“多汁牛肉”主厨的一张便条,上面写着:“实际上,加一撮盐。”厨师 A 根据这条建议更新了自己的烹饪风格。
为什么这很重要?
本文声称取得了三大突破:
- 拒绝“一刀切”:与以往的方法不同,COSMOS 不在乎厨师 A 用的是微波炉而厨师 B 用的是柴火灶。他们可以使用任何“厨房”(模型架构)。他们只需要能够描述食物的味道即可。
- 巨大的效率:发送完整食谱(模型参数)就像邮寄一个沉重的箱子。而发送口味描述(伪标签)则像寄一张明信片。本文表明,这将通过网络传输的数据量减少了10 到 100 倍,使其更快、更经济。
- 更快变聪明(数学部分):作者从数学上证明,这一过程不仅仅是缓慢改进,而是产生了一种“滚雪球效应”。每当厨师们从他们群组的主厨那里获得反馈时,他们犯错的概率就会指数级下降。这就像以前那样从“猜测”转变为“知晓”,速度要快得多。
总结
COSMOS 是一种让多样化的人群(或计算机)共同学习的方法,无需泄露秘密,也无需使用相同的工具。通过使用共享的“试吃菜单”,并根据观点而非工具对人员进行分组,它为每种类型的学习者创建了专门的专家,同时仅需极少量的数据往返传输。
本文在图像识别任务(如识别猫、狗和汽车)上测试了该方法,发现即使参与者的计算机模型和数据差异很大,COSMOS 的表现也始终优于其他方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。