← 最新论文
💻 computer science

Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning

本文提出 FedDTL,这是一种面向视觉 - 语言模型的新型联邦学习框架,该框架通过解耦图像与文本编码器以确保全局更新的一致性,并采用结合监督学习与强化学习的两阶段本地微调策略,从而在异构数据分布下有效平衡全局任务适应性与泛化能力。

原作者: Yuting Ma, Lechao Cheng, Xiaohua Xu

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuting Ma, Lechao Cheng, Xiaohua Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一群朋友试图共同学习一项新技能,比如识别不同种类的鸟类,但他们住在不同的城市,无法共享各自的私人相册。这就是联邦学习的核心理念:每个人都在自己的设备上本地学习,仅分享所学内容,而非原始数据。

现在,想象这些朋友正在使用一个超智能的、预训练好的“鸟类专家”(即视觉 - 语言模型)来协助他们。问题在于,如果每个人只研究自己的本地照片,然后试图平均他们的笔记,情况就会变得混乱。有些朋友可能会过于痴迷于自家后院里的特定鸟类(过度专业化),而另一些朋友则可能学会完全不同的鸟类描述方式,导致无法将他们的知识整合成一份有用的指南(不一致性)。

本文介绍了一种名为FedDTL的新方法来解决这一问题。以下是其工作原理,分解为简单的概念:

1. “拆分团队”策略(解耦训练)

在大多数方法中,每个朋友都试图独自学习如何观察鸟类(图像编码器)以及如何用文字描述它们(文本编码器)。这会导致混乱,因为每个人的描述都会逐渐偏离。

FedDTL将任务拆分:

  • 本地艺术家(客户端): 每位朋友保留自己的相机和相册。他们在本地训练自己的“图像编码器”,以识别自己照片中的鸟类。这确保了他们的私人照片安全。
  • 中央图书管理员(服务器): 中央服务器负责训练“文本编码器”。服务器不看照片,而是学习鸟类的名称(例如,“红衣主教”、“蓝松鸦”)。
  • 连接机制: 朋友们将他们的“视觉理解”发送给服务器,服务器则回传“文字定义”。这就像朋友们将素描发送给图书管理员,而图书管理员则回传正确的字典定义。这确保了每个人使用相同的“语言”来描述所见之物,使团队保持一致,同时无人能看到彼此的私人照片。

2. “两步舞”(两阶段本地微调)

即使有了拆分团队,如果一位朋友在本地照片上钻研过久,他们可能会开始死记硬背自家花园的特定光线或背景,从而忘记如何在不同场景中识别鸟类。这被称为“过度专业化”。

FedDTL 通过为每位朋友设计一个两步训练过程来解决这个问题:

  • 第一步:热身(监督微调 - SFT):
    首先,朋友进行一次快速、标准的课程。他们查看自己的照片,学习将其与中央图书管理员提供的鸟类名称进行匹配。这使他们能够快速、可靠地跟上进度。这就像背诵闪示卡片。

  • 第二步:强化助推(强化学习 - RL):
    热身之后,朋友切换到“试错”模式。他们不再仅仅是死记硬背,而是因通用性而非特异性而获得奖励。

    • 类比: 想象这位朋友在玩一个猜鸟类的游戏。如果猜对了,他们就能得分。但这里有个转折:即使照片有点模糊或角度奇怪,只要他们能猜对,就会受到鼓励。
    • 本文使用了一种名为GRPO(组相对策略优化)的技术。这就像一群朋友同时猜测同一种鸟类。如果一位朋友猜对了,而其他人猜错了,这位朋友就会因更具通用性而获得“奖励”。这阻止了他们仅仅死记硬背本地照片的确切像素,迫使他们学习鸟类的真正本质,从而使他们更擅长识别从未见过的鸟类。

为什么这很重要?

以前的方法试图通过添加复杂规则或简单地平均所有人的笔记来解决这些问题。但在“全数据”设置中(即朋友们拥有大量照片,而不仅仅是几张),这些旧方法失败了。它们要么导致团队过于不一致,要么导致个人过于痴迷于自己的数据。

FedDTL声称是首个成功同时平衡以下两点的方案:

  1. 全局适应: 团队共同很好地学习任务(每个人都对什么是“红衣主教”达成一致)。
  2. 泛化能力: 团队仍然能够识别新环境中从未见过的鸟类(而不仅仅是他们训练过的特定后院照片)。

结果

作者在各种困难条件下(例如,某些朋友拥有的数据类型与其他人截然不同)在多个数据集(如识别花卉、宠物和食物)上测试了该方法。他们发现,FedDTL 始终优于其他方法,尤其是在需要处理大量数据时。它成功地在保持团队统一的同时,确保没有任何一位朋友对自己的本地数据变得过于“固执”。

简而言之,FedDTL 是一种更智能的分布式群体协同学习方式:它将“观察”与“命名”分离以保持团队一致,并采用两步训练过程,确保他们学习的是游戏的通用规则,而不仅仅是自家后院的具体细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →