← 最新论文
🤖 machine learning

FedCC: Towards Addressing Label Distribution Skews in Distillation-Based Federated Learning

该论文提出了 FedCC,一种基于蒸馏的联邦学习算法,通过允许客户端将模糊样本标记为“未知”并利用校准后的伪标签来缓解标签分布倾斜问题,从而在存在严重数据异构性的场景中显著优于现有方法。

原作者: Wenxuan Ye, Onur Ayan, Xueli An, Georg Carle

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenxuan Ye, Onur Ayan, Xueli An, Georg Carle

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代通信那广阔且互联的网络中,一场关于计算机如何学习的静默革命正在悄然发生。传统上,人工智能系统的训练是通过将海量数据汇集到单一的中心位置,由算法研究数百万个示例以寻找模式。然而,这种方法引发了对隐私和安全的严重担忧,因为它需要将敏感的个人信息从手机、医疗设备和私人服务器转移到中央枢纽。为了解决这个问题,研究人员开发了一种称为“联邦学习”(federated learning)的方法,它允许许多不同的设备在从不共享原始数据的情况下共同学习。设备发送的不是数据本身,而是它们学到的教训——即描述它们所见内容的数学更新。这在保持个人信息本地化的同时,仍能让一种全球性的智能从集体努力中涌现。

然而,这一协作过程面临着一个顽固的障碍:每个设备上的数据很少是平衡的。一个人的手机可能充满了猫的照片,而另一个人的手机则可能只包含汽车的图像。当这些设备试图教导一个共享模型时,那些拥有某些类别丰富数据的设备往往会主导对话,迫使模型成为这些特定领域的专家,同时忽略那些稀有或缺失的类别。这种不平衡造成了盲点,导致系统会对它从未见过的事物做出自信但错误的猜测。当设备尝试从一组共享的无标签图像(没有识别标签的图片)中学习时,情况会更加复杂,而这通常是保护隐私所必需的。由于不知道这些共享图像的真实答案,中央服务器难以纠正由个体设备引入的偏差,从而导致全球模型出现倾斜且不可靠。

一个研究团队提出了一种解决此问题的新方法,引入了一个他们称之为 FedCC 的系统。他们的工作专注于一种特定类型的协作学习,即设备分享它们的预测而非其内部设置。在这种设置下,每个设备观察一组公共的无标签图像,并返回一个概率列表,表明它认为每张图像是什么。问题在于,如果一个设备只见过几种类型的图像,却被迫对所有图像进行猜测,那么问题就产生了。如果一个设备只见过狗的照片,它会自信地将一只猫误认为是狗;如果许多设备都这样做,中央服务器就会将这些错误聚合为一个单一的、有缺陷的结论。研究人员意识到,解决方案不是强迫每个设备做出猜测,而是允许它们在不确定时承认自己的无知。

FedCC 的核心创新是引入了一个“未知”(unknown)类别。在传统系统中,即使面对从未遇到过的图像,设备也必须选择一个已知的类别,例如“狗”、“猫”或“车”。FedCC 改变了规则,允许设备将令人困惑或陌生的图像标记为“未知”。这个简单的添加起到了安全阀的作用。当设备遇到超出其有限经验范围的图像时,它可以将该图像归入这个新的、通用的类别中,而不是强行给出一个错误的答案。通过承认自己不知道什么,设备可以保护群体免受其狭隘视角误导。

为了实现这一目标,研究人员设计了一个流程:设备首先从自己的私有数据中学习,然后使用一组共享的无标签图像来完善理解。在此精炼过程中,系统会计算设备对其预测的信心程度。如果设备非常有信心,它就会分享其猜测;如果它不确定,系统则会大量依赖“未知”类别。这种不确定性并不被视为失败,而被视为一种宝贵的信号。中央服务器随后结合所有设备的预测,给予那些有信心的设备更多权重,而给予那些不确定的设备较少权重。至关重要的是,服务器在创建最终的全球教训时会过滤掉“未知”标签,确保共享的知识仅建立在可靠且达成共识的信息之上。这种方法使得系统即使在数据高度倾斜(即某些设备对某些类别的资料极少)的情况下也能有效地学习。

研究人员在几个标准的图像数据集(包括日常物品和动物的集合)上测试了这种方法,并在数据分布非常不均的情况下进行了测试。在最极端的测试中,他们模拟了一个场景:十个设备中的每一个都只持有十个可能类别中的一个类别。在这种严苛的环境下,现有方法崩溃了,其准确率降至接近随机猜测的水平,通常低于 12%。相比之下,FedCC 系统保持了 67.3% 的稳健准确率。这一结果表明,通过允许设备从强制性错误中退后一步,整个系统变得更加准确。随着数据变得更加不平衡,FedCC 与其他方法的差距变得越来越大,证明了该方法在挑战最大时尤其有效。

除了提高最终的全球模型外,研究还表明这种方法也有助于单个设备。通过学会识别自身的局限性并将不确定的样本标记为“未知”,设备能够更好地识别它们本应学习的稀有类别。该系统实际上起到了正则化器的作用,防止模型在熟悉的类别上过于自信,从而忽略了它们不熟悉的类别。数据的视觉分析显示,使用 FedCC 训练的模型能够保持不同类别清晰且分离,而其他方法则倾向于将它们模糊在一起。这种清晰度表明,“未知”类别作为一个缓冲器,吸收了通常会破坏协作学习的噪声和混乱。

研究结果表明,在一个数据多样且碎片化的世界中,承认无知是一种强大的学习工具。通过将目标从强制预测转向允许不确定性,FedCC 提供了一种简单且有效的方法,用于构建更可靠、更公平的人工智能系统。该方法不需要复杂的全新基础设施或共享私有数据;它仅仅改变了设备沟通其信心的方式。随着设备网络不断扩大,且其持有的数据变得日益多样化,能够处理这些不平衡且不牺牲隐私的技术将变得至关重要。FedCC 提供了一条清晰的前行之路,表明有时最好的学习方式就是知道何时说:“我不知道。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →