✨ 要点🔬 技术摘要
想象一下,你正在尝试教导来自不同医院的一组医生如何诊断一种复杂疾病。每位医生都见过不同的患者,并了解不同的症状(概念)。然而,存在两个重大问题:
隐私 :他们无法彼此共享患者病历。
知识不完整 :没有一位医生知晓所有 症状。一位可能了解“发热”,另一位了解“皮疹”,第三位则了解“咳嗽”。
通常,要构建一个能够解释其诊断原因的智能人工智能(即“可解释”模型),你需要一份包含所有可能症状及其相互关系的庞大清单。但获取这份清单成本高昂,且很难在单一医院中找到。
本文介绍了一种名为**基于联邦概念的模型(F-CMs)**的新方法。可以将其视为一种“智能协作”,它能在无人查看原始患者数据的情况下,解决隐私和知识缺口问题。
以下是其工作原理,使用一个简单的类比:
问题:“固定蓝图”陷阱
想象医生们正在尝试构建一台用于诊断患者的巨型共享机器。
旧方法(标准联邦学习) :他们在开始前就为机器商定了一份固定蓝图 。如果后来加入了一位了解蓝图中未包含症状(如“淋巴结肿大”)的新医生,这台机器就无法学习该症状。这就像试图在一座按照僵化且不可更改的平面图建造的房屋上,强行添加一个新房间。
问题所在 :在现实世界中,医生(客户端)会加入和离开,并且他们会随时间发现新的症状。固定蓝图在此情况下会失效。
解决方案:“乐高”机器(F-CMs)
作者提出了一种像乐高积木 一样构建的机器。与其使用固定蓝图,不如将机器由可互换的模块组成,其中每个积木代表一种特定的症状(概念)或最终诊断。
每当有新医生加入时,系统会采取以下三个“魔法”步骤:
1. “共识地图”(图聚合)
每位医生都会绘制一张关于他们所了解的症状之间如何相互关联的粗略草图。由于他们只见过少数患者,有些草图可能杂乱无章或存在错误。
发生的情况 :中央服务器(“团队领导”)收集所有这些草图。它不是挑选其中一张,而是寻找最常见的连接。如果 10 位医生中有 9 位说“发热导致皮疹”,服务器就会画出这条线。如果一位医生说“发热导致下雨”,由于无人附和,服务器会忽略它。
结果 :基于所有人的部分知识,构建出一张单一、高质量的“主地图”,展示症状之间的连接方式。
2. “模块化扩展”(动态架构适应)
这是本文最大的创新。
场景 :一位新医生加入,他了解一种其他人都不知道的名为“淋巴结肿大”的症状。
旧方法 :你必须拆毁整台机器并从头重建,才能添加这个新部件。这既缓慢,又浪费了你已经学到的所有知识。
F-CM 方法 :系统查看主地图,发现新的“淋巴结肿大”积木,然后将一个新的乐高积木扣在机器上 。它只为该新症状构建所需的特定部分。机器的其余部分(用于“发热”和“皮疹”的部分)保持原样,保留了之前所有的学习成果。
优势 :机器能够有机生长,无需完全重启。
3. “专业化训练”(模块特定优化)
现在,医生们开始训练这台机器。
规则 :医生只能接触他们理解的乐高积木。如果一位医生了解“发热”但不了解“淋巴结肿大”,他只能更新“发热”积木。对于该医生而言,“淋巴结肿大”积木保持冻结(不变)状态。
结果 :服务器仅收集被触碰积木的更新。它对这些更新进行平均,使该特定积木变得更智能。这确保了医生不会意外“破坏”他们不理解的机器部分。
为何重要(结果)
作者在医学影像(如 X 光片)和模拟医学数据上测试了该方法。他们发现:
其准确度等同于拥有集中在一起的所有数据 :尽管数据是分散且私有的,但最终机器的表现与将所有数据汇集在一起时一样好。
它能处理新信息 :当携带新症状的新医生加入时,F-CM 系统能迅速适应并持续学习。而旧的“固定蓝图”系统则陷入停滞,表现不佳。
它高效 :因为它只更新需要更改的特定积木,所以与每次重建整个模型相比,它节省了巨大的计算资源。
它能处理“不可见”的概念 :即使某家医院从未见过某种特定症状,系统仍能对其做出预测,因为它从其他医院学到了该概念。
一句话总结
F-CMs 就像一个鲜活、呼吸着的专家团队 ,共同构建一个共享知识库。它不强迫大家在开始前就商定一个僵化的计划,而是允许计划不断演进。当拥有新想法的新专家加入时,系统只需将新部件添加到拼图中,同时保持旧部件完好无损,同时确保每个人的私有数据都锁在他们自己的保险箱中。
技术摘要:基于概念的联邦模型(F-CMs)
问题陈述
基于概念的模型(CMs)通过将预测建立在人类可理解的概念之上,增强了深度学习的可解释性。然而,由于单一数据源中概念标注的高成本和稀缺性,其实际部署受到阻碍。虽然联邦学习(FL)提供了一种在分布式数据所有者之间进行协作训练的范式,且无需共享原始数据,但现有的 FL 框架并不适合 CMs。标准的 FL 假设存在一个固定的、共享的模型架构,而 CMs 依赖于与特定概念集及其依赖关系明确绑定的架构。在具有统计异质性和时间非平稳性(例如客户端加入/离开或数据漂移)的现实 FL 设置中,可用概念集及其结构关系可能会演变。这造成了根本性的不匹配:标准 FL 无法适应新概念或依赖关系出现时所需的架构调整,从而导致可解释性丧失或需要进行代价高昂的全量重新训练。
方法论:基于概念的联邦模型(F-CMs)
作者提出了基于概念的联邦模型(F-CMs) ,这是一个旨在将 CMs 部署于演变的联邦环境中的框架。F-CMs 通过以下三个核心机制解决了静态 FL 假设与动态概念空间之间的不匹配:
图聚合: 服务器不假设预定义的全局结构,而是聚合客户端提供的结构信息(有向无环图或 DAG)。每个客户端 k k k 提交一个加权邻接矩阵 A ( k ) A^{(k)} A ( k ) ,表示其对监督变量之间边连接的局部置信度。服务器通过汇总这些置信度并应用最大共识规则来确定边的存在和方向,从而构建共享的全局 DAG G t G_t G t 。该过程能够处理嘈杂或冲突的局部结构,并确保全局模型反映联邦的集体知识。
动态架构适应: 共享的 CM 被分解为模块化组件:潜在编码器、特定概念编码器和任务解码器。随着新客户端的加入或数据分布的偏移,引入以前未见过的概念或依赖关系时,架构会进行模块化 适应:
扩展: 为新概念实例化新模块。
重连: 如果依赖关系发生变化(例如,出现新边 C i → C j C_i \to C_j C i → C j ),则更新相应模块的输入。
热启动: 保留未受影响模块的现有参数,而新参数则进行初始化(例如,零初始化或随机初始化)。这避免了全量重新训练并保留了先前学到的知识。
特定模块的优化与聚合: 为了处理部分监督(即客户端可能仅标注部分概念),F-CMs 采用掩码优化策略。在本地训练期间,客户端冻结其未监督的变量对应的模块。因此,仅生成针对监督组件的更新。服务器随后执行按模块聚合 ,仅针对为该变量提供监督的客户端子集,对每个特定模块的参数进行平均。这确保了全局模型能够整合异质监督,而无需强制客户端优化其无法观察到的概念。
主要贡献
本文介绍了 F-CMs,这是第一种通过在 FL 中调整模型结构而非假设固定架构来解决时间非平稳性下演变概念空间的方法。具体贡献如下:
新颖的方法论: 一种在现实联邦环境中部署基于概念架构的系统化方法,能够处理异质性的、部分的概念监督以及时序非平稳性。
架构灵活性: 超越了标准 FL 的固定架构假设,F-CMs 允许共享模型结构在训练过程中进行适应,从而实现了架构可解释性的融合。
隐私保护的知识共享: 通过在不共享原始数据的情况下跨实体聚合概念知识,减轻了各机构的标注负担。
实证验证: 使用四种不同的 CM 架构(CBM、CEM、CGM、C2BM)实现了 F-CMs,并在合成贝叶斯网络基准测试以及两个真实世界的医学影像数据集(SIIM-Pneumothorax 和 CheXpert)上进行了验证。
实验结果
作者将 F-CMs 与集中式上界、本地化训练、静态联邦变体(S-F-CMs)以及最先进的联邦概念学习基线(FedCBM、FCL)进行了评估。
准确率与覆盖率: F-CMs 实现了与具有全概念监督的集中式训练相当的任务准确率和概念覆盖率。相比之下,静态联邦基线和本地化模型的性能显著下降,且未能覆盖由后期加入的客户端引入的概念。
干预有效性: F-CMs 实现了对特定机构本地未标注概念的合理解释性推理和有效干预。当对真实概念进行干预时,F-CMs 保持了高标签准确率,这表明模型成功利用了聚合监督来推理其在本地训练期间未直接观察到的概念。
非平稳性下的效率: 在新客户端引入未见概念的场景中,F-CMs 比静态基线收敛得更快且损失更低。至关重要的是,与全量重新训练基线(S-F-CMs Reinit)需要更新 100% 的参数相比,F-CMs 仅需更新一小部分参数(根据设置不同为 8%–61%),展示了极高的适应效率。
鲁棒性: 该框架表现出对客户端间语义分歧和图扰动(客户端提供的 DAG 中的噪声)的鲁棒性。所提出的图聚合策略有效地去除了不一致的局部提议中的噪声。
多模态扩展: 概念验证扩展表明,F-CMs 能够处理异质输入模态(例如图像和文本),同时共享共同的概念语义空间。
意义与主张
本文主张,F-CMs 代表了在遵守数据隐私、标注稀缺和动态部署环境等现实世界约束的同时,扩展可解释模型的重要一步。通过弥合标准 FL 的静态性质与 CMs 的结构需求之间的差距,F-CMs 实现了:
对未见概念的可解释推理: 能够对特定客户端未标注的概念进行可解释的预测,这是现有静态联邦方法所不具备的能力。
可持续的联邦增长: 一种机制,能够在不丢弃先前学到的知识或承担全量重新训练的计算成本的情况下,整合新的数据源和监督类型。
隐私保护的可解释性: 一条跨机构聚合高层语义知识的途径,减少了对昂贵、集中式概念标注工作的需求。
作者承认了局限性,指出当前的 CM 架构最初并非为演变空间而设计,未来的工作可以专注于开发具有更高模块性的、感知联邦的 CMs。他们还强调,需要进一步分析针对基于概念的联邦模型特定潜在攻击面的隐私问题。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。