想象一群学生(即“客户端”)试图共同学习一门学科,但由于隐私规定,他们无法共享个人笔记。相反,他们各自研读自己的笔记,写下所学内容的摘要,并仅将这些摘要发送给一位老师(即“服务器”)。老师将所有摘要整合,为所有人创建一本单一且更优质的教科书。这就是联邦学习。
问题在于,并非所有学生都拥有相同类型的笔记。有些可能从教科书学习,有些从漫画书学习,还有些的页面可能缺失或用不同语言书写。通常这并无大碍;老师可以融合这些不同的视角。但有时,某位学生可能感到困惑、笔记损坏,或试图传授完全错误的知识。如果老师盲目地将这种“糟糕”的摘要与优质摘要混合,最终的教科书就会变得令人困惑或毫无用处。
本文提出了一种新方法,使老师能够在不阅读学生私人笔记或逐页比较其完整笔记的情况下,识别出哪位学生发送了“异常”摘要。
旧方法与新方法
旧方法(比较参数):
传统上,老师通过比较摘要内部的具体数值和权重,来检查某位学生的摘要是否与其他学生相似。这就像检查两位学生是否写出了完全相同的句子结构。问题在于,两位学生可能写出截然不同的句子,却表达相同的意思;或者写出相似的句子,却表达截然不同的含义。很难判断这种差异仅仅是风格不同,还是根本性的错误。
新方法(“房间布局”类比):
作者建议关注学习的结构,而非具体数值。
想象学生的大脑是一座巨大的多房间房屋。
- 输入空间:这是前门,问题(数据)由此进入。
- 房间:随着问题穿过房屋,它会经过不同的房间(神经网络的层)。
- 开关:在每个房间内,都有电灯开关。根据问题的不同,某些开关处于“开”状态,某些处于“关”状态。这种开/关开关的模式形成了该房屋处理特定问题的具体“布局”或地图。
作者的方法运作如下:
- 探测集:老师给每位学生提供同一份小型、标准的 128 道练习题清单(即“探测集”)。
- 绘制房屋地图:老师观察每位学生的“房屋”在回答这些问题时如何被激活。哪些开关是开启的?哪些房间是活跃的?
- 比较:老师将某位特定学生的“房屋布局”与群体的平均“房屋布局”进行比较。
- 如果学生 A 的房屋布局与群体相似,那么他就是正常的,即使其具体笔记看起来不同。
- 如果学生 B 的房屋布局完全不同(例如,厨房位于本应是卧室的位置),那么他就是异常的。
他们的发现
研究人员在两个不同的“教室”(数据集)中测试了这一想法:一个是服装图片集,另一个是动物图片集。
- 检测自然差异:当学生们的笔记自然不同(例如,有些包含更多猫的图片,有些包含更多狗的图片)时,“房屋布局”略有不同但保持稳定。老师可以识别出他们只是存在差异,而非损坏。
- 检测“坏”学生:研究人员随后秘密给一位学生提供了一本损坏的笔记本(充满噪声或模糊图像)。
- 这位学生的“房屋布局”变得混乱,与所有人的布局截然不同。
- 老师使用一个简单的数学技巧(即"Z 分数”,类似于一个“怪异度计”)来标记这位学生。对于坏学生,该计数的读数飙升,而对于其他人则保持平稳。
为何这很重要
主要结论是,这种方法既轻量又可解释。
- 轻量:它不需要繁重的计算或复杂的密码学。它只需检查一小份问题清单上的“开关模式”。
- 可解释:它能告诉老师为何标记某位学生:“你的大脑组织信息的方式与群体不同”,而不仅仅是说“你的数值不匹配”。
简而言之,本文赋予联邦学习一种新工具,用于识别那些真正困惑或行为异常的学生,确保最终的群体教科书保持可靠,即使所有人都是从不同来源学习。
技术摘要:通过表示层发散检测联邦学习中的异常客户端
问题陈述
联邦学习(FL)能够在不共享原始数据的情况下实现跨分布式客户端的协作模型训练,从而解决隐私和安全约束问题。然而,由于数据异质性(非独立同分布分布),联邦学习面临重大挑战,这通常导致收敛不稳定和全局性能下降。除了良性的统计异质性外,实际部署还面临风险,即客户端更新可能因分布偏移、传感器漂移或异常输入而偏离。
当前检测此类偏差的方法通常依赖于比较模型参数或梯度。作者认为,这些方法在揭示不同客户端如何影响神经网络(NN)的内部功能行为和决策边界方面提供的见解有限。需要一种机制来区分由非独立同分布数据引起的预期变异性与可能破坏聚合过程稳定性或可信度的潜在有害偏差。
方法论
本文提出了一种轻量级的几何度量,用于量化客户端本地模型与全局模型之间的功能发散。该方法不分析参数,而是专注于由激活诱导的输入空间划分。
激活模式与输入空间划分:
- 对于基于 ReLU 的前馈神经网络(FF),作者为每一层 l 定义了二元激活模式 al(x;θ)。
- 这些模式将输入空间划分为分段仿射区域。共享相同激活模式的样本属于同一区域。
- 作者利用一个固定的、共享的探测集 P(数据的独立同分布子集)来评估这些模式。
激活亲和度度量:
- 对于给定层 l,两个探测样本 xi 和 xj 之间的激活亲和度 Klθ(i,j) 是根据其激活模式之间的汉明距离计算的。
- 该度量量化了样本在跨越超平面数量意义上的“距离”。高亲和度表示样本位于相同或邻近区域;低亲和度表示被多个超平面分隔。
- 这生成了一个亲和度矩阵 Klθ,捕捉模型如何对输入进行分组。
分层几何发散:
- 为了比较客户端模型(θc)与全局模型(θg),作者计算它们亲和度矩阵之差的弗罗贝尼乌斯范数:dl(θ,θ′)=∥Klθ−Klθ′∥F。
- 定义了一个分层发散(Dhier)以考虑神经网络的层次结构。由于早期层定义粗略分离,而更深层对其进行细化,因此早期层的差异被赋予更高的权重。
- 公式如下:
Dhier(θ,θ′)=d1(θ,θ′)+l=2∑L(r=1∏l−1λr)dl(θ,θ′)
其中 λl=exp(−βdl) 作为更深层的下调因子,前提是早期层已表现出显著差异。
异常检测:
- 在联邦学习设置中,在轮次 t 为每个客户端 c 计算发散度 Dc(t)。
- 为了识别异常客户端,使用所有客户端发散度分布的中位数和中位数绝对偏差(MAD)计算鲁棒的离群值分数(z-score)。
主要贡献
- 几何视角: 引入了一种基于神经网络激活模式诱导的几何结构而非参数值来分析联邦学习客户端行为的新视角。
- 轻量级度量: 提出了一种通过测量本地训练如何改变输入空间的组织来量化功能发散的度量,捕捉了超越参数级比较的差异。
- 可解释信号: 证明了该度量提供了用于监控数据异质性和识别异常客户端贡献的可解释信号。
实验结果
作者在两个场景下评估了该度量:在 Fashion-MNIST 上使用多层感知机(MLP),以及在 CIFAR-10 上使用 ResNet-18,采用带有狄利克雷划分的随机梯度下降(SGD)来模拟非独立同分布数据。
度量验证(异质性分析):
- 实验改变了狄利克雷参数 α(从接近独立同分布的 α=10 到高度异质的 α=0.1)。
- 结果: 在接近独立同分布的设置中(α=10),客户端发散度迅速稳定。在高度异质的设置中(α=0.1),该度量捕捉到了发散度的系统性增加,并识别出持续偏离全局模型的客户端,这与“不同的数据分布诱导不同的几何组织”这一直觉相一致。
异常客户端识别:
- 通过对一个客户端的数据集应用扰动(高斯噪声、旋转、模糊)而其他客户端保持标准,模拟了一个“偏移”客户端。
- 结果: 与所有轮次中的常规客户端相比,偏移客户端始终表现出显著更高的几何发散度和鲁棒的 z-score。虽然常规客户端收敛到稳定的发散值,但偏移客户端保持了持续的偏离,表明其输入空间的几何组织根本不同。这在两种架构和数据集上均成立。
意义与主张
本文主张,监控神经网络诱导的几何结构为评估联邦学习中的客户端贡献提供了有意义且可解释的信号。所提出的度量有效地区分了稳定的异质客户端与那些其更新引起异常功能变化的客户端。
作者将这项工作定位为风险感知聚合策略的工具。通过识别功能上(而不仅仅是参数上)偏离的客户端,系统可以根据其功能行为对更新进行加权或过滤。文章结论指出,这种方法为更明智的聚合打开了大门,但同时也指出,未来工作需要将此信号直接集成到训练循环中,并将其应用于大规模或对抗性环境。该工作被呈现为对现有加密隐私和拜占庭鲁棒性方法的补充,提供了一种几何监控信号而非正式的加密保证。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。