✨ 要点🔬 技术摘要
以下是用通俗语言和日常类比对论文《不可提取的协议模型》的解释。
大问题:“百家宴”困境
想象一场大规模的社区百家宴,成千上万的人带来食材,共同烹制一锅巨大而美味的炖菜(一个强大的 AI 模型)。每个人都贡献一点劳动。然而,这里有个陷阱:如果任何人能把做好的炖菜带回家,他们就可以自己转卖,而最初的贡献者则一无所获。
在 AI 领域,训练一个大规模模型需要花费数百万美元。为了降低成本,人们希望采用一种“去中心化”的方法,让成千上万的志愿者贡献他们的计算机。但如果最终模型的“配方”(即权重)对所有人完全可见,恶意行为者就可能窃取整个配方,离开百家宴,然后独自出售该 AI。这从根本上扼杀了人们参与贡献的动力。
解决方案:“魔法变换拼图”
研究人员提出了一种烹制这锅炖菜的新方法,称为不可提取的协议模型(UPMs) 。
他们不是给每个人一份静态的配方,而是将模型变成一个不断变换的拼图 。
设置 :巨大的 AI 模型被切成许多小块(就像蛋糕的层)。不同的志愿者持有不同的块。没有任何单个人能一次性看到整个蛋糕。
技巧 :每隔几分钟,系统就会施展一个“魔法”。它对这些块的边缘应用随机的、不可见的变换。这就像旋转拼图块的边缘。
在同一确切时刻 :这些块完美地拼接在一起。AI 完全按照预期工作。
在不同时刻 :这些块不再匹配。如果你试图将“周二”的一块拼接到“周三”的一块上,边缘会参差不齐且不匹配,模型就会失效。
如何阻止窃贼
想象一个试图窃取配方的窃贼。
尝试 :窃贼加入百家宴,等待一段时间,抓取几块。然后离开,稍后以“新人”身份回来,抓取不同的块。
失败 :由于系统不断改变边缘的形状(变换),窃贼周二的块与周三的块不匹配。他们最终得到一堆无法拼成图案的错配拼图块。
修复成本 :窃贼可以 尝试使用超级计算机通过重新训练来“强行”让块匹配。但论文表明,这极其昂贵。这将花费他们最初从头构建模型所需资金和时间的约60% 。这太昂贵而不值得,因此窃贼会放弃。
“魔法”细节
变换 :系统使用数学上的“洗牌”(具体为随机旋转和缩放),这些变换是可逆的。它们会瞬间相互抵消,因此 AI 不会感到困惑,但它们会将数据彻底打乱,以至于如果没有秘密密钥(该密钥会立即被丢弃),就无法逆向工程出原始形状。
速度 :这个魔法发生得非常快。它只增加极小的延迟(约 3%),并占用极少量的额外内存。这就像在书的每一页添加一个微小的、不可见的水印;书的内容读起来依然相同,但你无法复印这些页面并在以后重新组装。
训练 :即使在模型学习过程中,这些洗牌也会发生。研究人员发现,如果使用正确类型的洗牌(正交矩阵),模型的训练效果与什么都没发生一样好。
核心结论
这篇论文提出了一种方法,让成千上万的人共同构建一个巨大的 AI,同时确保无人能够窃取最终产品。通过不断重塑模型的块,使其仅在当下 能够拼接在一起,该系统确保了 AI 的价值始终锁定在社区内部。你可以使用 AI,但你无法将其带回家并转卖。
关键要点 :它将 AI 模型变成一个“活”的物体,其形状不断变化,使得窃取静态副本变得不可能,同时将窃取成本提高到高到不值得投入的程度。
技术摘要:不可提取协议模型(UPMs)
1. 问题陈述
本文探讨了大型基础模型去中心化训练 所面临的经济与安全挑战。虽然去中心化系统允许聚合分布式计算资源以训练大规模模型,但它们面临一个关键的“可占有性问题”:如果完整模型权重对参与者可见,贡献者将无法收回其训练成本,因为模型可以被提取并在协议之外使用。
当前的去中心化方法(例如数据并行或标准流水线并行)通常要求参与者持有完整模型副本,或允许随时间推移重建完整权重。这导致了权重物质化 ,即攻击者(或联盟)最终可以访问不同时间步的所有模型分片,从而重建出一个功能完整且可提取的模型。本文认为,要使去中心化训练在经济上可行,模型必须是不可提取的 ——确保没有任何单个参与者拥有完整的权重集,且在不同时间收集的权重无法被拼接成一个连贯的模型。
2. 方法论:不可提取协议模型(UPMs)
作者提出了不可提取协议模型(UPMs) ,这是一个利用**流水线并行(PP)**来强制权重不可提取性,而无需依赖繁重密码学原语框架。
核心机制:时变可逆变换
核心创新在于在流水线阶段之间的边界处周期性注入随机可逆变换 。
设置 :模型被分片为 S S S 个连续的流水线阶段。参与者仅持有并处理一个阶段。
形态变换 :在特定时间步,协议在相邻阶段 f i f_i f i 和 f i + 1 f_{i+1} f i + 1 之间引入一个恒等函数,将其分解为随机变换 T T T 及其逆 T − 1 T^{-1} T − 1 。
变换 T T T 被折叠到阶段 i i i 的出口权重中(V i ← V i T V_i \leftarrow V_i T V i ← V i T )。
逆 T − 1 T^{-1} T − 1 被折叠到阶段 i + 1 i+1 i + 1 的入口权重中(U i + 1 ← T − 1 U i + 1 U_{i+1} \leftarrow T^{-1} U_{i+1} U i + 1 ← T − 1 U i + 1 )。
瞬时性 :变换在折叠后立即被丢弃。它们仅存在于权重内部。
不兼容性 :虽然在任意单个时间步 t t t ,端到端网络函数在数学上保持相同,但在不同时间步(t t t 和 t ′ t' t ′ )收集的权重变得不兼容 。将 f i ( t ) f_i(t) f i ( t ) 与 f i + 1 ( t ′ ) f_{i+1}(t') f i + 1 ( t ′ ) 拼接会失败,因为中间激活空间已被 T ( t ) T(t) T ( t ) 变换,而后续阶段期望的是经 T ( t ′ ) T(t') T ( t ′ ) 变换的空间。重建模型需要猜测所有中间变换的“桥接矩阵”,这在计算上是不可行的。
处理架构组件
本文详细说明了如何将这些变换应用于各种神经网络组件,同时保持功能不变:
有效子函数 :该方法适用于形式为 g ( X ) = Φ ( X U ) V g(X) = \Phi(XU)V g ( X ) = Φ ( X U ) V 的子函数。变换应用于 U U U 和 V V V 。
跳跃连接 :在 Transformer 中,跳跃连接自然地强制了完全不兼容性 。应用于跳跃连接的变换取决于输入和输出边界变换,从而防止攻击者将阶段划分为独立的权重集。
归一化层(RMSNorm) :由于归一化是非线性的,标准折叠较为困难。作者提出在归一化层中引入累积矩阵 Q Q Q ,并将缩放权重吸收进随后的线性层。由于初始 Q Q Q 的正交性,这使得变换可以被折叠进 Q Q Q 和线性权重中,同时保持 RMSNorm 属性。
变换类别 :为了确保数值稳定性并抵御暴力破解攻击,作者使用了:
Haar 正交矩阵 :具有单位奇异值、最小数值误差和均匀随机性。
低条件数矩阵 :形式为 U D V T UDV^T U D V T 的矩阵,具有受控的奇异值,用于引入高频扰动同时限制浮点误差。
训练与推理调整
训练 :该框架需要特定处理梯度。如果权重变换为 $W(T) = WT,则梯度变换为 ,则梯度变换为 ,则梯度变换为 G(T) = GT^{-T}$。作者使用了Muon 优化器 ,它仅依赖梯度的一阶矩,这使得在使用正交变换时,更新步骤能与未变换模型保持一致。
推理 :为了减轻重复变换折叠带来的浮点误差累积,系统在磁盘上存储高精度(FP64)权重。在每个形态变换步骤,变换被应用于高精度副本,转换为低精度(例如 FP16/BF16),然后加载到 GPU 显存中。
3. 主要贡献
框架引入 :提出了 UPMs,这是一个训练和推理框架,能够在允许任何参与者提取完整权重集的情况下实现协作模型服务。
理论分析 :深入分析了哪些架构(Transformer、MLP、RNN)支持 UPMs,变换的要求(随机性、可逆性、条件数),以及这些变换如何使跨时间组装变得不连贯的数学证明。
抗攻击性 :
直接提取 :证明了攻击者在短时间内访问所有阶段的概率微乎其微,特别是在具有“完全不兼容性”(跳跃连接)的情况下。
拼接攻击 :表明通过中间激活求解桥接矩阵是不切实际的,因为这要求跨时间步的输入完全相同,而这可以通过分布检查轻松防御。
基于学习的攻击 :通过实证表明,微调一个“拼接”模型(来自不同时间步的权重)需要至少 60% 的从头训练所需的计算资源,从而保持了协议的经济可行性。
实证验证 :在 Qwen-2.5-0.5B 和 Llama-3.2-1B 模型上进行了广泛实验。
4. 结果
功能等价性 :在 Qwen-2.5-0.5B 和 Llama-3.2-1B 上,应用 10,000 次正交变换形态变换步骤,导致 FP32 下的性能下降可忽略不计(Δ P P L < 0.01 \Delta PPL < 0.01 Δ P P L < 0.01 ;Jensen–Shannon 漂移 < 4 × 10 − 5 < 4 \times 10^{-5} < 4 × 1 0 − 5 )。通过高精度变通方案,在 FP16 和 BF16 下也保持了稳定性。
开销 :
推理 :每 30 秒应用一次变换,增加约 3% 的延迟、0.1% 的带宽和 10% 的 GPU 内存开销。
训练 :开销极小,增加 1.6% 的时间和 <1% 的内存开销,因为反向传播占主导地位。
攻击可行性 :
拼接 :微调一个拼接的 Llama 3.2-1B 模型,达到相同的困惑度所需的 token 数量约为从头训练所需数量的 60% 。
排除率 :即使访问所有不兼容的权重,排除率(攻击所需计算量与从头训练所需计算量之比)仍然很高(≥ 0.6 \ge 0.6 ≥ 0.6 ),使得该攻击对大多数联盟在经济上不可行。
5. 意义与主张
本文声称,UPMs 解决了协作训练 与权重保密性 之间的矛盾。通过将模型价值绑定到协议而非静态权重,UPMs 使得在社区驱动的去中心化训练中嵌入程序化激励机制 成为可能。
经济可行性 :该框架确保了模型的“可排除性”得以维持,允许贡献者因其计算资源获得补偿,而无需承担模型被盗并被免费使用的风险。
开源兼容性 :UPMs 允许模型架构、超参数和数据集保持开源,同时保持权重不可提取。
无信任去中心化 :该系统朝着完全无信任、不可提取的训练迈进,将 UPMs 定位为开放、去中心化 AI 的技术支柱。
作者承认了局限性,指出安全性依赖于参与者的诚实多数,且当前评估仅限于单机模拟,排除了现实世界的侧信道攻击(计时、缓存)。他们还指出,无法检查权重可能会阻碍安全评估,建议需要多样化的利益相关者监督以缓解这一问题。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。