想象一下,你想向一个强大的 AI 助手提出一个秘密问题,但你非常担心助手可能会窥探你的问题或答案。为了解决这个问题,你将问题放入一个坚不可摧的魔法玻璃盒中(这就是全同态加密,或 FHE)。助手可以在不打开盒子的情况下在盒内执行计算,完成后将盒子交还给你。你打开盒子,答案便在其中。
然而,这里有个陷阱:在这些魔法玻璃盒内进行数学运算极其缓慢且耗费精力。这就像戴着厚重的手套去解复杂的拼图。每当 AI 尝试混合两个数据片段时,它都必须完成大量工作。
本文介绍了一种构建这些“秘密 AI"大脑的新方法,称为公开衰减同态状态空间模型(HSSM)。以下是其工作原理,使用简单的类比说明:
问题:“重体力劳动”陷阱
在标准的秘密 AI(如 Transformer)中,每当 AI 处理句子中的一个新词时,它都必须将新的秘密词与句子的旧秘密记忆进行混合。
- 旧方法:想象你正搬着一个沉重的上锁保险箱(记忆),并且必须将其与另一个沉重的上锁保险箱(新词)混合。你必须搬起两个保险箱,将它们混合,然后锁好结果。对长故事中的每个词都这样做既令人疲惫又缓慢。“重量”(计算成本)不断堆积。
解决方案:“公开衰减”技巧
本文的作者意识到,他们可以稍微改变规则以使工作更轻松。他们提出了一种新设计,其中“记忆”不需要每次都与新秘密进行混合。
- 新方法(HSSM):想象 AI 拥有一个记忆保险箱,它自身会缓慢漏气(衰减)。这种“泄漏”是一个公开规则,众所周知(它不是秘密)。
- 与其混合两个沉重的上锁保险箱,AI 只需让旧记忆泄漏一点点(这很容易,因为它是公开规则),然后将一个小的、新的秘密便条加入混合中。
- 类比:这就像是一个有个小洞的水桶。水位(记忆)每秒都会自然下降一点(公开衰减)。你只需要倒入一小杯新水(新的秘密输入)来维持其运行。你不必每次都搬起整个水桶并与另一个水桶混合。
为什么这很重要
通过使用这种“漏水桶”方法,AI 避免了最昂贵、最费力的数学运算。
- 速度:研究者在真实计算机(特别是强大的 NVIDIA L40S GPU)上测试了该方法。他们发现,这种新方法在处理完整句子时比之前的最佳方法快约5 倍。
- 内存:由于 AI 不需要像传统 AI 那样保存其见过的每一个词的庞大增长列表,因此它使用的计算机内存要少得多。这就像保留一张单张的便条,而不是一堆不断增长的纸张。
- 准确性:尽管速度更快、更轻量,AI 仍然给出了完全正确的答案。在涉及电影评论(Rotten Tomatoes)和短句(SST-2)的测试中,秘密 AI 得出了与正常非秘密 AI 完全相同的正确答案。
他们实际做了什么(以及没做什么)
研究人员构建了一个特定系统,其中:
- 你(客户端):负责将文本转换为数字、加密并将它们放入盒子的繁重工作。
- 服务器:接收盒子,运行“漏水桶”数学运算,并将盒子交还。
- 你(再次):打开盒子查看结果。
重要限制:
- 本文并未声称已解决在盒子内读取原始文本的问题。文本在放入盒子之前仍必须转换为数字。
- 它并未声称是一个完整的通用聊天机器人(如大型语言模型)。它是一个用于分析短数据序列(例如分类评论是正面还是负面)的特定工具。
- “泄漏”(衰减)是一个固定的公开规则。如果 AI 需要根据秘密改变泄漏率,魔法就会失效,速度将变回缓慢。
总结
本文证明,通过改变 AI“记忆”事物的方式——从“混合两个沉重的秘密”转变为“让秘密泄漏并添加一小滴”——我们可以使秘密 AI 变得更快、更实用。这是一个巧妙的工程技巧,它在保持隐私承诺的同时,消除了数学运算的沉重负担。
技术摘要:用于私有序列推理的公开衰减同态状态空间模型
1. 问题表述
本文探讨了在全同态加密(FHE)下进行序列推理的高计算成本问题。虽然 FHE 支持私有推理,即客户端加密输入、服务器在密文上评估模型,但标准序列模型面临严重限制。在明文神经网络中常规的操作——如非多项式激活函数、softmax、层归一化和上下文范围的注意力机制——由于乘法深度、旋转成本和密文实例化等问题,在 FHE 下成为一级系统约束。
具体而言,本文指出了加密选择性循环中的瓶颈。在朴素的加密循环块(例如加密的 GRU 或 LSTM)中,状态更新通常涉及将加密的、输入相关的门控与加密的携带状态相乘(ht=gA(xt)⋅ht−1+…)。这种密文 - 密文乘法在每个时间步消耗乘法深度,迅速耗尽可用的噪声预算,并需要昂贵的自举(bootstrapping)或刷新操作。
2. 方法论:公开衰减 HSSM
作者提出了公开衰减同态状态空间模型(HSSMs),这是一种旨在避免在循环携带路径上进行密文 - 密文乘法的循环/状态空间块。
- 核心机制:该设计将循环衰减系数(a)固定为公开/明文。状态更新方程为:
ht=a⋅ht−1+g(xt)⋅u(xt)
其中,ht 是加密状态,a 是公开标量,g(xt)u(xt) 代表局部写入路径。
- 深度降低:通过将携带项(a⋅ht−1)变为密文 - 明文操作,本文消除了与循环携带相关的乘法深度增长。唯一的密文 - 密文乘法发生在局部写入路径(g⋅u)中,该操作是有界的且局限于当前步骤。
- 系统架构:
- 客户端:处理分词、冻结的 fastText 查找、训练归一化的随机投影、裁剪、加密、解密和阈值处理。
- 服务器端:接收加密的有界投影特征。它执行公开仿射投影、评估低次加密门控/写入多项式、执行局部写入乘法,并使用公开衰减聚合状态。
- 约束:模型参数(权重、衰减、投影)是公开的。服务器观察元数据(序列长度、操作形状),但不观察加密数据或密钥。
3. 主要贡献
本文做出了四项主要贡献:
- 架构规范:定义了具有公开衰减不变性的最小 HSSM 块,明确分离了客户端预处理与服务器端同态评估。
- 符号对比:将 HSSM 与基于 Transformer 风格的加密推理及朴素的加密选择性循环进行对比。它表明 HSSM 保持了固定大小的加密状态,并避免了朴素循环中的乘法深度累积。
- 实证验证:报告了 OpenFHE(CPU)和 FIDESlib(CUDA)后端上的真实 FHE 工件。这包括显示跨后端噪声行为一致的对齐层级轨迹,以及 L40S GPU 的测量数据。
- 任务质量与系统成本:将任务准确率与系统延迟分离。它使用修复后的 fastText 工作流(避免“玩具”特征)验证了该方法,并将 HSSM 与面向同态加密的多项式注意力机制进行了比较。
4. 实验结果
评估集中在 Rotten Tomatoes 和 SST-2 情感分析数据集上,使用有界特征接口(每个示例 512 个投影标量)。
- 准确率:加密 HSSM 路径与明文分类完全匹配,在 Rotten Tomatoes 上达到 0.7505 的准确率,在 SST-2 上达到 0.7420。
- 延迟与效率:
- 与全序列多项式注意力相比,HSSM 大约快 5 倍(例如,评估时间约 15 毫秒对比约 75 毫秒),同时保持或超越任务质量。
- 与缓存的最终令牌多项式注意力相比,HSSM 在更长上下文(T=16, 32)上显示出 1.34–1.62 倍 的更低延迟,并保持更小的逻辑加密状态占用空间。
- 资源使用:
- 内存:无论序列长度(T)如何,HSSM 仅保留单个加密状态密文,而多项式注意力需要 O(T) 或 O(T2) 个密文用于缓存和实例化分数。压力测试显示,HSSM 在 L40S GPU 上可完成长达 T=36 的序列,而实例化的二次注意力因内存不足错误在 T=36 时失败。
- 深度:投影后的 HSSM 在深度 8 / 环 32768 下成功,而可比的加密 Q/K/V 注意力块需要深度 10 / 环 65536 才能在相同序列长度下成功。
- 噪声与层级:OpenFHE 和 FIDESlib 上的对齐轨迹确认,扩展的 HSSM 路径在最终层级 3 结束,噪声尺度度数为 2,且在有界特征工作流中无需调用自举。
5. 意义与主张
本文主张,公开衰减 HSSM 是一种实用的 FHE 协同设计模式,适用于从有界投影特征进行服务器端加密序列推理。
- 设计杠杆:核心贡献在于证明,用公开/明文衰减替代加密的输入相关携带门控,是降低加密携带路径压力的可衡量杠杆。
- 主张范围:作者对其范围持谨慎态度。他们不声称:
- 同态分词或嵌入查找。
- 模型私有权重(权重是公开的)。
- 精确的 softmax、完整的 Transformer 块或生产规模的语言模型服务。
- 针对恶意服务器或侧信道攻击的安全性。
- 结论:结果表明,对于有界特征推理,公开衰减 HSSM 提供了一种具体的权衡:它在固定状态加密计算中实现了非玩具任务效用,比全序列注意力具有更低的延迟,并减少了逻辑状态增长,所有这些都在无需自举的可管理 FHE 深度预算内运行。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。