← 最新论文
🤖 machine learning

Power-Softmax: Towards Secure LLM Inference over Encrypted Data

本文介绍了“Power-Softmax",这是一种新颖的、同态加密友好的自注意力变体,它使得训练首个十亿参数级多项式大语言模型成为可能,这些模型能够在加密数据上进行安全推理,同时保持与标准 Transformer 相当的推理能力和上下文学习能力。

原作者: Itamar Zimerman, Allon Adir, Ehud Aharoni, Matan Avitan, Moran Baruch, Nir Drucker, Jenny Lerner, Ramy Masalha, Reut Meiri, Omri Soceanu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Itamar Zimerman, Allon Adir, Ehud Aharoni, Matan Avitan, Moran Baruch, Nir Drucker, Jenny Lerner, Ramy Masalha, Reut Meiri, Omri Soceanu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你想向一个超级聪明的机器人(大型语言模型,或称 LLM)提问,但希望保守问题的秘密。你既不想让机器人的所有者看到你问了什么,也不想让机器人本身知道你的秘密。

为此,你使用一种特殊的“魔法锁”,称为同态加密(HE)。这把锁允许你将问题以 scrambled(混淆、不可读)的格式发送。机器人可以在混淆后的问题上进行数学运算,并返回一个混淆的答案,随后你可以将其解锁。机器人永远看不到真实的问题。

问题:机器人的“大脑”无法适配这把锁
问题在于,这些现代机器人是构建在一种特定的数学引擎之上的,称为Transformer。该引擎使用一种非常常见的工具——Softmax——来决定哪些词语更重要。

可以将Softmax想象成一位厨师,他品尝汤品,并根据一个复杂的指数配方来决定加多少盐。这对烹饪来说很棒,但“魔法锁”(HE)只理解简单的线性数学(多项式)。它无法处理厨师那种复杂的指数配方。如果你试图在锁定的状态下强迫机器人使用其正常的大脑,数学运算就会崩溃,或者机器人会变得困惑且不稳定。

之前的尝试就像试图把方钉硬塞进圆孔:

  1. “蛮力”方法:尝试用巨大且杂乱的多项式来近似复杂的配方。这虽然可行,但极其缓慢且笨重。
  2. “预训练”方法:在机器人学习之前改变其大脑,用更简单的东西替换复杂的配方。但这通常会使机器人变得不那么聪明,或者导致其在规模扩大时表现挣扎。

解决方案:PowerSoftmax
本文的作者发明了一种新工具,称为PowerSoftmax

想象一下,厨师不再使用复杂的指数配方,而是使用一个简单的幂次配方(例如对数字进行平方)。

  • 类比:如果 Softmax 是一位将食材乘以某种神奇增长数字的厨师,那么 PowerSoftmax 就是一位仅仅将食材乘以自身的厨师(例如 2×22 \times 23×33 \times 3)。
  • 为何有效:这种“幂次配方”的行为几乎与原始复杂配方完全一致,但它能完美地适配“魔法锁”。它足够简单,让锁能够处理;又足够智能,能让机器人保持清晰的思考。

他们解决的挑战
仅仅替换配方是不够的;为了让它适用于巨型机器人,他们必须解决三个具体问题:

  1. “零”问题:在新配方中,数学运算有时可能会除以零,导致系统崩溃。
    • 解决方法:他们添加了一个微小的安全缓冲(就像安全网),确保数学运算永远不会触及零,从而使计算稳定且易于近似。
  2. “溢出”问题:如果数字变得太大或太小,机器人的大脑就会爆炸(或冻结)。
    • 解决方法:他们创建了一个“稳定变体”,在执行数学运算之前将数字缩放到一个安全、可管理的范围内,这就像厨师在将汤加入整锅之前先尝一小勺一样。
  3. “长句子”问题:原始方法随着句子变长而变得越来越慢。
    • 解决方法:他们发明了一种“长度无关”的方法。与其计算长故事中每一个单词来进行数学运算,他们只需查看单词的平均值。这意味着无论你是问一个简短的问题还是写一整部小说,机器人都能保持快速。

结果:一个巨大且安全的机器人
利用这些技巧,该团队构建了首个拥有超过 10 亿参数的安全机器人(这是衡量机器人“大小”和智能程度的指标)。

  • 规模:它比任何之前的安全机器人大 10 倍以上。
  • 智能:它仍然能够理解上下文、通过推理解决问题,并从示例中学习(一种称为“上下文学习”的技能),其表现与标准的、未加锁的机器人一样出色。
  • 速度:由于他们的新数学方法如此高效,它在加密数据上的运行速度比之前的方法快得多。

总结
这篇论文提出了一种尊重隐私的构建 AI 的新方法。他们用一种更简单的、基于“幂次”的版本替换了 AI 复杂的“注意力”机制,使其能够适配加密锁。这使得他们能够训练庞大的、拥有十亿参数的 AI 模型,这些模型能够在不泄露用户数据或模型秘密的情况下,安全地进行思考和推理。他们不仅仅制造了一个小玩具,而是构建了一个真正起作用的大型安全大脑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →