← 最新论文
💬 NLP

Leveraging ASIC AI Chips for Homomorphic Encryption

本文提出了 CROSS 编译器框架,通过基对齐变换(BAT)和内存对齐变换(MAT)将同态加密工作负载适配至 AI 加速器(如 TPU),成功利用其低精度矩阵引擎解决了现有算法在 AI 芯片上的资源利用率低和能效差的问题,实现了同态加密算子的能效新突破。

原作者: Jianming Tong, Tianhao Huang, Jingtian Dang, Leo de Castro, Anirudh Itagi, Anupam Golder, Asra Ali, Jeremy Kun, Jevin Jiang, Arvind, G. Edward Suh, Tushar Krishna

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianming Tong, Tianhao Huang, Jingtian Dang, Leo de Castro, Anirudh Itagi, Anupam Golder, Asra Ali, Jeremy Kun, Jevin Jiang, Arvind, G. Edward Suh, Tushar Krishna

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何用最先进的 AI 芯片,以极低的能耗和极高的速度,处理极其复杂的加密数据”**的故事。

为了让你轻松理解,我们可以把整个技术过程想象成**“在超级工厂里加工特殊货物”**。

1. 背景:为什么我们需要这个?(隐私与效率的矛盾)

想象一下,你想把一份绝密文件(比如你的医疗记录或银行密码)发给云端的 AI 医生或分析师去处理。

  • 传统做法:你必须先把文件锁进保险箱(加密),然后寄给 AI。AI 拿到后,因为打不开保险箱,只能把整个箱子扔在一边,或者需要极其笨拙的方法去“猜”里面的内容。这导致处理速度极慢,就像让一个超级跑车在泥地里爬行,效率极低,耗电巨大
  • 同态加密(HE):这是一种神奇的魔法,允许 AI 在不打开保险箱的情况下,直接对里面的文件进行计算(比如统计平均值、做诊断),算完后再把结果锁好寄回给你。
    • 问题:虽然魔法很强大,但施展这个魔法的计算成本太高了。目前的通用芯片(如 GPU)处理起来还是很慢,而专门为此设计的芯片(ASIC)又太贵,还没法大规模普及。

2. 核心挑战:拿着锤子找钉子(架构不匹配)

研究人员发现,Google 的 TPU(一种专门用来训练 AI 的超级芯片)其实非常适合做这件事,因为它算力极强且省电。但是,直接拿现有的 AI 算法去跑 TPU,就像**“试图用一把巨大的工业级电锯去切一块精致的手术刀”**,完全不对路:

  1. 精度不匹配(大材小用 vs 小材大用)

    • AI 芯片(TPU):擅长处理大量、简单、低精度的数字(比如 8 位整数),就像拥有成千上万个快速的小工人在同时搬运砖块。
    • 加密算法:传统上需要处理少量、极其复杂、高精度的数字(比如 32 位或 64 位整数),就像让一个高级工匠单独去雕刻每一块砖。
    • 结果:如果直接运行,TPU 那些强大的“小工人”大部分时间都在发呆(闲置),只有少数“高级工匠”在干活,导致资源浪费严重。
  2. 搬运不匹配(乱序 vs 流水线)

    • 加密算法:需要频繁地、随机地打乱和重组数据(就像在仓库里把箱子从 A 区随机搬到 B 区)。
    • AI 芯片:设计初衷是流水线作业,数据按顺序流动最顺畅。让它去处理随机搬运,就像让流水线工人停下来去整理杂乱的仓库,效率极低。

3. 解决方案:CROSS 编译器框架(“翻译官”与“重组师”)

为了解决这个问题,论文提出了一套名为 CROSS 的编译器框架。你可以把它想象成一个超级翻译官和物流重组专家,它把原本给“高级工匠”设计的加密任务,重新包装成适合“小工人”流水线作业的形式。

它有两个核心绝招:

绝招一:BAT(基对齐变换)—— 把“复杂雕刻”变成“批量搬运”

  • 原来的做法:加密计算需要把一个大数字拆成很多小块,然后像做复杂的拼图一样,把很多块拼起来,中间有很多多余的零(就像在搬运砖块时,很多砖块是空的,但工人还得搬)。
  • CROSS 的做法
    • 它发现那些“多余的零”和复杂的计算步骤,其实是可以提前算好的。
    • 它把原本稀疏、复杂的计算,压缩成了一个密集的、简单的矩阵乘法
    • 比喻:原本需要 100 个工人分别去搬 100 个空箱子和 100 个实箱子(其中 50 个是空的)。CROSS 提前把空箱子扔掉,把实箱子打包成整齐的 10 个大托盘。现在,TPU 的“小工人”们可以一次搬运一个大托盘,效率瞬间提升,而且没有浪费任何力气

绝招二:MAT(内存对齐变换)—— 把“现场整理”变成“预先排版”

  • 原来的做法:计算过程中,数据需要不断被打乱顺序(比如把第 1 个和第 100 个交换)。在 TPU 上,这种“现场整理”非常慢,因为工人得停下来去翻找。
  • CROSS 的做法
    • 它利用数学技巧,把“打乱顺序”这个动作,提前融合到了计算步骤里。
    • 它把原本需要“先计算、再打乱”的过程,变成了“计算出来的结果天然就是打乱好的顺序”。
    • 比喻:原本工人需要把做好的菜(计算结果)端出来,再根据客人的要求重新摆盘(打乱顺序)。CROSS 的做法是,让厨师在做菜的过程中,就直接按照客人想要的摆盘方式把菜做好了。工人端出来的那一刻,就是完美的,完全省去了“摆盘”这个耗时环节

4. 成果:惊人的效率提升

通过这套方法,研究人员在真实的 Google TPU 芯片上进行了测试,结果令人震惊:

  • 速度记录刷新:在处理加密核心运算(NTT)时,CROSS 在 TPU 上的速度比目前最先进的 GPU 方案(如 NVIDIA A100)还要快,甚至刷新了记录。
  • 能效之王:在“每瓦特电力能完成多少工作”这个指标上,CROSS 的表现是:
    • 比开源 CPU 方案快 451 倍
    • 比顶级 GPU 方案快 7.8 倍
    • 甚至比一些专门设计的、昂贵的加密芯片还要快(或者接近)。

5. 总结:这意味着什么?

这篇论文的核心思想是:我们不需要为了隐私计算去专门造一种昂贵的新芯片。

只要给现有的、强大的 AI 芯片(如 Google TPU)穿上 CROSS 这件“智能外衣”(编译器),它们就能瞬间变身成为处理加密数据的超级引擎

  • 对普通人:这意味着未来我们在云端使用 AI 服务(如医疗诊断、金融分析)时,既能享受 AI 的便利,又能真正保护隐私,而且速度更快、电费更便宜
  • 对行业:它证明了 AI 芯片和隐私计算可以“同床共枕”,让现有的硬件设施发挥 1+1>2 的效用,让安全计算变得触手可及。

一句话总结:CROSS 就像一位天才的“翻译官”,它把原本让 AI 芯片“水土不服”的加密任务,翻译成了芯片最擅长的“流水线语言”,从而让隐私计算变得既快又省。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →