Efficient and Privacy Aware Edge Cloud Collaborative Inference for Large Language Models
本文提出了一种以隐私为中心的边缘-云协同大语言模型推理框架,该框架利用端侧认证的 KV 缓存和加密数据传输,在保护异构设备用户隐私的同时,显著降低了延迟和带宽消耗。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一个超级聪明的机器人大脑,它能写故事、解数学题,还能像人类一样聊天。这就是我们所说的“大语言模型”(LLM)。但问题在于:这些大脑规模巨大且极其耗电,通常无法装进你的手机或笔记本电脑里。它们住在云端那些庞大且功能强大的计算机上。因此,当你向手机提问时,它必须通过互联网向云端“大喊”你的问题,等待那个巨大的大脑思考,然后再倾听答案。这虽然行之有效,但有两个大问题。首先,由于来回“大喊”需要时间,所以速度很慢。其次,这存在风险,因为你不得不把你的秘密想法、私人历史和准确的措辞告诉云端。这就像是为了得到一个回复,就把日记的内容发给了一个陌生人。
为了解决这个问题,科学家们尝试过将工作拆分:让你的手机处理简单的部分,并将困难的部分发送到云端。但即便如此,这也很棘手。如果你发送的数据太多,速度就会变慢;如果你发送得太少,云端就会感到困惑。而且,如果你发送的是原始想法,隐私仍然面临风险。这篇论文探讨了一种新的玩转这种“捉迷藏”游戏的方法。它提出了一个巧妙的伙伴关系,让你的设备与云端像侦探与图书管理员一样协同工作。设备保留最敏感的线索(如你的私人历史和特定词汇),而云端则负责阅读书籍的繁重工作。其目标是让机器人大脑快到能与你即时聊天,同时又足够私密,让云端永远看不见你的原始秘密。
侦探与图书管理员:一种新的聊天方式
那么,这个新系统究竟是如何运作的呢?来自 KunlunMeta 的 Yi Li、Chen Li 和 Jiexong Liu 在这篇论文中构建了一个名为“边缘-云协作推理”的框架。把它想象成一场高风险的“传声筒”游戏,你想在拥挤的房间里传递一条信息,但不希望中间的人(云端)知道这条信息的内容,也不希望他们重复信息时耗时太久。
在这个新设置中,你的设备(“边缘”)扮演着聪明侦探的角色,而云端则扮演着庞大且功能强大的图书管理员的角色。这里有一个魔术技巧:
1. 侦探先做功课(隐私第一)
你的设备不会直接向云端大喊你的原始问题,而是先做一些功课。它将你的文字转化为一种秘密代码(称为“嵌入/embeddings”),并决定允许云端看到多少过去的对话历史。这就像侦探交给图书管理员一份仅限图书管理员查阅的书单,而从未透露侦探实际的案情笔记。设备还保留了一份它认为可能的答案的特殊“草稿”。这被称为“投机采样/解码(speculative decoding)”。这就像侦探在图书管理员读完当前页面之前,就已经猜出了故事的下一句。
2. 图书管理员负责重活(但仅限必要部分)
云端接收这个秘密代码和“准入许可”(缓存授权)。它看不到你的原始文字,只能看到数学运算。它利用自己超强大的大脑来阅读获得授权的历史记录并处理困难的部分。至关重要的一点是,云端并不一次性计算出整个答案。它只计算侦探尚未猜出的那部分答案。这被称为“拆分词表投影(split vocabulary projection)”。想象一下,云端只需要写下句子的最后几个词,而你的设备则根据自身的本地知识补全其余部分。
3. 握手(快速且安全)
一旦云端完成了它的部分,它会将一小段加密的答案发回给你的设备。随后,你的设备将自己的猜测与云端的片段结合起来,形成最终答案。因为它们在协同工作,所以不需要等待整个句子写完再进行下一步。它们可以并行地进行“投机”并检查工作。为了保持安全,两者之间飞行的所有数据都使用了特殊的锁(AES-GCM 加密)进行了加密,因此即使黑客在监听,他们看到的也只是乱码。
结果:更快、更小、更安全
研究人员构建了这个系统的原型,并在不同类型的设备上进行了测试:仅配备 CPU 的标准计算机(如基础办公 PC)、配备图形显卡(GPU)的强大计算机,以及小型嵌入式设备(如智能恒温器或汽车计算机)。
他们发现,这个“侦探与图书管理员”团队比旧方法要快得多。
- 速度: 与“朴素型”拆分系统(即不使用这些高级隐私技巧,直接将模型切成两半)相比,这种新方法在 GPU 设备上将生成每个词的时间减少了高达 46.1%。在标准 CPU 上,速度也提升了 29.4%。
- 数据节省: 由于它们只发送严格必要的答案部分,当对话使用英文(使用较小的词汇子集)时,从云端传回的数据量减少了高达 67.4%。
- 质量: 最重要的一点是,答案的质量依然很高。该系统生成的答案与完全由云端模型独立生成的结果有 98.6% 是相同的。微小的差异主要是由于为了适配较小设备而对数学运算进行了轻微简化。
这个系统“不是”什么
理解这篇论文“不是”在声称什么非常重要。作者明确表示,这并不是一个能让云端完全失明的魔法护盾。云端仍然可以看到“特征张量(feature tensors)”(秘密代码)和“草稿 Token(draft tokens)”(猜测)。如果一个拥有大量额外知识的极聪明黑客试图对秘密代码进行逆向工程,他们可能仍然会了解到关于你输入的信息。论文明确指出,这不是一种正式的“差分隐私(differential privacy)”保证(一种严格的数学定义)。相反,它提供的是一种实用的、系统层面的保护。它让云端很难看到你的原始日记,但并不能让日记对拥有正确工具的超级侦探完全隐形。
此外,论文也排除了“你可以直接在手机上运行整个巨大大脑”的想法。对于大多数消费级设备来说,数学运算仍然过于沉重。“仅端侧(endpoint-only)”的方案(即手机完成所有工作)比协作式方案速度慢得多,且生成的答案质量也较低。
为什么这很重要
这篇论文表明,我们不必在“快速、智能的 AI”和“私密的 AI”之间做选择。通过将设备和云端视为一个团队,让设备保留对话中最敏感部分的钥匙,我们可以兼得两者之长。该系统可以适应你拥有的任何设备,无论是强大的游戏 PC 还是汽车里的微型芯片,这使得私密、快速的 AI 聊天成为未来的一种现实可能。作者在受控的实验室环境中测量了这些结果,虽然数字看起来很有前景,但真正的考验将是如何在复杂、不可预测的现实世界中应对。但就目前而言,这是迈向拥有一个尊重你秘密的智能助手的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。