这篇论文讲述了一个非常酷的技术突破:如何让巨大的“人工智能大脑”(大语言模型)在你的手机里跑得飞快,而且还能同时干很多不同的活,却不需要联网。
想象一下,以前的手机 AI 就像是一个住在云端的大管家。你想让它帮你写邮件、改语法或者换个语气说话,手机得把问题发给云端,云端处理完再发回来。这就像每次想问个问题,都得打个长途电话,既慢又费流量,而且隐私也藏不住。
现在的挑战是:能不能把这个“大管家”直接搬进手机里?
难点在于: 手机内存小、电池小,而 AI 模型太大、太笨重。而且,如果你想让 AI 既能“写诗”又能“修图”,传统做法是给它装好几个不同的“大脑”,手机根本装不下。
三星的研究团队(在 Galaxy S24 和 S25 上)想出了一个绝妙的办法,他们把这件事变成了**“一个大脑,八种面具,瞬间切换”**。
以下是他们是怎么做到的,用几个生活中的比喻来解释:
1. 核心魔法:一个大脑,随时换“面具” (Multi-LoRA)
- 传统做法: 就像你想让一个人既当厨师又当司机,你得给他准备两套完全不同的衣服和工具,甚至要换两辆车。在手机里,这意味着要存好几个巨大的模型文件,内存直接爆满。
- 他们的做法: 他们把 AI 模型变成了一个**“万能底座”**(冻结的推理图)。
- 这个底座是固定的,就像一辆底盘坚固的卡车。
- 不同的任务(比如“写正式邮件”、“讲笑话”、“改语法”)就像不同的“面具”或“工具箱”(这就是 LoRA 技术)。
- 创新点: 以前换面具要换车(重新编译模型),现在他们让“面具”变成了随车携带的配件。当你需要“讲笑话”时,手机瞬间给卡车装上“幽默面具”;下一秒需要“写公文”,瞬间换成“严肃面具”。
- 结果: 不需要存好几个大模型,只需要存一个底座和几个小小的面具文件。手机内存省了,切换速度快如闪电。
2. 并行魔法:一次说话,八种风格 (Concurrent Token Generation)
- 传统做法: 如果你想让 AI 同时给你生成“正式、礼貌、幽默、严肃”等 8 种不同风格的回复,手机得跑 8 次,像是一个人排队 8 次去问同一个问题,非常慢。
- 他们的做法: 他们发明了一种**“分身术”**。
- 想象你在写一封信,传统的 AI 是一次写一个字。
- 他们的 AI 像是一个拥有 8 个笔触的魔法笔,在同一秒钟,在同一张纸上,同时写出 8 种不同风格的句子。
- 原理: 它们发现,虽然风格不同,但句子的开头和大部分结构是一样的。于是,它们利用手机芯片(NPU)的并行处理能力,一次性把 8 种结果都算出来。
- 结果: 速度直接提升了6 倍!你不需要等待,瞬间就能在屏幕上看到所有选项。
3. 加速魔法:不用草稿,直接猜 (Dynamic Self-Speculative Decoding)
- 传统做法: AI 说话是一个字一个字蹦出来的(自回归),就像一个人思考很久才说一个字,非常慢。为了加速,以前的方法通常是再请一个“小助手”(草稿模型)先猜几个字,但这需要额外的内存,手机装不下。
- 他们的做法: 他们让 AI 自己**“学会预判”**。
- 想象你在玩填字游戏。以前的 AI 是填一个格子,确认一个,再填下一个。
- 现在的 AI 像是**“一次填好几个格子”**。它利用一种特殊的技巧(前缀微调),在生成第一个字的同时,顺便把后面几个字也“猜”出来。
- 如果猜对了,就一次性通过;如果猜错了,再修正。
- 结果: 不需要额外的“小助手”,也不需要额外的内存,生成速度直接提升了2.3 倍。
4. 瘦身魔法:把“高清”变成“素描” (Quantization)
- 做法: 就像把一张巨大的 4K 高清照片压缩成一张清晰的素描画。
- 他们把模型里的数字精度从“超级精细”(浮点数)压缩到了“够用且清晰”(4 位整数)。
- 结果: 模型体积缩小了,但聪明的程度几乎没有下降。这让巨大的模型能塞进小小的手机里。
总结:这对你意味着什么?
这项技术就像是在你的手机里建了一个“全能 AI 工作室”:
- 隐私安全: 所有计算都在手机里完成,不用把你的聊天记录发给云端。
- 极速响应: 无论是改语法、写邮件还是换语气,几乎是“秒回”。
- 省电省空间: 不需要下载好几个巨大的 APP,一个模型搞定所有任务。
- 多语言支持: 支持 9 种语言,8 种任务,随时随地用。
简单来说,三星的工程师们通过**“一个底座换面具”、“一次生成八种结果”和“自己预判加速”这三招,把原本只能在云端运行的超级 AI,完美地塞进了我们的 Galaxy S24 和 S25 手机里,让手机真正变成了你的私人智能助理**。
1. 研究背景与问题 (Problem)
将大型语言模型(LLM)部署到智能手机等边缘设备上面临着严峻的工程挑战,主要受限于内存(Memory)、延迟(Latency)和运行时灵活性(Runtime Flexibility)。
- 核心矛盾:传统的服务器端 LLM 可以通过参数高效微调(PEFT,如 LoRA)动态适应不同任务,但这通常需要重新编译模型或加载不同的权重文件。而在设备端,推理图(Inference Graph)必须是冻结的(Frozen),且内存资源极其有限。
- 现有痛点:
- 多任务切换困难:若要支持多个任务(如不同语言、不同风格),传统方法需要为每个任务加载独立的模型或重新编译,导致存储占用大、切换延迟高。
- 推理效率低:生成多个风格变体(如正式、礼貌、幽默)通常需要串行运行多次推理,导致延迟成倍增加。
- 硬件兼容性:许多优化技术(如 Flash Attention)与手机上的神经网络处理器(NPU)不兼容;基于草稿模型(Draft Model)的投机采样(Speculative Decoding)会消耗额外的宝贵内存。
目标:在三星 Galaxy S24/S25(搭载高通 SM8650/SM8750 芯片)上,实现一个单一大模型支持多语言、多任务,并能动态切换且无需重新编译的高效推理框架。
2. 方法论 (Methodology)
该研究提出了一套硬件感知(Hardware-aware)的综合框架,主要包含以下四个核心技术模块:
2.1 动态多 LoRA 启用机制 (Multi-LoRA Enablement)
- 创新点:将 LoRA 权重视为运行时输入(Runtime Inputs),而非在训练时静态合并到主模型中。
- 实现方式:
- 构建一个包含 LoRA 权重占位符(Placeholders)的单一冻结推理图。
- 在推理时,将不同任务的 LoRA 权重作为输入数据与 Token 一起传入。
- 优势:无需为每个任务重新编译图或重新量化,实现了“即插即用”的任务切换,显著降低了存储需求和内存开销。
2.2 设备端模型优化 (Model Optimizations)
为了适应 NPU 和嵌入式 GPU 的架构特性,进行了以下转换:
- 注意力并行化:将多头注意力(MHA)分解为多个单头注意力(SHA)并行路径,利用 NPU 的并行计算核心。
- 线性层转卷积层:将全连接层(Linear Layers)重解释为 1×1 卷积。这使得模型能利用嵌入式硬件后端高度优化的卷积算子(如 Winograd 算法),降低延迟和能耗。
- 量化策略:采用混合精度量化。权重量化为 INT4,激活值量化为 INT8,并结合量化感知训练(QAT)以保持精度。
- 图优化:应用常量折叠(Constant Folding)和算子融合(Operator Fusion)以减少运行时计算和内存访问。
2.3 并发 Token 生成 (Concurrent Token Generation, CTG)
- 场景:针对需要同时生成多个风格变体(如 8 种不同语气的回复)的场景。
- 传统做法:串行运行 8 次推理,延迟增加 8 倍。
- 创新做法:
- 利用所有变体共享同一冻结图和 KV Cache 的特性。
- 设计了一种掩码解码方案(Masked Decoding),仅修改第一个 Token 的采样逻辑。
- 在单次前向传播中,利用共享的 KV Cache 和 Tensor 布局,同时生成 8 个不同的输出流。
- 效果:将风格生成的延迟降低了 6 倍。
2.4 动态自投机解码 (Dynamic Self-Speculative Decoding, DS2D)
- 原理:一种基于树状分支的投机采样策略,不需要额外的草稿模型(Draft Model)。
- 机制:
- 利用Prefix Tuning微调基础模型,使其能够一次性生成 1+m 个 Token(1 个主 Token + m 个预测 Token)。
- 构建树状结构进行验证:如果预测 Token 被接受,则继续生成;否则回退。
- 动态分支配置:针对不同用例(如修正、写作助手、总结)动态调整分支配置(Branch Configuration),以最大化接受率。
- 优势:避免了加载额外模型带来的内存开销,完全兼容冻结的单图推理流程。
3. 关键贡献 (Key Contributions)
- 首个设备端“万能”多 LoRA 框架:实现了在单一冻结推理图上动态加载多个 LoRA 权重,支持多语言(9 种)和多任务(8 种)的实时切换,无需重新编译。
- 并发生成技术:提出了 CTG 机制,在单次推理中并行生成多种风格变体,解决了多风格输出的延迟瓶颈。
- 无草稿模型的投机解码:设计了 DS2D 策略,在不增加内存负担的前提下,通过半自回归(Semi-Autoregressive)方式加速 Token 生成。
- 端到端硬件优化:针对高通 NPU 进行了从算子分解(MHA 转 SHA)、线性层转卷积到 INT4 量化的全链路优化。
4. 实验结果 (Results)
实验在三星 Galaxy S24 (SM8650) 和 S25 (SM8750) 上进行,使用了 1B 和 3B 参数的 LLaMA 基础模型。
- 性能提升:
- 整体延迟与内存:相比未优化方案,实现了 4-6 倍 的整体改进。
- 并发生成:CTG 技术使风格生成延迟降低 6 倍。
- 解码速度:DS2D 技术使 Token 生成速度提升 2.3 倍(在 3B 模型上,Tokens/sec 从 ~22 提升至 ~44+)。
- 吞吐量:在 Galaxy S25 上,3B 模型的 Token 生成速率达到 41.32 tokens/sec,端到端生成时间仅为 2.85 秒。
- 精度保持:
- 在 9 种语言和 8 种任务(如语法修正、风格转换、智能回复、摘要等)上,量化模型(INT4/INT8)的精度与 FP32 模型相比保持极高的一致性(相对准确率 RA 大多在 97%-103% 之间)。
- 例如,在韩语、英语、德语等语言的“修正”任务中,QAT 模型的 G-Eval 分数与 FP32 几乎持平甚至略优。
- 资源占用:
- 3B 模型在设备上的峰值内存占用约为 1.5 GB - 2.5 GB(取决于具体配置),成功在移动端运行。
- 多 LoRA 方案(LoRA as Input)比多图方案更节省内存(686 MB vs 894 MB 对于 2 任务场景)。
5. 意义与影响 (Significance)
- 商业落地:该框架已成功应用于三星 Galaxy S25 系列的 Galaxy AI 功能中,证明了生成式 AI 在移动端完全离线(No-cloud)运行的商业可行性。
- 技术突破:打破了“多任务需要多模型”或“高性能需要云端”的传统认知,展示了通过算法优化(LoRA 动态加载、并发解码、自投机采样)可以在资源受限设备上实现复杂的大模型应用。
- 行业指导:为边缘 AI 开发者提供了一套最佳实践指南,特别是在处理内存密集型基础模型、量化策略以及 NPU 算子适配方面。
- 可持续性:通过减少云端依赖和降低设备能耗,推动了更绿色、更隐私保护的 AI 生态发展。
局限性:
- 当前设计假设所有 LoRA 具有相同的维度,限制了异构 LoRA 尺寸的支持。
- DS2D 中的预测 Embedding 是静态的,可能在处理高语义方差或长依赖输入时降低接受率。
- 多流解码依赖于编译时定义的固定风格集,不支持动态用户自定义风格。
总体而言,这项工作标志着移动设备端大模型部署从“单任务、单模型”向“多任务、动态适应、高效并发”的重要跨越。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。