Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices
本文提出了一种运行时感知(runtime-aware)的延迟预测框架,该框架通过自适应地融合静态模型描述符与动态硬件遥测数据,旨在实现跨异构边缘设备、且仅需极少校准即可进行的准确且具可迁移性的大语言模型(LLM)部署筛选。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图在掌上游戏机上挑选一款完美的视频游戏。你拥有庞大的游戏库,从微小的益智冒险到宏大的史诗级角色扮演游戏应有尽有。但问题在于,你的游戏机有点“任性”。如果你玩得太久,它会发热;它的电池消耗很快;而且根据你握持的方式或一天中的不同时间,它处理不同游戏的方式也会变得很奇怪。如果你试图下载并测试每一款游戏,以看看哪一个运行得顺畅,你会在等待下载中耗费一整天,结果却发现其中一半的游戏都会崩溃或卡顿。你需要一种方法,仅仅通过观察游戏的描述和你游戏机当前的状态,就能猜出哪一个真的能跑得动。这正是目前手机和小型设备上的人工智能领域所面临的精确问题。
科学家们正试图将“大语言模型”(LLMs)——即那些能够写故事、回答问题和解决问题的超级聪明的人工智能大脑——直接运行在我们的设备上,而不是将数据发送到巨大的云端服务器。这对隐私保护和速度提升非常有益,但预测起来却是一场噩梦。一个 AI 模型可能在一部手机上运行得非常完美,但在另一部看似相似的手机上却会卡死。为什么?因为 AI 的速度取决于一个混乱的组合:问题的长度、手机变热的情况、剩余电量,甚至运行 AI 的特定软件。如果我们无法在实际尝试之前预测 AI 运行的速度,我们就会浪费大量的测试时间和能量。这就是“预测未来”的故事。
AI 速度的“水晶球”
在这篇论文中,来自佐治亚州立大学和陆军研究实验室的一个研究小组构建了一个用于 AI 速度的“水晶球”。他们称之为运行时感知延迟预测框架(runtime-aware latency prediction framework)。让我们来拆解一下这个术语。“延迟”(Latency)只是一个表示某事发生所需时间的专业词汇。“运行时感知”(Runtime-aware)意味着该系统在 AI 工作时会关注正在发生的事情,而不仅仅是看 AI 在纸面上的参数。“可迁移性”(Transferable)则意味着即使你从一种类型的设备转移到另一种类型,这个水晶球依然有效。
研究人员意识到,试图在每一种设备上测试每一个 AI 模型,就像是为了找到自己最喜欢的口味而去品尝世界上每一种口味的冰淇淋一样。这既缓慢又昂贵。相反,他们想要一个系统,能够观察一个新的设备和一个新的 AI 模型,然后说:“嘿,这个组合大概需要 10 秒钟来回答。”
这个水晶球是如何工作的
其系统的核心秘诀在于它不仅仅观察静态事实。想象一下你在猜测一辆汽车行驶的速度。一个“静态”的猜测只会看汽车的发动机大小和重量。但一个“运行时感知”的猜测还会检查天气、交通状况以及司机是否困倦。
研究人员的系统同时做两件事:
- 静态路径: 它查看设置的“身份证”。这包括模型的规模、手机或设备的类型以及各项设置。
- 动态路径: 它在设备运行时监测其“心跳”。它追踪芯片如何变热、处理器转速如何以及内存被使用了多少。
系统将 AI 的工作分为两个阶段,就像一场两部分的比赛:
- 预填充阶段(Prefill Phase): 这是 AI 阅读你的问题并整理思绪的阶段。这通常是一个快速、爆发式的冲刺。
- 解码阶段(Decode Phase): 这是 AI 一个词一个词写出答案的过程。这是一个更长、更稳定的慢跑过程。
通过将这两个阶段分开处理,并将“身份证”信息与“心跳”数据相结合,系统构建出了一个更聪明的预测。他们使用了一种特殊的“门控融合”(gated fusion)机制,这就像一个智能红绿灯,决定在不同情况下应该更多地听从静态事实还是实时交通状况。
校准的魔力
这里有一个最重要的技巧:系统并非开箱即用就完美无缺。如果它是在 Pixel 8 手机上训练的,而你尝试将其用于 Pixel 8 Pro,它可能会把数字算错,因为这两部手机略有不同。
为了解决这个问题,研究人员使用了一个校准集(calibration set)。把它想象成一次快速的“试驾”。你在新设备上运行 AI 几次(也许是 6 到 20 次),看看它实际的表现如何。系统随后会利用这些少量的真实结果来微调它的水晶球,使其预测结果与新设备的现实情况保持一致。
校准的结果是惊人的。如果没有校准,该系统预测在 Pixel 8 Pro 上进行“解码”(写出答案)所需时间的表现(称为 )是 -1.085。这是一个糟糕的分数,意味着预测效果甚至比随机猜测还要差。但在经过极少量的校理解后,这个分数跃升到了 0.927,这几乎是完美的。这就像是将一张模糊的照片通过几次调整,瞬间变得清晰无比。
测试系统
团队在各种设备上测试了他们的想法,以确保这不仅仅是针对某一款特定手机的偶然现象。他们使用了:
- Pixel 8 和 Pixel 8 Pro: 主要的主角,代表现代移动电话。
- Jetson Nano: 一种常用于机器人和无人机的微型计算机。
- Orange Pi 5 Pro: 一种小型单板计算机。
- RTX 3090: 通常出现在高端游戏 PC 中的强大显卡。
他们发现,同一个 AI 模型在大型显卡上可以非常快(每秒 64.38 个 token),但在小型 Orange Pi 上却极其缓慢(每秒 8.42 个 token)。这证明了你不能仅仅根据模型本身来猜测速度;你必须了解设备。
这为什么重要:筛选过程
最终目标不仅仅是预测速度,而是为了节省时间。想象一下你有 100 个不同的 AI 模型,你需要为你的特定手机挑选出最好的那一个。如果没有这个系统,你必须下载并测试所有 100 个。有了这个系统,你可以瞬间预测所有 100 个模型的速度。
研究人员随后使用了一种称为**帕累托优化(Pareto optimization)**的策略。这是一种高级说法,意指寻找“最佳平衡点”。他们想要一个既快又聪明的模型。如果模型 A 比模型 B 慢,但并不比它更聪明,那么模型 A 就是没用的。系统会过滤掉糟糕的选项,为你留下最优秀的候选名单进行实际测试。
在测试中,这种筛选过程成功地让最好的模型保持在竞争范围内。例如,在从 Pixel 8 Pro 转向 Pixel 8 时,系统虽然过滤掉了一半的候选者,但确保了绝对最优的模型仍然在名单之中。
他们的发现(以及未发现的部分)
论文指出,这种方法是加速且廉价地部署 AI 的有力工具。他们发现:
- 静态猜测是不够的: 仅仅知道模型大小并不能告诉你它在特定手机上运行得有多快。
- 校准是关键: 你不能直接把一个设备的预测结果“复制粘贴”到另一个设备上;你需要一点真实的观测数据来修正预测。
- 阶段很重要: 将 AI 的“阅读”部分和“写作”部分区别对待,会让预测更加准确。
然而,作者也谨慎地指出,这只是一个起点。他们的最佳结果出现在 Pixel 系列手机上,虽然他们展示了系统在 Jetson 和 Orange Pi 等其他设备上可以运作,但尚未对这些设备进行深入的深度训练。他们还注意到,在高性能计算机上,较小的模型有时并不总是比大的模型运行得更快,这是他们系统所帮助解释的一种奇特现象。
简而言之,这篇论文提供了一种聪明且灵活的方法,让你无需等待数小时去寻找答案,就能预测 AI 在你的设备上运行的速度。它将一场混乱的猜谜游戏变成了一个基于数据的计算决策,帮助我们在不耗费过多时间或电量的情况下,获得最佳的设备端 AI 体验。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。