More GPUs or a Smaller Cache? Tensor Parallelism versus KV Compression for Memory-Bound LLM Serving
本文表明,对于受限于内存带宽的大语言模型(LLM)推理服务,KV 压缩在成本与容量比方面始终优于张量并行,而后者仅在模型超过设备显存限制时才为必要,却无法提升较小模型的延迟表现或成本效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
当大型语言模型被要求进行长对话或处理海量文档时,它面临着一个简单但顽固的物理限制:内存。模型必须在计算机内存的一个特殊区域(称为缓存)中保留所有已说和已听内容的运行记录,以确保其回答保持连贯。如果对话变得过长,或者同时有太多人提问,这个缓存就会溢出,导致系统崩溃。为了保持服务的运行,工程师们传统上依赖两种截然不同的策略。一种方法是购买更多的计算机芯片,将内存负载分散到多个协同工作的强大处理器上。另一种方法是缩小对话本身的内存占用,利用巧妙的数学技巧压缩数据,使其能够容纳在单个芯片上,即使这意味着要牺牲一点点精度。多年来,这两类专家一直处于各自独立的世界中,很少比较他们解决方案的实际价格标签。
一项新研究将这两种方法带到了同一个房间里,以观察对于这些系统的运营者来说,哪一种才是真正的更便宜。研究人员利用针对真实硬件校准的模拟实验,旨在寻找一个转折点,即增加更多芯片是否比压缩数据更划算。他们使用流行的开源模型和不同类型的顶级计算机芯片测试了各种配置,测量了每生成百万词的成本与响应速度之间的关系。结果令人惊讶:并不存在转折点。在他们测试的所有场景中,压缩数据都明显比增加硬件更便宜。随着对内存缓解需求量的增加,这种成本差距变得越来越大,压缩技术提供的节省额度几乎是单纯购买更多芯片的两倍。
这项研究表明,问题本身是基于对这些系统失效方式的一种误解。研究人员发现,对于较小的模型,内存限制很少仅由对话长度引起。一个拥有70亿参数的模型在标准高端芯片上运行时,可以处理其最大可能的对话长度,而永远不会耗尽空间。真正的障碍不是聊天有多长,而是模型本身有多大。当模型的核心指令(或权重)太大而无法装入单个芯片时,任何压缩都无济于事,因为压缩只能缩小对话历史,而不能缩小模型的“大脑”。在这些情况下,增加芯片不是一个选择,而是让系统能够运转下去的唯一途径。这划定了一条清晰的分界线:如果模型足够小,可以放入单个芯片,那么压缩就是更优的低成本方案。如果模型太大,增加芯片是强制性的,此时压缩就成了在硬件到位后处理更多用户的次要工具。
研究人员还发现,这两种策略买到的东西是不同的。增加更多芯片会让系统变得更快,减少启动回答和生成每个单词所需的时间。然而,压缩数据会让系统变慢,因为计算机必须更努力地解压信息,而且它现在能处理的额外用户会造成交通拥堵,从而延迟响应。虽然压缩技术可以让每一美元的硬件支出支持大约十六倍的并发用户,但增加芯片仅能小幅提升这种容量,且成本要高得多。研究结论指出,最有效的路径是首先确定模型是否能放入单个芯片。如果可以,则通过压缩数据来廉价地服务更多人。如果不可以,则添加必要的芯片以使其可行,然后通过压缩数据来最大化该硬件所能支持的用户数量。在这些模拟实验的现实世界中,认为这两种方法成本相等的“中间地带”根本不存在。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。