← 最新论文
🤖 machine learning

CHIME: A Case for Efficient Long-Context Attention-FC Disaggregated Inference with DIMM-PIM

本文提出了 CHIME,这是首个利用 DIMM-PIM 加速器、通过无气泡流水线和混合粒度重布局来平衡内存容量与带宽约束的 Attention-FC 解耦推理系统,其相比于最先进的 HBM-PIM 方案实现了高达 5.15 倍的加速。

原作者: Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Qingyuan Liu, Liyan Chen, Haocheng Wang, Yanning Yang, Dong Du, Zhigang Mao, Naifeng Jing, Yubin Xia, Haibo Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图烘焙世界上最大、最复杂的蛋糕。你有一个超快、高科技的烤箱(GPU),它可以在瞬间完成食材混合和层叠烘焙,但它非常小,一次只能容纳几层托盘。与此同时,你还有一个庞大但移动缓慢的储藏室(内存),用来存放所有的面粉、糖和鸡蛋。如果你尝试制作一个需要堆积如山的食材的蛋糕,你的烤箱就会因为没有空间放置托盘而停滞,或者因为它一直在等待储藏室递送下一批面粉而浪费时间。这正是现代“大语言模型”(LLM)——即那些能写代码、讲故事、解数学题的超智能 AI 聊天机器人——所面临的问题。随着这些模型试图理解越来越长的对话(比如一次性读完一整本小说),它们会卡在从储藏室向烤箱搬运数据的过程中。

为了解决这个问题,科学家们提出了一个聪明的想法,叫做“解构”(disaggregation)。他们不再强迫烤箱和储藏室挤在同一个小盒子里,而是将工作拆分:让烤箱负责重活——即混合和烘焙(数学运算),同时将大量的食材发送到一个独立的、巨大的储藏室中,那里配备了特殊的助手(称为 PIM,或存内计算),负责快速分类和提取食材。其初衷是通过拆分团队来提高整体效率。但转折在于:仅仅给储藏室配备更多的助手或更快速的货架,并不总能让蛋糕烤得更快。有时,储藏室因为规模太大而导致空间不足;有时,它又因为速度太快,反而让烤箱只能在那儿无所事事地干等着。

这时,来自上海交通大学的一个研究团队带着名为 CHIME 的新系统介入了。他们意识到,旧有的拆分方式缺少一条至关重要的规则:你不能只是让团队中的某一部分变得异常强大,你必须确保最弱的一环不会拖累所有人。他们发现,在这些拆分系统中,速度受限于哪种资源更稀缺——是储藏室的存储空间,还是它递送东西的速度。如果你有一个速度无限但只有一杯面粉的储藏室,你会陷入困境;如果你有一个装满面粉的仓库,但配送货车慢如蜗牛,你也同样会陷入困境。

该论文提出将 CHIME 作为一种平衡两者的解决方案。CHIME 并没有使用昂贵且微小的超高速储藏室(例如目前附着在高端显卡上的那种),而是使用了标准的、海量的计算机内存条(DIMM),并在其中升级了小型助手。这为系统提供了巨大的存储容量和良好的运行速度,且不会造成过度昂贵的成本。但仅仅插上这些新的内存条是不够的;研究人员必须发明一种新的数据组织方式,以确保助手们不会互相绊倒,并开发一套新的调度系统,以确保烤箱和储藏室始终同步工作,绝不会出现一方等待另一方追赶的情况。

通过详细的计算机模拟,作者发现这种新方法可以让 AI 的速度比目前使用那些微型、昂贵储藏室的最佳方法快上高达 5.15 倍。他们还证明了,单纯提高储藏室的速度或规模本身是行不通的;你必须让两者同时增长才能看到真正的收益。简而言之,CHIME 是一种更聪明、更平衡的方式来运行这些庞大的 AI 大脑,确保在其他部分忙得不可开交时,没有任何一部分团队是在原地闲站着无所事事的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →