Ada-MK: Adaptive MegaKernel Optimization via Automated DAG-based Search for LLM Inference
Ada-MK 是一种新颖的优化框架,它通过编译时基于有向无环图(DAG)的搜索与内存拆分,消除了运行时动态调度并降低了共享内存占用,从而实现了 MegaKernels 在商业在线广告系统中的首次工业级部署,在 NVIDIA GPU 上相比 vLLM 实现了高达 50.2% 的吞吐量提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在运营一家为大型在线商店(如搜索引擎或广告平台)提供的高速配送服务。每当客户提出一个问题,你的系统就必须逐字生成回复。在大语言模型(LLM)的世界里,这被称为“推理”。
问题在于,每生成一个单词,你的计算机都必须向图形处理器(GPU)发送数千条微小的指令。这就像一名配送司机为了仅仅一句话,不得不反复执行以下操作:在邮局停下、取件、开车到仓库、卸货、再开回来,如此循环数千次。这种“走走停停”的开销浪费了大量时间——大约 15% 的总行程时间都花在了这些微小的停顿上,而非实际送货。
核心构想:“巨型内核(MegaKernel)”
为了解决这个问题,研究人员发明了一个名为**巨型内核(MegaKernel)**的概念。与其为每一项微小任务都在邮局停下,不如想象一辆超高效的配送卡车:它在出发时一次性取走所有所需物品,全程不停车直达,并在最后一次性卸货。它将所有那些微小的停顿融合为一次巨大而连续的旅程。这消除了“走走停停”的延迟。
然而,这里有一个限制。该公司(NVIDIA)所使用的特定卡车类型(Ada/L20 架构 GPU),其驾驶室比更新、更高级的卡车(Hopper/Blackwell 架构)更小,储物空间也更有限。
- 旧方案 1(手工调优): 专家手动为这种特定的小驾驶室定制了一辆卡车。它很快,但如果你更换了货物(AI 模型)或道路(硬件),这辆卡车就会出问题。它不具备可移植性。
- 旧方案 2(自动调优): 他们尝试建造一辆能在行驶中自动调整 cargo 空间的卡车。但司机必须在驾驶过程中不断查看地图并做出决策(“货架满了吗?我该停下吗?”)。这些不断的决策拖慢了卡车的速度,而在需要毫秒级交付的场景下,这是不可接受的。
新方案:Ada-MK
本文的作者创建了Ada-MK,这是一个为较小的"Ada"卡车解决上述问题的新系统。以下是他们如何做到的,使用了简单的类比:
1. “智能装箱”策略(自适应共享内存)
这辆小卡车有一个极小的储物舱(共享内存)。如果你试图装入太多东西,卡车就会停滞。
- 创新点: 他们不再试图将整个行李箱塞进狭小的储物舱,而是将行李箱切成两半(K 维度拆分)。他们只装入一半的物品,送达后,再装入另一半。
- 结果: 这将所需的峰值存储减少了50%。他们还找到了方法,在卸下一件包裹后立即复用空出的空间来装载下一件,确保卡车永远不会因等待空间而闲置。
2. “预先规划路线”(离线 DAG 搜索)
旧的“自动调优”卡车在行驶过程中做决策,这导致了交通拥堵(分支惩罚)。
- 创新点: 团队利用一台强大的计算机,在卡车离开车库之前模拟了数百万种可能的路线。他们在一张详细的图表(有向无环图,DAG)中规划了每一个转弯和停靠点。
- 结果: 一旦找到最佳路线,他们将其“固化”。司机在驾驶时不再需要思考或查看地图;他们只需完美地遵循预先规划的路径。这消除了所有决策延迟,使行驶过程极其顺畅和快速。
3. “混合车队”(异构引擎)
他们意识到,对于行程的某些部分(在开始时加载大量包裹,称为“预填充/Prefill"),旧的标准卡车实际上更好。但对于最后的配送(逐字生成,称为“解码/Decode"),他们新的巨型内核卡车则更胜一筹。
- 创新点: 他们构建了一个混合系统。他们在开始阶段的重体力劳动中保留标准卡车,但在最后的配送阶段无缝切换到他们的新巨型内核卡车。
- 结果: 你得到了两者的最佳组合:开始阶段的高速和结束阶段的超低延迟,而无需重建整个配送网络。
现实世界的影响
团队在百度商业在线广告系统上测试了这项技术。
- 速度: 在速度至关重要的场景(小批量、短回复)中,他们的系统比标准行业工具快23.6%,比流行的开源工具 vLLM 快50.2%。
- 可靠性: 它在不同类型的 AI 模型和任务中表现一致。
- 首创性: 这是“巨型内核”首次成功部署于真实的、在线的商业广告系统中。
总结
本文描述了一种方法,使 AI 聊天机器人和广告系统在特定的、较小的计算机芯片上运行得更快。他们通过更高效地打包数据、预先规划整个配送路线(使司机无需思考)以及将新的高速配送方法与现有工具相结合来实现这一目标。其结果是一个能显著更快地提供答案的系统,特别是在许多用户逐一提问时。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。