FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy
FluxBin 是一个算法-算子协同设计框架,它结合了一种新颖的解耦二进制分解方法与一种使用查找表和虚拟列映射的专用 CUDA 算子,旨在实现超低比特的大语言模型推理,同时在保持高准确度的同时显著提升速度、节省能耗并减少内存占用。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是能够编写故事、解决问题并进行对话的强大计算机程序,但它们也带来了巨大的物理成本。运行这些模型需要海量的计算机内存和能量,通常需要极少数人才能获得的专门且昂贵的硬件。这是因为模型将它们的知识存储在巨大的数字网格中,而将所有这些数字以其原始的高精度形式保留下来会占用过多的空间。科学家们长期以来一直试图通过压缩数字来缩小这些模型,就像将一张高分辨率照片转换为较小的文件一样。这种压缩的一个极端版本是将数字简化到最简单的形式,仅使用两个数值,本质上将其转变为一系列“开”与“关闭”的开关。从理论上讲,这应该使模型变得极其快速且高效,但在实践中,计算机在处理这些简化后的数字时会遇到困难,要么导致速度变慢,要么导致精度下降。将简化后的数字转换回可用格式的过程往往耗时过长,以至于抵消了任何速度上的提升,使得模型依然和以前一样缓慢。
一支研究团队现在找到了一种打破这一僵局的方法,创造出一种新方法,允许这些超简化的模型在不损失思考清晰度的前提下高速运行。他们开发了一个名为 FluxBin 的系统,该系统通过改变计算机读取模型内存的方式来发挥作用。该系统不再尝试在每次模型需要进行计算时都将简化后的数字转换回复杂的数字,而是使用了一个预制的查找表(lookup table)。想象一个图书馆,你不需要阅读每一本书来寻找答案,只需在书架上查找一个代码,就能立即得到最终答案。研究人员构建了一个专门的计算机程序,该程序以一种对模型最重要部分进行额外照顾的方式来创建这些查找表,确保关键信息在压缩过程中不会丢失。他们还设计了一种新的数据组织方式,使计算机可以流畅地访问数据,从而避免了在读取稀疏或分散信息时通常会发生的“交通拥堵”。
这项工作的成果意义重大,因为它证明了极度压缩并不一定以牺牲速度为代价。当研究人员在高性能计算机芯片上测试该系统时,发现它可以在单张标准显卡上运行一个通常需要巨大内存的海量模型。该系统生成文本的速度比标准、未压缩版本的模型快了近六倍。此外,由于计算机进行的重体力劳动更少,移动的数据也更少,因此其能耗降低了约十倍。这种效率意味着,以前只能在单台机器上运行的庞大模型,现在可以有效地在单机上运行并操作,为在资源有限的地方使用更强大的人工智能打开了大门。
这种方法的成功依赖于数据压缩方式与计算机硬件指令读取方式之间的仔细平衡。研究人员意识到,仅仅将一切变得简单是不够的;他们必须识别哪些部分的模型对误差最为敏感,并对它们进行区别对待。他们创建了一种方法,将模型的知识分为一个通用的、简化的基础和一个针对最重要部分的特殊、详细的笔记。这种混合方法确保了模型在保持智能的同时,仍能从简化格式中获益。通过将这种智能压缩策略与直接在计算机处理器上运行的定制程序相结合,他们消除了以往尝试中一直存在的缓慢转换步骤。该系统通过将简化数据直接映射到预先计算的结果,从而让计算机能够跳过数学运算,直接获取答案。
在实验中,团队在几种不同版本的语言模型上测试了他们的方法,范围涵盖了从小型模型到拥有数十亿参数的巨型模型。在每种情况下,新系统都实现了速度的剧增和能耗的大幅降低。对于测试过的最大模型,该系统能够在单张计算机卡上运行,而标准版本则会因为内存不足而完全无法运行。模型的准确性保持在高水平,与其他需要耗费大量时间和计算能力进行设置的先进方法性能相当。研究人员指出,他们的方法无需重新训练模型,这意味着它可以立即应用于现有系统。这表明,在日常硬件上运行强大的人工智能不再是一个“是否可能”的问题,而是一个关于使用正确工具来释放已有潜力的课题。
这项工作的意义不仅在于让模型变得更快,它还从根本上改变了软件与硬件之间的关系。多年来,该领域一直陷入了一个循环:设计出的新算法在理论上是高效的,但在实践中却无法实现,因为硬件无法跟上步伐。这种新方法通过将算法和硬件指令协同设计,弥合了这一差距,确保过程中的每一步都针对其运行的具体机器进行了优化。研究人员证明,通过仔细管理数据的存储和访问方式,可以实现此前被认为对于此类高度压缩模型而言难以企及的性能水平。随着人工智能变得越来越庞大和复杂,这类方法对于使这些技术在从个人设备到大规模数据中心等更广泛的应用场景中变得触手可及且具有实用性至关重要。这项工作表明,通过巧妙的数学与高效工程的结合,可以克服现有技术的局限性,从而迎来一个强大的智能不再是奢侈品,而是标准工具的未来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。