RequestRouter: Request-Boundary Routing for Efficient Single-GPU LLM Inference
RequestRouter 是一个轻量级的请求边界控制器,它能为单 GPU 大语言模型(LLM)推理服务动态选择最优的推理模式(例如量化、投机采样或前缀缓存),在保持与全精度推理近乎一致的准确度的同时,实现显著的延迟和能耗降低,且几乎不产生额外开销。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代人工智能依赖大型语言模型来生成文本、回答问题和解决问题。这些系统功能强大,但同时也非常耗电。每当用户提出一个问题时,计算机必须进行数十亿次计算才能产生答案,这一过程消耗了大量能源并耗费了时间。对于运行这些系统的人来说,挑战在于如何让计算机工作得尽可能快,同时又不浪费电力。目前,大多数系统对每一个请求都使用单一且固定的设置,无论任务是简单还是复杂。这就像是在行驶过程中,无论你是跨越一个街区还是穿越整个国家,都让一辆重型卡车以高速在公路上行驶;虽然可行,但往往效率低下。研究人员现在正在寻找将计算机的设置与特定任务相匹配的方法,希望在不改变模型本身底层智能的情况下,节省能源并加快响应速度。
纽约大学的一个研究小组开发了一种名为 RequestRouter 的新方法来解决这个问题。该系统并没有强迫每个请求都经过同样缓慢且高能耗的过程,而是充当了一个轻量级的交通控制器。在计算机开始生成答案之前,这个控制器会查看关于请求的一些简单细节,例如用户问题的长度、预期答案的长度,以及该问题是否与近期其他问题具有共同的起始短语。基于这些线索,控制器会从现有的选项菜单中立即选择处理该特定请求最有效的方式。这些选项包括:使用较低精度的数值来运行模型以节省能源;使用一种通过预测下一个词来加速生成的技巧;或者重复利用已经计算过的对话部分。该系统并不重新训练模型或改变其架构;它只是从现有的工具中为当前的任务选择最合适的工具。
研究人员在一块用于运行这些模型的常用硬件——高性能图形显卡上测试了这个想法,使用的是一个标准的八十亿参数语言模型。他们进行了数千次测试,涵盖了从简短快速的交互到长篇复杂对话的不同类型的请求。他们将智能控制器的性能与使用单一、未经优化的设置处理所有任务的标准方法进行了对比。结果令人瞩目。平均而言,该控制器使系统的速度比标准方法快了两倍,而生成的每个词所消耗的能量不到一半。在一次更严谨的测试中,研究人员多次重复相同的请求以确保结果并非偶然,控制器仍然保持了近两倍的速度提升和显著的节能效果。该控制器在做出决策时也极其迅速,选择路径所需的时间不到五千分之一毫秒,这种延迟微小到用户几乎无法察觉。
至关重要的是,研究人员发现这些效率的提升并没有以牺牲质量为代价。他们在各种旨在衡量模型理解和回答问题能力的基准测试中对系统进行了测试。智能控制器保留了标准方法几乎所有的准确性,保留了超过百分之九十九的性能。这一点非常重要,因为某些更快速、更节能的方法有时会导致模型准确度下降。该控制器使用一种简单的基于规则的策略来避免这些陷阱,即将困难的问题路由到最可靠的设置,而将较简单的任务发送到更快、更高效的模式。研究还对比了他们简单的基于规则的控制器与试图利用人工智能来预测最佳设置的更复杂的学习系统。他们发现,复杂的系统在做出决策时要慢得多,增加的延迟抵消了节省下来的能量。事实证明,这种简单的、基于规则的方法是最实际的解决方案,在速度、能源和质量之间提供了最佳的平衡。
这项工作表明,未来高效人工智能的发展可能不需要构建更聪明的新模型或发明新的硬件。相反,通过仅仅关注进入请求的结构并将其与正确的处理模式相匹配,就可以取得显著的改进。研究人员证明,通过将不同的优化技术视为可选选项而非永久设置,他们可以回收大量的效率。这种方法在尊重输出质量的同时,大幅降低了运行这些系统的能源成本。它为使大型语言模型更具可持续性提供了一条清晰的路径,表明有时实现节能最有效的方法不是更努力地工作,而是通过为每个特定任务选择合适的工具来更聪明地工作。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。