← 最新论文
🤖 AI

Pre-Compiled Pipeline Shards for Distributed LLM Inference on Intel AI PC Fleets

本文提出了一种分布式推理系统,该系统利用分布在多台闲置 Intel AI PC 上的预编译 OpenVINO 流水线分片,通过优化的图融合、投机采样解码以及请求交错技术,实现了对超过单设备显存限制的大型语言模型(参数量高达 70B)的交互级速度执行及高吞吐量。

原作者: Tate Berenbaum, Muthaiah Venkatachalam

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Tate Berenbaum, Muthaiah Venkatachalam

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代计算领域,一种新型个人电脑已经出现,它们配备了专为人工智能设计的强大处理器。这些机器通常出现在时尚的笔记本电脑中,内置了可以运行大型语言模型(能够进行写作、推理和对话的程序)的专用芯片。然而,单台机器存在一个硬性限制:其内存太小,无法容纳最先进模型的庞大“大脑”,因为这些模型所需的存储空间远超任何单一设备所能提供的极限。传统上,为了运行这些巨型模型,用户不得不依赖遥远且昂贵的云端服务器,通过互联网发送问题并等待回复。这产生了一种对外部基础设施的依赖,并引发了对数据隐私的担忧,因为敏感信息必须离开本地机器。研究人员面临的问题是:是否可以通过将一群普通的、闲置的个人电脑通过标准的办公网络连接起来,使它们协同工作,从而运行一个对于任何单台机器来说都过大的模型,同时还能保持数据留在本地并让响应速度足以进行真实的对话。

一个研究团队致力于通过构建一个系统来回答这个问题,该系统将一个大型人工智能模型拆分为较小的部分,并将每一部分分配给一小队电脑中的一台。想象一本非常厚重、一个人无法搬动的书;与其尝试独自抬起它,不如让一群人排成一列,每人拿着一个章节。随着故事的展开,第一个人阅读他们的章节,并将上下文传递给下一个人,下一个人接着阅读自己的章节,依此类比,直到最后一个人完成句子。在这个系统中,“章节”是人工智能模型的层,而“传递”是通过标准网络连接实现的。研究人员发现,仅仅这样拆分模型是不够的;计算机之间的交接速度太慢,而且检查工作的过程过于笨拙,导致系统反应迟钝。为了解决这个问题,他们开发了三种特定的技术,将一个缓慢的实验性设置转化为了一个快速、可用的工具。

第一个突破涉及在模型组件被启动之前如何进行准备的细微变化。当研究人员最初将模型层导出以在计算机的图形芯片上运行时,软件遗漏了一个通常能加速运行的关键优化。通过在每个部分的编码中注入一条特定的、简单的指令,他们解锁了图形处理器中隐藏的效率。这一小小的调整使得拆分后的部分运行速度几乎与在单台机器上运行的原始未拆分模型一样快。如果没有这个修复,系统的速度会显著降低,但有了它,性能差距几乎消失了,证明了可以在不牺牲速度的情况下对模型进行拆分。

第二个挑战是处理用于加速人工智能思考的“草拟”过程。通常,一个更小、更快的模型会猜测接下来的几个词,然后由主模型进行检查。如果猜测错误,主模型必须丢弃错误的猜测并重新开始。在这些电脑所使用的专用芯片上,丢弃错误猜测的标准方式极其缓慢,每次纠错需要近半秒钟——这足以破坏对话的流畅度。研究人员发现了一个聪明的变通方法:他们并没有从计算机内存中物理删除错误的猜测,而是简单地告诉人工智能忽略它们。通过在后台数据中将错误的猜测标记为不可见,系统实现了与删除完全相同的结果,但耗时仅为原来的极小部分。这使得系统能够使用更快的草拟技术而不会产生惩罚性的延迟,让人工智能的感觉更加灵敏。

第三项创新允许系统同时为多人服务。在标准设置中,当队列中的一台计算机正在工作时,其他计算机往往处于闲置等待状态。研究人员设计了一种方法,让计算机可以同时处理来自不同用户的请求。当一台计算机正在为用户 A 完成一个句子时,队列中的下一台计算机已经可以开始为用户 B 开始一个句子。这种任务交织的方式让机群中的每台机器都保持忙碌,有效地倍增了总速度。结合另外两个修复方案,这种方法使得两台计算机组成的机群服务两名用户的速度,几乎是单台计算机服务一名用户的两倍。

研究结果是在由三台高端笔记本电脑组成的机群通过标准 Wi-Fi 网络连接的情况下测量的。在测试中,运行热门 80 亿参数模型的两台计算机设置,为两名用户提供服务的速率接近每秒 44 个单词,这足以进行自然、互动的对话。这比单台计算机为一名用户运行同一模型的速度快了 1.79 倍。更令人印象深刻的是,当研究人员模拟了缓慢的远程互联网连接时,该系统仍然可用,而未经优化的相同设置则变得过于缓慢而无法实际使用。该系统还成功扩展到了运行一个庞大的 700 亿参数模型,而这个规模是机群中任何单台计算机都无法独立承载的。通过将这个巨型模型拆分到四台计算机上,团队实现了交互式速度,证明了一组消费级设备可以处理以往只能由大型数据中心承担的任务。

该研究还探讨了系统在不同条件下的表现。他们发现,网络的传输速度不如计算机之间交接的效率重要。当连接速度较慢时,系统通过在单次处理中处理更多单词来进行补偿,从而平滑了延迟。他们还在真实的广域网连接(跨越互联网)上测试了系统,结果证实,通过适当的优化,即使在计算机相距甚远的情况下,机群仍能保持稳定的对话速度。研究人员指出,虽然该系统运行良好,但它依赖于计算机处于受信任的环境中,因为它不包含加密或身份验证等内置安全功能。此外,他们观察到,在持续使用期间,计算机产生的物理热量最终可能会减慢其速度,这是在实际部署中需要管理的一个因素。

最终,这项工作表明,运行强大人工智能的障碍不仅在于硬件,还在于如何使用硬件。通过重新思考模型拆分的方式、纠正错误的方式以及服务多用户的方式,一小组普通的计算机可以作为一个强大的整体机器运作。研究人员向公众开放了他们的代码和数据,以便他人验证结果并基于该系统进行开发。研究结果表明,在不久的将来,组织可以利用现有的计算机运行自己的私有、高速人工智能集群,实现数据本地化并减少对外部云服务的依赖。该系统证明,凭借正确的软件,可以利用一群闲置机器的集体力量来解决那些曾被认为需要超级计算机才能解决的问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →