← 最新论文
💻 computer science

HetRoute Heterogeneous and Cost-aware Collaborative Routing Framework for Distributed Edge MoE Inference

本文提出了 HetRoute,一种用于分布式边缘 MoE 推理的协作路由框架,该框架将传输、计算和质量成本统一到一个模型中,以优化专家放置和在线路由,在保持质量约束的同时,显著降低了延迟和流量。

原作者: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Yuan, Ning Li, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图解决一个巨大的、复杂的拼图,但拼图碎片散落在不同房屋的各个角落。有些房子拥有超级快速的计算机,有些则很慢;有些房子通过光纤高速连接,而另一些则通过颠簸、缓慢的土路相连。在人工智能的世界里,当我们尝试运行大规模的“混合专家”(Mixture-of-Experts, MoE)模型时,情况正是如此。这些庞大的 AI 大脑在处理每个问题时并不使用其全部功能,而是只唤醒几个特定的“专家”部分来解决问题。挑战在于,如何确定该唤醒哪些专家以及将问题发送到哪里,才能让答案返回得最快,而不至于陷入交通拥堵或损失准确性。如果我们只是把问题发送到最近的房子,那里可能会因为计算机疲劳或硬盘已满而变慢;如果我们发送得太远,可能会卡在缓慢的道路交通堵塞中。科学家们一直试图寻找完美的路由方式,但以往的大多数方法就像是只盯着一辆车看的交警,或者只关心房子有多近,却忽略了道路的速度或内部计算机的状态。

本文介绍了一种更智能的新系统,名为 HetRoute。你可以把 HetRoute 想象成一个组织极其严密的快递服务,它不仅看某一个房子或某一条路,而是会同时观察单个拼图碎片在整个配送路径上的情况。它综合考虑了所有因素:房屋之间的道路速度、内部计算机的性能、计算机是否正处于忙碌状态(比如是否有人在排队)、甚至还考虑了计算机是否正在使用“压缩版”的拼图碎片以节省空间(这可能会使答案的完美程度略微下降)。Het-Route 为单个问题所需的整个专家组制定了一个统一的计划,而不是为每个专家分别做出贪婪的决策。通过这种方式,它发现自己可以让 AI 答案的到达速度平均提升 59.0%,并减少 58.0% 的最差情况延迟。它还减少了 72.1% 在房屋之间传输的数据量,同时保持了与原始未压缩版本几乎同样优秀的回答质量。

问题所在:“迷失方向”的智能 AI

为了理解为什么 HetRoute 如此重要,我们首先需要了解什么是“混合专家”(MoE)模型。想象一个巨大的图书馆,其中的每一本书都是某个特定领域的“专家”。当你提出一个问题时,图书馆并不会阅读所有的书,而是只取出与问题最相关的几本“顶级”(Top-k)专家书籍。这种方式非常高效,因为当你询问数学问题时,你不会浪费时间去读关于烹饪的书。

然而,在现实世界中,这些图书馆通常被拆分到许多不同的服务器(计算机)上,分布在不同的地方,例如靠近你的边缘服务器。当一个问题进来时,所需的“Top-k”专家可能分散在三个不同的服务器上。处理这种旧的方法就像是请一位朋友跑去三个不同的房子去拿三本书。如果你的朋友先跑向最近的房子,可能会发现书被锁在地下室(存储在慢速 CPU 上),必须等待钥匙。或者,他们可能会跑向一个很远的房子,那里有一本放在高速架子上的书(在快速 GPU 内存中),但通往那里的路却堵塞了。

以往的方法试图通过以下两种方式解决问题:

  1. 保持本地化: 总是尝试使用最近服务器上的专家,即使那个服务器很慢或很忙。
  2. 贪婪选择: 为每个专家单独挑选“最佳”服务器,却没意识到为专家 A 挑选的最佳服务器可能会迫使专家 B 进入一条糟糕的路径,从而拖慢整个小组的速度。

本文认为这些旧方法是有缺陷的,因为它们把专家视为独立的旅行者。实际上,他们是一个团队。如果一名团队成员变慢了,整个团队都会变慢。

解决方案:HetRoute 的“队长”

HetRoute 扮演着一位出色的团队队长角色,它会在任何人出发前就规划好整个任务。它使用了一个“统一成本模型”,这是一种高级说法,指它有一个单一的评分表,同时权衡四个不同的维度:

  1. 传输成本: 通过互联网将问题发送到服务器所需的时间。
  2. 加载成本: 如果专家不在那里,将其从慢速硬盘(CPU)移动到快速内存库(GPU)所需的时间。
  3. 计算与排队: 服务器思考的速度,以及问题在其他问题后面排队等待的时间。
  4. 质量惩罚: 如果服务器使用“压缩版”专家以节省空间,答案的质量会受到多大影响?

HetRoute 分两个阶段工作:离线阶段在线阶段

离线阶段(地图绘制者):
在提出任何问题之前,HetRoute 会观察网络并决定将专家副本放在哪里。它不仅仅是把专家放在最近的服务器上,它还会问:“如果我把这个专家的副本放在服务器 B 上,以后会节省时间吗?”它还会决定哪些专家应该住在快速的“GPU”内存中,哪些可以留在慢速的“CPU”内存中。至关重要的是,它会创建“冗余”副本。就像车里备有备胎一样,HetRoute 会在不同的服务器上放置热门专家的额外副本。这确保了如果某个服务器忙碌或损坏,队长仍有其他选择。

在线阶段(实时导航员):
当一个真实的问题到达时,HetRoute 不仅仅是挑选最近的服务器。它会观察该问题所需的整个专家组。它会问:“如果我把专家 A 发送到服务器 X,把专家 B 发送到服务器 Y,总共需要多少时间?”它会计算“瓶颈”——即团队中最慢的部分。如果服务器 X 很快但服务器 Y 陷入了交通堵塞,HetRoute 可能会决定将两个专家都发往服务器 Z,即使服务器 Z 稍微远一点,因为整个团队会一起更快地完成任务。

它使用了一种巧妙的技巧,叫做“束搜索”(beam search,类似于手电筒同时扫描几条最佳路径),以便在不陷入可能性迷宫的情况下找到完美的服务器组合。

结果:更快、更聪明、更安全

作者在一个包含 10 个具有不同速度和连接性的模拟边缘服务器网络上测试了 HetRoute。他们使用了三种不同的超大规模 AI 模型来观察其表现。

结果令人印象深刻:

  • 速度: 与现有的最佳方法相比,HetRoute 将获取答案的平均时间减少了 59.0%。它还减少了“尾部延迟”(即出现问题时的最差情况延迟)58.0%
  • 流量: 它减少了服务器之间传输的数据量 72.1%。这非常重要,因为通过互联网传输数据既慢又昂贵。
  • 吞吐量: 该系统每秒处理的问题数量比其他方法多出 2.13 倍
  • 质量: 尽管速度更快,但回答的质量依然保持得非常高。其“质量退化”(即答案变差的程度)被控制在极小的预设预算 2% 之内。

论文还通过数学证明了他们的系统是“质量安全”的。即使网络变得极其繁忙且正常的快速路径被阻塞,HetRoute 也有一个“回退”计划。它始终会将问题路由到一个“全精度”专家(最高质量版本)那里,而这个专家保证在某处存在,从而确保答案绝不会变差,哪怕这会多花一点时间。

为什么这很重要

本文表明,我们不必在速度与质量之间,或在本地计算与远程计算之间做选择。通过将 AI 专家视为一个协调的团队而非独立的奔跑者,并通过根据实时交通和计算机健康状况来规划整个路径,我们可以让强大的 AI 在网络的“边缘”(例如在你的手机或本地服务器上)流畅运行。HetRoute 表明,AI 的未来不仅在于构建更大的模型,还在于如何更聪明地移动它们。它将一个混乱、拥堵的网络变成了一台运转良好的机器,让每一位专家都清楚地知道该去哪里才能以最快速度完成任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →