← 最新论文
🤖 machine learning

OrderMoE: An expert similarity driven distributed edge MoE inference

OrderMoE 是一个新颖的框架,它通过利用专家相似性来实现远程专家的本地替代,从而在保持可控推理质量的同时,显著降低分布式边缘 MoE 推理的延迟和通信开销。

原作者: Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Athanasios V. Vasilakos, Song Guo, Haijun Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,互联网就像一座繁忙、喧闹的大城市,超级聪明的计算机(被称为大语言模型)就生活在其中。这些计算机就像是才华横溢的图书管理员,可以回答任何问题、编写故事或解决数学难题。然而,这些图书管理员体型庞大且沉重,无法装进你的手机或当地咖啡馆的电脑里。通常情况下,为了得到一个答案,你的手机必须向城市另一端的巨型数据中心大声喊出一个问题,等待那位巨大的图书管理员思考,然后再等待答案传回。这既耗时,又占用了大量的城市“道路空间”(带宽)。

为了提高速度,科学家们发明了一种新型的图书管理员,叫做“混合专家模型”(Mixture of Experts,简称 MoE)。这种图书管理员不再是一个巨大的大脑,而实际上是由许多较小的专家组成的团队。当你提出一个问题时,一位聪明的经理(被称为路由器)会快速挑选出针对该特定任务所需的两到三个专家,并忽略其余的人。这使得图书管理员变得更快、更轻量化。但棘手的部分在于,在分布式边缘系统中,这些专家散落在不同的本地服务器上(比如不同的咖啡馆或社区枢纽),而不是集中在一个大型建筑内。如果路由器挑选的专家正在三个小镇之外的一家咖啡馆工作,你的手机就必须把问题传送到那么远的地方,并等待答案传回。在道路狭窄拥挤的城市里,这种往返时间可能和向那个巨型数据中心说话一样慢。

这正是名为 OrderMoE 的一项新研究发挥作用的地方。研究人员利用一个由八台物理服务器组成的真实测试平台,提出了一个简单而巧妙的问题:如果我们不总是将问题发送给路由器选中的那个“精确”专家,而是可以使用一个就在隔壁、且能做几乎同样工作的“不同”专家呢?

论文指出,尽管许多专家名字不同,但他们的思维方式其实非常相似。作者发现,通过测量他们“思维模式”的相似度(使用所谓的“路由器诱导逻辑值”,router-induced logits),可以将这些专家归类为不同的家族。如果路由器选中了一个远在天边的专家,OrderMoE 会检查附近是否有一个足够相似的“表亲”专家可以胜任这项工作。如果有,问题就会在本地处理,从而节省了跨越城市长途跋涉的时间。

然而,研究人员知道这是一场微妙的平衡。使用“表亲”代替“精确专家”可能会节省时间,但也可能意味着答案不是“完全完美”的。为了解决这个问题,他们构建了一个智能交通控制器,它会为每一个问题做出决定:是使用本地的表亲专家比较安全,还是值得等待远方那个精确专家的回复。这个控制器还会向前瞻,思考下一个问题可能需要去哪里,以免不小心把问题发往一个会对“下一步”造成不良影响的服务器。

当他们在包含不同速度和内存大小的八台服务器的真实网络上测试 OrderMoE 时,结果令人印象深刻。与其它方法相比,该系统成功地将平均等待时间(延迟)降低了约 40% 到 51%,并大幅削减了服务器之间传输的数据量。或许最重要的一点是,回答的质量几乎没有下降——仅有极微小、几乎察觉不到的下降。这项研究表明,通过让本地服务器替换使用相似的专家,我们可以让人工智能变得更快、响应更及时,而无需建造更大、更昂贵的数据中心。这有点像是意识到你并不需要开车去隔壁小镇买一种特定类型的三明治;你家楼下的店就有一种非常相似的,而且几秒钟内就能准备好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →