← 最新论文
💻 computer science

Towards Distributed Inference of LLMs on a P2P Network

本文提出了一种用于对等网络(P2P)大语言模型(LLM)服务的去中心化、前缀缓存感知路由方案,该方案利用本地基数树(radix trees)和异步节点元数据,将请求路由至具有最长匹配前缀的节点,从而在无需中心化协调或 KV 缓存传输的情况下降低推理延迟。

原作者: Shabari S Nair, Krishanu Saini

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Shabari S Nair, Krishanu Saini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在经营着一个巨大的知识图书馆(一个大型语言模型),它能帮助人们编写故事、回答问题和解决问题。每当有人提出问题时,图书馆在开始给出答案之前,必须先对请求的第一部分进行“思考”。这个“思考”阶段既慢又耗能。

然而,经常会有许多人的问题以完全相同的词语开头——比如“这是一个关于猫的故事……”或者“将这句话翻译成法语”。在一个聪明的图书馆里,一旦那些开头词语的“思考”过程完成,图书馆就会将这些工作成果保存在一个临时笔记本中(称为 KV Cache),这样下次有人提问时就不必重做一遍。这被称为 前缀缓存(Prefix Caching)

问题:“单一图书馆”的瓶颈

在传统的设置中,你可能有一个巨大的图书馆大楼,里面有很多书架(节点)。如果有一个新来的人,中央管理员会决定将他送到哪个书架。

  • 问题在于: 如果管理员把一个人送到了书架 A,但他们问题的“思考”成果却保存在书架 B 上,那么书架 A 就必须从头开始。管理员必须不断检查每一个书架,看看笔记都存在哪里。如果管理员变得太忙或者崩溃了,整个图书馆都会变慢。
  • 另一种选择: 一些图书馆尝试将笔记从书架 B 立即复制到书架 A。但这些笔记可能非常庞大(就像搬运整排书架一样),在它们之间移动需要耗费大量的时间和带宽。

解决方案:点对点的“流言”网络

这篇论文提出了一种运行这个图书馆的新方法:没有中央管理员。 相反,每个书架(节点)都是自己的图书管理员,他们直接彼此交流。

以下是它是如何运作的,使用一个简单的类比:

1. “基数树”(Radist Tree,图书管理员的心智地图)
每个图书管理员都保存着一份关于他们最近回答的问题以及他们保存的笔记的心智地图(基数树)。

  • 例子: 图书管理员爱丽丝知道她拥有关于“如何烤蛋糕”的笔记。图书管理员鲍勃知道他拥有关于“如何修理自行车”的笔记。

2. “流言”(反熵/Anti-Entropy)
与其由一个中央老板告诉所有人正在发生什么,不如让图书管理员们互相“传闲话”。每隔几秒钟,他们就会向邻居低声传递一个简短的摘要:“嘿,我刚刚保存了关于‘烘焙’的笔记。”

  • 他们不会发送沉重的笔记(实际的数据);他们只是发送一个关于他们涵盖了哪些主题的微型列表。
  • 这在后台进行,因此不会减慢实际的工作进度。

3. 做出决策(路由/Routing)
当一个带着类似“如何制作巧克力蛋糕”请求的新客户走进来时,第一个看到他的图书管理员会检查自己的心智地图。

  • 他会问:“还有谁有关于‘烘焙’的笔记?”
  • 如果他听到邻居说鲍勃拥有关于“烘焙”的笔记,他就会把客户送到鲍勃那里。鲍勃可以跳过“思考”阶段,直接给出答案。
  • 如果他的地图有点陈旧(过时)导致他把客户送错了人,这并不是灾难。那个错误的人只需要从头开始“思考”即可。答案依然是正确的,只是稍微慢了一点。正确性永远不会丢失,丢失的只是速度。

4. 处理人群(热点/Hotspots)
如果每个人都想了解“烘焙”怎么办?鲍勃成为了“烘焙专家”,并且变得不堪重负。

  • 系统有一个安全阀:如果鲍勃太忙了,他会向其他图书管理员低声说:“我满了!”
  • 其他图书管理员随后会停止在一段时间内将烘焙请求发送给鲍勃,而是让鲍德处理完手头的工作,并将新的请求发送给其他人,由后者从头开始进行“思考”。

实验展示了什么

研究人员在一个包含四个“图书管理员”并使用通用知识数据集(MMLU)的计算机模拟中测试了这个想法。

  • 快速网络获胜: 如果图书管理员之间可以快速“传闲话”(低网络延迟),这个系统会比没有任何路由机制的系统快得多。它通过复用“思考”的工作节省了大量时间。
  • 慢速网络落败: 如果“传闲话”耗时过长(高网络延迟),那么发送请求到正确人员所花费的时间将长于你自己动手做这项工作的时间。
  • 专业化: 系统会自然地产生“专家”。如果某个话题很受欢迎,一个节点最终会囤积所有相关笔记,从而成为该特定话题的超级专家。然而,如果笔记变得太大,系统会自动踢出旧笔记以腾出空间,导致“专家”的角色随时间而变化。

核心结论

这篇论文表明,对于分布式 AI 系统,我们不需要一个沉重的中央老板或昂贵的数据传输。相反,我们可以使用一种去中心化的、基于流言(gossip-based)的系统,其中的节点共享轻量级的地图,说明自己知道什么。

  • 优点: 它具有韧性(如果一个节点坏了,其他节点仍能继续工作),扩展性好,并且避免了移动大量数据。
  • 缺点: 它只有在网络速度快且问题具有高度重复性(例如许多人在问类似的问题)时才有效。如果网络很慢或者问题都是完全独特的,该系统就无法获得太多速度上的提升。

简而言之,这就像一群朋友在分享一个播放列表。与其由一个人管理整个列表,不如每个人都告诉其他人他们有哪些歌曲。如果你想要一首歌,你就去找那个拥有这首歌的朋友。如果他们没有,你就自己播放即可。这虽然有点乱,但当大家都在听同样的流行歌曲时,效果非常好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →