← 最新论文
🤖 machine learning

DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs

本文表明,由退役二手硬件构建的 128 卡 GPU 集群能够经济地为 LLaMA-70B 等大语言模型提供服务,尽管其环境可持续性严格取决于是否部署在低碳电力地区,以抵消旧 GPU 较高的能耗。

原作者: Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zeyu Cao, Xuan Guo, Cheng Zhang, Cheuk Hang Lau, Ilia Shumailov, Yiren Zhao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人工智能领域目前正处于飞速发展的竞赛之中,其动力源自被称为 GPU 的大规模计算芯片,这些芯片充当了训练和运行复杂语言模型的引擎。这些模型可以编写故事、解决问题并进行对话,但它们需要巨大的计算能力。为了跟上步伐,数据中心不断升级硬件,将功能完好的芯片退役,以为更快、更新的芯片腾出空间。这种循环留下了大量性能尚可但已“过时”的加速器,从而创造了一个二级市场,这些被弃置的组件以其原始价格的一小部分被售出。研究人员和工程师面临的问题是:这些退役的机器能否被赋予第二次生命来服务现代 AI 任务,还是说它们的陈旧程度使其在效率和浪费方面变得过于低效而无法发挥作用。

一组研究人员试图通过完全使用二手零件从零开始构建一个大规模计算集群来回答这个问题。他们不仅仅是购买了二手显卡;他们采购了二手处理器、内存、主板和网络设备,构建了一个由 128 块退役 NVIDIA V100 GPU 组成的系统。这个被他们命名为“垃圾堆集群”(DumpsterCluster)的集合,旨在测试旧硬件是否能够处理运行大型语言模型的沉重工作负载,特别是名为 LLaMA-70B 的 700 亿参数模型。该团队花费了一年时间在真实环境中运行这个集群,处理实际的用户请求,以观察这种方法在经济上是否可行,以及在环境上是否可持续。他们的发现揭示了一个充满惊喜潜力的故事,但同时也附带了一个严格的条件:虽然硬件可以工作,但其成功完全取决于它被放置在哪里以及如何管理。

这种方法的经济案例非常引人注目。研究人员组装的整个 128 GPU 系统成本约为 22,000 美元,由于市场贬值,这一价格在研究过程中已从 32,000 美元下降。相比之下,一个仅包含八块最新一代 GPU 的现代系统成本约为 600,000 美元。这种巨大的前期成本差异意味着,尽管旧芯片的单体性能较弱,但由于其数量庞大,该集群可以处理大量的数据。通过运行该系统一年,团队证明了他们可以有效地服务于大型语言模型,实现文本生成的速度虽然比最新的超级芯片慢,但对于许多实际应用而言已经足够。成功的关键不仅在于购买零件,还在于重写运行它们的软件。

用于运行这些模型的标准软件是为拥有极快芯片间连接的新型硬件设计的。DumpsterCluster 中的旧款 V100 芯片连接速度较慢且内存较少,这通常会导致它们在处理大型模型时发生阻塞。为了解决这个问题,研究人员开发了一种定制引擎,改变了任务分配的方式。他们没有尝试让芯片不断地进行通信,而是重新排列了模型,使每个芯片处理计算中的特定部分,形成一条长链,并将结果向下传递。他们还优化了系统,使计算机的中央处理器在后台处理数据传输,同时让图形芯片保持工作,从而防止系统处于闲置状态。这种策略使得 128 块旧芯片能够作为一个单一的、具有凝聚力的单元运行一个在单个芯片上根本无法容纳的模型。

然而,这项研究表明,这种解决方案并不是解决 AI 行业能源和环境问题的万能药。研究人员发现,虽然前期成本很低,但运行机器的长期成本很大程度上取决于电价和电力来源。旧芯片的能效低于现代芯片,这意味着生成相同数量的文本时,它们消耗的功率更多。如果这个集群运行在电力来自化石燃料的地区,那么每生成一个单词所产生的总碳排放量可能会比使用新型高效系统高出数十倍。如果使用的电力是不洁净的,那么回收利用硬件带来的环境效益就会被完全抵消。只有当该系统位于拥有充足、廉价且清洁能源(如风能或水电)的地区时,这种方案才真正具有可持续性。在这些特定地点,低廉的电价抵消了旧芯片的低效率,使得总拥有成本较低,且碳足迹处于可控范围。

硬件的可靠性也带来了挑战,团队必须对其进行管理。在一年间,该集群经历了多次技术故障,但绝大多数都是可以通过简单重启而非物理修理来解决的软件故障。真正的硬件故障(即芯片或组件实际损坏)非常罕见,在所有事故中占比不足 14%。这表明,通过仔细测试并预留一些额外的容量来应对故障,二手硬件完全可以达到生产使用的可靠性水平。研究人员指出,该系统最适合用于回答问题和生成文本,而不是从头开始训练新模型,因为后者需要不同类型的计算能力和稳定性。

最终,这篇论文证明,赋予退役技术第二次生命是可能的,但这并非仅仅是将旧零件插上即可。这种“垃圾堆集群”的成功依赖于工程、经济和地理之间的微妙平衡。它需要专门的软件来克服陈旧硬件的局限性,需要一个拥有廉价且清洁电力的位置来降低运行成本和排放,并且需要对比全新系统稍高的维护率有足够的容忍度。当这些条件满足时,这种方法为在不持续制造新芯片所带来的巨大财务和环境成本的情况下扩大 AI 能力提供了一条可行的路径。它暗示了一个未来,即只要我们愿意将正确的工具与正确的能源相匹配,就可以延长计算硬件的生命周期。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →