← 最新论文
🤖 machine learning

Paris: A Decentralized Trained Open-Weight Diffusion Model

该论文介绍了 Paris,这是首个通过完全去中心化框架训练并公开发布的开源权重扩散模型,该框架利用隔离的专家模型和动态路由器,在无需同步梯度的情况下实现了高质量的文本到图像生成,同时与先前的基准相比,显著降低了对训练数据和计算资源的需求。

原作者: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:创造艺术不再仅仅是关于一位天才坐在工作室里,而是关于一个庞大的、全球性的艺术家团队在从未进行过交流的情况下共同协作。这就是“扩散模型”(diffusion modeling)这一领域的核心——这是一种人工智能技术,它通过从一片混乱的静态噪声云开始,通过一步步地将其细化为清晰的图像,从而学习如何创作图像,就像雕塑家凿去石头以显现出雕像一样。多年来,这个领域最大的障碍在于对“中央指挥中心”的需求。为了训练这些强大的AI艺术家,研究人员通常必须将数千台超高速计算机聚集在一个地方,通过昂贵的高速电缆连接在一起,让它们全部以完美的同步节奏工作。如果一台计算机掉队,整个团队都必须等待。这意味着只有最富有、资金最充足的机构才能构建出最好的图像生成器,让其他人望尘莫及。

于是,“Paris”诞生了。这是由 Bagel Labs 发起的一个新项目,它提出了一个大胆的问题:如果我们根本不需要那个中央指挥中心呢?如果我们能通过让许多较小的团队在完全隔离的状态下,在各自不同的国家、使用各自的电脑工作,并在最后才将他们的成果汇聚在一起,从而训练出一个世界级的 AI 艺术家呢?该论文将 Paris 呈现为第一个完全以此方式训练的公开发布的图像生成器,证明了你不需要超级计算机集群也能制作出美丽的画作。相反,它使用了一个巧妙的技巧:将 AI 拆分为一个专家团队,每个专家学习一种不同的风格,并配备一个聪明的“交通控制器”,在你请求一张图片时决定听从哪位专家的意见。

核心理念:一群孤独的天才

通常,训练一个庞大的 AI 就像试图让一个由 1,000 名歌手组成的合唱团完美地和谐共鸣。他们都必须站在同一个房间里,聆听指挥,并在有人走调时立即调整自己的声音。如果房间太大或麦克风反应太慢,整首歌就会崩溃。这就是传统 AI 训练发生的情况:数千个图形处理器(GPU)不断向彼此喊出它们的进度,在进入下一步之前等待所有人跟上。这既昂贵,又需要特殊的超高速网络,而且无法在混合了新旧型号的计算机上实现。

Paris 颠覆了这一局面。与其说是一个巨大的合唱团,不如想象成八位处于各自隔音室中的独唱家。他们从不互相交谈,从不共享乐谱,也从不等待他人完成。

  • 独唱家(专家): Paris 模型由八个较小的 AI“专家”组成。每个专家都在互联网图像库的不同切片上进行训练。一个可能只学习日落,另一个学习狗,还有一个学习建筑。他们在完全隔离的状态下进行训练,使用任何可用的硬件,即使一个是在美国的快速服务器上,而另一个是在欧洲较慢的机器上。
  • 交通控制器(路由): 由于这些专家在训练期间从不交谈,我们如何知道在当你输入“一只金毛寻回犬在草地上奔跑”时该使用哪一个?这就是“路由”发挥作用的地方。它是一个微小且轻量级的 AI,充当聪明的交通警察。当你给它一个提示词时,它会观察图像混乱、模糊的起始点,并迅速做出判断:“嘿,专家 3 最擅长画狗,让我们用他吧!”或者,“实际上,这个场景需要专家 3 和专家 5 的结合。”

它是如何运作的:“无需交谈”的魔力

Paris 的天才之处在于它处理训练数据的方式。研究人员使用了一个庞大的包含 1100 万张图像的数据集,并使用了一个智能工具(称为 DINOv2)根据图像的外观将它们分为八个不同的堆。然后,他们将每一堆发送给不同的专家。

  • 无需同步: 在普通的 AI 训练中,计算机必须不断停止并同步它们的“梯度”(类似于关于如何改进的笔记)。Paris 的专家则不然。他们只是在自己的时间、以自己的速度不停地训练、训练、训练。一个可能完成了 100,000 步,而另一个可能只到了 90,000 步。这并不重要。
  • 路由的任务: 路由是单独训练的。它学习观察一张带有噪声、模糊的图像,并猜测哪个专家最适合这种特定的噪声模式。它就像一位图书管理员,能根据你手里书本散发出的微弱气味,准确地知道该从哪排书架上取书。

他们的发现:更少的数据,更少的电力,同样的质量

团队将 Paris 与传统方法以及之前的分布式尝试进行了对比测试。结果出人意料地高效:

  • 资源节省: 与之前的最佳分布式方法相比,Paris 成功地使用 14 倍更少的训练数据(1100 万张图像而非 1.54 亿张)和 16 倍更少的 GPU-天(完成计算所需的时间量)训练出了高质量的模型。
  • “前二名”的惊喜: 当他们测试如何组合专家时,发现了一些有趣的现象。仅使用单个“最佳”专家(Top-1)效果不错,但使用前两位专家(Top-2)并将他们的结果混合在一起,实际上能产生最好的图片。
  • “全员参与”的错误: 有趣的是,尝试同时使用所有八位专家(Full Ensemble)反而会让图片质量变差。事实证明,让太多声音同时响起会产生噪音。论文表明,保持选择性是关键;你不需要整个合唱团,你只需要合适的独唱家。

为什么这很重要

论文总结道,你不需要一个价值数十亿美元的数据中心来构建一个世界级的图像生成器。通过让计算机独立工作并在最后才进行协调,Paris 证明了可以通过“异构硬件”——即由不同、更便宜且地理位置分散的计算机组成的混合系统——来构建高质量的 AI。这为研究人员和规模较小的公司打开了大门,使他们无需依赖那些直到现在仍作为该领域守门人的、大规模且同步的基础设施,就能训练出强大的模型。

简而言之,Paris 展示了你不需要强迫每个人步调一致来完成杰作,而是可以让每个人找到自己的节奏,然后在最后的谢幕时刻,由一位聪明的指挥家将他们汇聚在一起。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →