← Nieuwste papers
🤖 machine learning

Paris: A Decentralized Trained Open-Weight Diffusion Model

Het artikel introduceert Paris, het eerste publiekelijk vrijgegeven open-weight diffusiemodel dat volledig is getraind via een gedecentraliseerd framework dat geïsoleerde expertmodellen en een dynamische router gebruikt om hoogwaardige tekst-naar-afbeelding generatie te bereiken zonder gesynchroniseerde gradiënten, terwijl de vereisten voor trainingsdata en rekenkracht aanzienlijk worden verminderd in vergelijking met eerdere baselines.

Oorspronkelijke auteurs: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

Gepubliceerd 2026-08-03
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhiying Jiang, Raihan Seraj, Marcos Villagra, Bidhan Roy

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin het creëren van kunst niet alleen draait om één enkel genie in een studio, maar om een enorm, wereldwijd team van kunstenaars die samenwerken zonder ooit met elkaar te hoeven praten. Dit is de kern van een veld genaamd "diffusiemodellering", een type kunstmatige intelligentie dat leert om afbeeldingen te creëren door te beginnen met een chaotische wolk van statische ruis en deze stap voor stap te verfijnen tot een helder beeld, net zoals een beeldhouwer steen wegbeitelt om een standbeeld te onthullen. Jarenlang was de grootste hindernis in dit veld de noodzaak van een "centraal commando centrum". Om deze krachtige AI-kunstenaars te trainen, moesten onderzoekers meestal duizenden supersnelle computers op één plek verzamelen, verbonden door dure, hogesnelheidskabels, die allemaal in perfecte pas werkten. Als één computer vertraagde, moest het hele team wachten. Dit betekende dat alleen de rijkste, best gefinancierde instellingen de beste beeldgeneratoren konden bouwen, waardoor de rest buiten spel werd gezet.

Maak kennis met "Paris", een nieuw project van Bagel Labs dat een gedurfde vraag stelt: Wat als we dat centrale commando centrum helemaal niet nodig hebben? Wat als we een wereldklasse AI-kunstenaar kunnen trainen door veel kleinere teams in totale isolatie te laten werken, op hun eigen computers, in verschillende landen, en hun werk pas aan het einde samen te brengen? Het paper presenteert Paris als de eerste publiekelijk vrijgegeven beeldgenerator die volledig op deze manier is getraind, waarmee wordt bewezen dat je geen supercomputercluster nodig hebt om prachtige plaatjes te maken. In plaats daarvan gebruikt het een slimme truc waarbij de AI wordt opgesplitst in een team van specialisten, die elk een andere stijl leren, en een slimme "verkeersregelaar" die beslist naar welke specialist hij luistert wanneer je om een plaatje vraagt.

Het Grote Idee: Een Team van Solitaire Genieën

Normaal gesproken is het trainen van een enorme AI alsoAct te proberen een koor van 1.000 zangers perfect te laten harmoniseren. Ze moeten allemaal in dezelfde kamer staan, naar een dirigent luisteren en hun stemmen direct aanpassen als iemand vals zingt. Dit is wat er gebeurt bij traditionele AI-training: duizenden grafische kaarten (GPU's) schreeuwen constant hun voortgang naar elkaar en wachten tot iedereen heeft ingehaald voordat ze naar de volgende stap gaan. Het is duur, vereist speciale hogesnelheidsinternet en is onmogelijk te doen met een mix van oude en nieuwe computers.

Paris draait het scenario om. In plaats van één groot koor, stel je een groep van acht solisten voor, die elk in hun eigen geluidsdichte kamer zitten. Ze praten nooit met elkaar, delen nooit hun bladmuziek en wachten nooit op de anderen om klaar te zijn.

  • De Solisten (De Experts): Het Paris-model bestaat uit acht kleinere AI-"experts". Elke expert wordt getraind op een andere deel van de afbeeldingenbibliotheek van het internet. De een leert misschien alleen over zonsondergangen, een ander over honden, en een derde over architectuur. Ze trainen in volledige isolatie, op de beschikbare hardware, zelfs als de een op een snelle server in de VS staat en de ander op een langzamere machine in Europa.
  • De Verkeersregelaar (De Router): Omdat deze experts tijdens de training nooit met elkaar praten, hoe weten we dan welke we moeten gebruiken wanneer je typt "een golden retriever die door een weide rent"? Dat is waar de "router" om de hoie komt. Het is een kleine, lichte AI die werkt als een slimme verkeersregelaar. Wanneer je een prompt geeft, kijkt het naar het rommelige, ruisende startpunt van de afbeelding en beslist snel: "Hé, Expert 3 is het beste in honden, laten we die gebruiken!" of misschien: "Eigenlijk heeft deze scène een mix nodig van Expert 3 en Expert 5."

Hoe het Werkt: De Magie van "Niet Praten"

Het genie van Paris ligt in de manier waarop het de trainingsdata afhandelt. De onderzoekers namen een enorme dataset van 11 miljoen afbeeldingen en gebruikten een slimme tool (genaamd DINOv2) om ze in acht verschillende stapels te sorteren op basis van hoe ze eruitzien. Daarna stuurden ze elke stapel naar een andere expert.

  • Geen Synchronisatie: Bij normale AI-training moeten de computers constant stoppen en hun "gradiënten" (wat soort noten zijn over hoe je kunt verbeteren) synchroniseren. De Paris-experts doen dit niet. Ze trainen gewoon, trainen, trainen, op hun eigen tijd en op hun eigen snelheid. De een kan misschien 100.000 stappen voltooid hebben terwijl een ander er pas op 90.000 zit. Dat maakt niet uit.
  • De Taak van de Router: De router wordt apart getraind. Het leert om naar een ruig, wazig beeld te kijken en te raden welke expert de beste match is voor dat specifieke ruispatroon. Het is als een bibliothecaris die precies weet uit welk boekenrek hij moet pakken op basis van de vage geur van het boek dat je vasthoudt.

Wat Ze Vonden: Minder Data, Minder Vermogen, Dezelfde Kwaliteit

Het team testte Paris tegen de oude manier van doen en tegen een eerdere gedecentraliseerde poging. De resultaten waren verrassend efficiënt:

  • Resourcebesparing: Paris slaagde erin om een hoogwaardig model te trainen met 14 keer minder trainingsdata (11 miljoen afbeeldingen in plaats van 154 miljoen) en 16 keer minder GPU-dagen (de hoeveelheid computertijd die nodig is) vergeleken met de vorige beste gedecentraliseerde methode.
  • De "Top-2" Verrassing: Toen ze testten hoe ze de experts konden combineren, ontdekten ze iets interessants. Het gebruiken van slechts één enkele "beste" expert (Top-1) was goed, maar het gebruik van de top twee experts en het mengen van hun resultaten (Top-2) produceerde daadwerkelijk de beste plaatjes.
  • De "Volledige Team" Fout: Opvallend genoeg maakte het proberen om alle acht experts tegelijk te gebruiken (het Volledige Ensemble) de plaatjes slechter. Het blijkt dat het hebben van te veel stemmen die tegelijkertijd proberen te zingen, ruis creëert. Het paper suggereert dat selectief zijn de sleutel is; je wilt niet het hele koor, je wilt alleen de juiste solisten.

Waarom Dit Er Toe Doet

Het paper concludeert dat je geen miljarden dollars kostend datacenter nodig hebt om een wereldklasse beeldgenerator te bouwen. Door computers onafhankelijk te laten werken en ze pas aan het einde te coördineren, bewijst Paris dat hoogwaardige AI gebouwd kan worden op "heterogene hardware" — wat betekent: een mix van verschillende, goedkopere en geografisch verspreide computers. Dit opent de deur voor onderzoekers en kleinere bedrijven om krachtige modellen te trainen zonder de enorme, gesynchroniseerde infrastructuur die tot nu toe de poortwachter van het veld was.

Kortom, Paris laat zien dat je een meesterwerk kunt bouwen, niet door iedereen te dwingen in pas te marcheren, maar door iedereen hun eigen ritme te laten vinden en dan een slimme dirigent de kans te geven om hen net op tijd samen te brengen voor de laatste buiging.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →