← Nieuwste papers
🤖 machine learning

Towards General Preference Alignment: Diffusion Models at Nash Equilibrium

Dit artikel introduceert Diffusion Nash Preference Optimization (Diff.-NPO), een speltheoretisch kader dat diffusiemodellen in staat stelt superieure tekst-naar-afbeelding-afstemming te bereiken door zelfspel tegen zichzelf aan te moedigen, waardoor de beperkingen van traditionele op Bradley-Terry gebaseerde voorkeursmethoden worden overwonnen.

Oorspronkelijke auteurs: Jiaming Hu, Jiamu Bai, Haoyu Wang, Debarghya Mukherjee, Ioannis Ch. Paschalidis

Gepubliceerd 2026-05-07
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiaming Hu, Jiamu Bai, Haoyu Wang, Debarghya Mukherjee, Ioannis Ch. Paschalidis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer getalenteerde kunstenaar (het Diffusiemodel) hebt die schilderijen kan maken op basis van je beschrijvingen. Deze kunstenaar is echter getraind op het hele internet, dus hoewel ze bekwaam is, past hun stijl niet altijd precies bij wat jij specifiek leuk vindt. Soms tekenen ze een kat die een beetje op een hond lijkt, of een zonsondergang die meer op soep lijkt.

Om dit op te lossen, leren we de kunstenaar meestal door hen paren afbeeldingen te tonen: "Ik vind deze beter dan die." Dit heet Preferentie-uitlijning.

De Oude Manier: Het "Scorehouder"-Probleem

De meeste huidige methoden (zoals DPO) proberen de kunstenaar te leren door te doen alsof er een verborgen "Scorehouder" (een beloningsmodel) bestaat. Ze gaan ervan uit dat als Afbeelding A beter is dan Afbeelding B, en Afbeelding B beter is dan Afbeelding C, dan Afbeelding A noodzakelijkerwijs beter moet zijn dan Afbeelding C.

Het paper betoogt dat dit een gebrekkige aanname is. Menselijke smaak is rommelig en soms circulair, net als het spel Steen-Schaar-Blad:

  • Je kunt Steen verkiezen boven Schaar.
  • Je kunt Schaar verkiezen boven Blad.
  • Maar je kunt ook Blad verkiezen boven Steen.

De oude methoden proberen deze keuzes in een rechte lijn te dwingen (A > B > C), wat de complexiteit van echte menselijke smaak niet vastlegt. Ze vertrouwen ook op een "Scorehouder" die de computer moet raden, wat onnauwkeurig kan zijn.

De Nieuwe Manier: Het "Sparringpartner"-Spel (Diff.-NPO)

De auteurs stellen een nieuwe methode voor genaamd Diff.-NPO (Diffusion Nash Preference Optimization). In plaats van een score te raden, veranderen ze het trainingsproces in een spel tussen twee versies van de kunstenaar:

  1. De Huidige Kunstenaar: De versie van het model die we proberen te verbeteren.
  2. De Vorige Kunstenaar: De versie van het model van de vorige trainingsstap (optredend als tegenstander).

Hoe het spel werkt:
Stel je voor dat de Huidige Kunstenaar en de Vorige Kunstenaar in een boksrings staan. Ze krijgen allebei dezelfde prompt (bijvoorbeeld "Teken een kat").

  • Ze schilderen allebei een plaatje.
  • Een scheidsrechter (een preferentie-checker) bekijkt beide en beslist welke beter is.
  • De Huidige Kunstenaar probeert de ronde te winnen door een plaatje te maken dat de scheidsrechter verkiest boven het plaatje van de Vorige Kunstenaar.
  • Cruciaal is dat de Huidige Kunstenaar ook moet onthouden hoe ze goed kunnen schilderen in het algemeen (dicht bij de oorspronkelijke training blijven), anders beginnen ze misschien om alleen maar het spel te winnen, rare, onzinnige dingen te tekenen.

Dit heet een Nash-evenwicht. Het doel is een punt te bereiken waar de Huidige Kunstenaar zo goed is dat geen enkele andere strategie het consequent kan verslaan. Het is een "zelfspel"-lus waarbij het model tegen zichzelf vecht om beter te worden, in plaats van alleen maar te proberen een statische score te bevredigen.

De "Sweet Spot"-Balans

Het paper introduceert een speciale "knop" (een wiskundige verhouding genaamd τ/η\tau/\eta) die controleert hoe het spel wordt gespeeld:

  • Draai de knop in de ene richting: De kunstenaar probeert alleen de "Vorige Kunstenaar" te verslaan. Dit is puur zelfspel. Het is agressief en leert snel, maar de kunstenaar kan van de rails raken en vergeten hoe ze normale dingen moeten tekenen.
  • Draai de knop in de andere richting: De kunstenaar probeert alleen een "Referentie-kunstenaar" te verslaan (een vaste, originele versie). Dit is veilig en stabiel, maar de kunstenaar kan vastlopen en niet veel verbeteren omdat het doel te makkelijk of te star is.
  • De Sweet Spot: Diff.-NPO vindt het perfecte midden. Het gebruikt de Vorige Kunstenaar om verbetering te stimuleren (online leren) en de Referentie-kunstenaar om het model geaard te houden (stabiliteit).

Wat Gebeurde Er Toen Ze Het Probeerden?

De onderzoekers testten dit op populaire beeldgenerators (Stable Diffusion 1.5 en SDXL) met behulp van een enorm dataset van menselijke voorkeuren genaamd Pick-a-Pic.

  • Het Resultaat: Diff.-NPO versloeg de oude methoden consequent.
  • Het Bewijs: Toen ze het nieuwe model in een "face-off" tegen de oude modellen stelden, won het Diff.-NPO-model vaker. Het produceerde afbeeldingen die mensen (en geautomatiseerde rechters) meer leuk vonden.
  • Visuele Kwaliteit: In vergelijkingen naast elkaar waren de Diff.-NPO-afbeeldingen realistischer, volgden ze de prompts beter en zagen ze er coherenter uit dan afbeeldingen gemaakt door de oudere methoden.

Samenvatting

In eenvoudige termen zegt het paper: "Stop met proberen een perfecte score te berekenen voor wat mensen leuk vinden, want menselijke smaak is daarvoor te ingewikkeld. Laat de AI in plaats daarvan een spel spelen tegen zijn eigen verleden, met een veiligheidsnet om te voorkomen dat het gek wordt. Deze 'sparring'-aanpak creëert een betere, beter uitgelijnde kunstenaar."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →