← Nieuwste papers
💬 NLP

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

Dit paper introduceert 'Stitching Noisy Diffusion Thoughts', een trainingsvrij framework dat door middel van beloningsgeleide samenvoeging van hoogwaardige redeneerstappen uit diverse diffusie-gebaseerde trajecten, de nauwkeurigheid van wiskundige en coderingstaken aanzienlijk verbetert en de latentie verlaagt ten opzichte van bestaande methoden.

Oorspronkelijke auteurs: Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

Gepubliceerd 2026-02-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel lastige puzzel moet oplossen, zoals een ingewikkelde wiskundetaak of het schrijven van een stuk code. Normaal gesproken laten we een slimme computer (een AI) deze puzzel in één keer oplossen, van begin tot eind. Maar als de puzzel moeilijk is, maakt de AI soms een kleine fout halverwege. Omdat de AI dan al "vastzit" in die fout, kan hij de rest van de oplossing niet meer goed maken. Het is alsof je een auto hebt die in een greppel rijdt: als je daar niet uitkomt, kom je nooit op je bestemming.

De onderzoekers van dit papier hebben een slimme nieuwe manier bedacht om dit probleem op te lossen. Ze noemen hun methode "Stitching" (naaien of samenvoegen). Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. Het "Kookpartij"-principe (In plaats van één meesterkok)

Stel je voor dat je een perfecte taart wilt bakken, maar je bent bang dat je één keer de verkeerde hoeveelheid suiker gebruikt.

  • De oude manier: Je vraagt één meesterkok om de taart te bakken. Als hij de suiker verkeerd meet, is de taart mislukt.
  • De nieuwe manier (Diffusion): Je roept 4 of 5 verschillende koks bij elkaar. Ze bakken allemaal tegelijk een eigen versie van de taart. Omdat ze allemaal een beetje anders werken, maken ze allemaal andere fouten. De ene kok vergeet de suiker, de andere bakt de bodem te lang, maar een derde kok maakt de vulling perfect.

2. De "Kwaliteitscontroleur" (De Process Reward Model)

Nu heb je 5 taarten, maar geen van hen is perfect. In plaats van te kiezen voor de taart die er het mooist uitziet (de hele taart), kijken we naar de losse onderdelen.

  • Een slimme keurmeester (de AI die de stappen beoordeelt) kijkt naar elke stap van elke kok.
  • Hij zegt: "Kijk, Kok A heeft de bodem perfect gebakken. Kok B heeft de vulling perfect gemaakt. Kok C heeft de glazuur perfect gesmeerd."
  • De slechte onderdelen (zoals de verbrande bodem van Kok B) worden weggegooid.

3. Het "Naai-actie" (Stitching)

Nu komen we bij het magische deel. We nemen de beste bodem van Kok A, de beste vulling van Kok B en de beste glazuur van Kok C. We "naaien" deze perfecte stukken aan elkaar tot één super-idee voor een taart.

  • Dit is de "Stitched Rationale": een samengesteld recept dat bestaat uit alleen de beste onderdelen van alle pogingen.

4. De "Finale Chef" (De Autoregressive Solver)

We hebben nu een perfect recept, maar we moeten de taart nog wel écht bakken. We geven dit samengestelde recept aan één finale chef (een andere AI).

  • Omdat de chef nu alleen maar hoeft te kijken naar de perfecte stappen die we al hebben geselecteerd, hoeft hij niet meer te "gokken" of te zoeken. Hij hoeft alleen maar het eindresultaat te berekenen.
  • Dit gaat veel sneller en levert een veel betere taart op dan als we hadden geprobeerd om één kok alles in één keer te laten doen.

Waarom is dit zo cool?

  • Snelheid: Omdat de eerste koks (de diffusie-modellen) allemaal tegelijk kunnen werken, is het heel snel om veel ideeën te genereren.
  • Betrouwbaarheid: We gooien geen hele goede ideeën weg omdat ze ergens een klein foutje hebben. We redden alleen de goede stukjes.
  • Kosten: Het is goedkoper dan het laten denken van één enorme AI voor een lange tijd. We gebruiken veel kleine, snelle pogingen en selecteren het beste.

Kortom: In plaats van te hopen dat één AI alles perfect doet in één lange reeks, laten we een hele groep AI's tegelijk proberen, selecteren we de beste stukjes uit al die pogingen, en laten we een finale AI die perfecte stukjes samenvoegen tot het juiste antwoord. Het is als het maken van een collage van de beste ideeën, in plaats van te hopen op één perfecte tekening.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →