← Nieuwste papers
💬 NLP

Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models

Dit artikel introduceert LATCH, een trainingsvrij framework voor Diffusion Language Models dat Confidence-Verified Commit en Block-Wise Early Commit combineert om significante versnellingen in inferentie (tot 17,8x) te bereiken terwijl de nauwkeurigheid van volledige decodering nagenoeg behouden blijft door dynamisch de outputstabiliteit te verifiëren en niet-finale tokenblokken te versnellen zonder afhankelijk te zijn van suffix-prompts of vaste hyperparameters.

Oorspronkelijke auteurs: Chia-Ming Lee, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu

Gepubliceerd 2026-07-31
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chia-Ming Lee, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een complexe puzzel probeert op te lossen, maar in plaats van de stukjes één voor één van links naar rechts te leggen, begin je met een bord dat volledig bedekt is met mist. Elke paar seconden klaart de mist een beetje op, waardoor er tegelijkertijd een wazige gok voor elke plek op het bord zichtbaar wordt. Dit is hoe een nieuw soort kunstmatige intelligentie, een Diffusion Language Model genoemd, denkt. In tegenstelling tot oudere AI die schrijft zoals een mens een zin typt (woord voor woord), ziet deze AI het hele plaatje tegelijkertlijk evolueren.

De grote vraag voor wetenschappers is: Wanneer stop je? Omdat de AI constant zijn gokken verfijnt, hoeft hij niet te wachten tot de allerlaatste seconde om het definitieve antwoord te zien. Vaak stabiliseert het antwoord en stopt het veranderen lang voordat het proces "klaar" is. Als je precies kunt uitzoeken wanneer het antwoord is gestabiliseerd, kun je de computer vervroegd stoppen, wat een enorme hoeveelheid tijd en energie bespaart. Echter, te vroeg stoppen is riskant; als je het bord bevriest terwijl de AI nog tussen twee verschillende antwoorden heen en weer schakelt, leg je een foutief resultaat vast. De uitdaging is het bouwen van een "slimme stopknop" die het verschil weet tussen een tijdelijke pauze en een definitieve beslissing.


Het verhaal van het papier: Het "LATCH"-systeem

Dit papier introduceert een slim nieuw systeem genaamd LATCH (Localized Acceleration with Tracked-Candidate Halting), dat fungeert als een super-slimme stopknop voor deze mistige-puzzel AI-modellen. De auteurs, een team van de National Yang Ming Chiao Tung University en de University at Albany, SUNY, realiseerden zich dat eerdere pogingen om deze modellen te versnellen leken op het gebruik van een bot instrument: ze stopten óf te vroeg en kregen het antwoord fout, óf ze wachtten te lang en verspilden tijd.

Beschouw het decodeerproces van de AI als een lange treinrit met verschillende wagons (blokken). De trein rijdt vooruit, en in elke wagon proberen de passagiers (de gokken van de AI) een definitieve bestemming te kiezen.

  • Het Probleem: Oude methoden keken naar de hele trein en zeiden: "Hé, de passagiers in de eerste wagon zien er tevreden uit, dus laten we de hele trein stoppen!" Maar bij lange, complexe redeneertaken (zoals ingewikkelde wiskundige problemen) kunnen de passagiers in de eerste wagon echter tevreden zijn met een fout antwoord, terwijl het echte antwoord nog in de laatste wagon wordt uitgewerkt.
  • De LATCH-oplossing: De auteurs hebben de taak verdeeld in twee duidelijke rollen, zoals een conducteur en een lokale stationsmanager.

1. De Lokale Manager (BWEC): "Waar te Versnellen"
Het eerste deel van LATCH, genaamd Block-Wise Early Commit (BWEC), fungeert als een lokale stationsmanager. Het kijkt naar de vroege wagons van de trein (de niet-finale blokken). Als de passagiers in een specifieke wagon zelfverzekerd lijken en een richting hebben gekozen, zegt de manager: "Geweldig, deze wagon is klaar! Laten we de rest van de stops voor deze wagon overslaan en naar de volgende gaan." Dit versnelt de reis aanzienlijk voor de delen van het antwoord die slechts tussenstappen zijn, zoals het doen van de berekening in een wiskundig vraagstuk voordat de uiteindelijke zin wordt geschreven.

2. De Conducteur (CVC): "Wanneer de Trein te Stoppen"
Het tweede deel, Confidence-Verified Commit (CVC), is de strikte conducteur die beslist wanneer de hele trein kan stoppen. Dit is het meest kritieke deel. De conducteur kijkt niet alleen naar hoe "tevreden" de passagiers eruitzien; hij controleert daadwerkelijk het antwoord zelf.

  • Hij leest constant het definitieve antwoord dat de AI produceert opnieuw.
  • Hij vraagt: "Is dit antwoord een paar stappen achter elkaar hetzelfde gebleven?"
  • Hij vraagt: "Is de AI echt zeker over dit antwoord?"
  • Pas wanneer het antwoord gedurende een specifiek aantal stappen stabiel en zelfverzekerd is geweest, trekt de conducteur de noodrem aan en zegt: "Oké, we hebben ons antwoord. Stop de trein."

Wat ze vonden

Het team heeft LATCH getest op 11 verschillende taken, variërend van eenvoudige meerkeuzevragen tot moeilijke wiskundige problemen die lange ketens van redeneren vereisen. Ze gebruikten twee verschillende AI-modellen, LLaDA en Dream, en ontdekten dat LATCH een game-changer was.

  • Snelheid: Voor korte, eenvoudige antwoorden was LATCH 9,3 tot 17,8 keer sneller dan de standaardmethode. Voor lange, complexe redeneertaken was het 2,0 tot 3,3 keer sneller.
  • Nauwkeurigheid: Ondanks het feit dat het zo vroeg stopte, maakte LATCH geen fouten. Het bleef binnen 2,0 procentpunt van de nauwkeurigheid van de volledige, trage methode. In veel gevallen behaalde het exact dezelfde score als de trage methode.
  • Geen training nodig: Het beste deel is dat LATCH niet opnieuw getraind hoeft te worden of nieuwe trucjes hoeft te leren voor elke nieuwe taak. Het team stelde de regels één keer in, en ze werkten perfect voor alle 11 taken en beide modellen zonder enige wijziging.

Wat ze uitsloten

Het papier betoogt expliciet tegen het idee dat je simpelweg naar een "betrouwbaarheidsscore" of een "voortgangsbalk" kunt kijken om te beslissen wanneer je moet stoppen.

  • Oude methoden faalden omdat ze naar de hele sequentie keken en een hoge betrouwbaarheidsscore zagen, denkend dat de taak voltooid was. Maar de auteurs lieten zien dat bij lange redeneertaken de AI voor een lange tijd zelfverzekerd kan lijken over een fout antwoord, voordat hij op het allerlaatste moment plotseling naar het juiste antwoord omslaat.
  • Ze bewezen dat stoppen op basis van enkel "hoeveel tijd er is verstreken" of "hoeveel tokens zijn ingevuld" gevaarlijk is. Als je een wiskundig probleem te vroeg stopt, bevries je het antwoord voordat de berekening daadwerkelijk is voltooid.
  • Ze toonden ook aan dat je niet dezelfde "stopregel" kunt gebruiken voor een korte quiz en een lange essay. De regel voor wanneer te stoppen moet specifiek zijn voor het antwoord zelf, niet alleen voor het proces.

De Kern van de Zaak

De auteurs suggereren dat LATCH een zeer effectieve, "training-vrije" manier is om deze krachtige AI-modellen veel sneller te maken zonder hun intelligentie te verliezen. Door de taak van "het versnellen van de tussenstappen" te scheiden van "het verifiëren van het definitieve antwoord", creëerden ze een systeem dat precies weet waar te versnellen en wanneer te stoppen. Het is als het hebben van een gids die weet wanneer hij de saaie delen van een museum moet overslaan, maar erop staat om te blijven tot het meesterwerk volledig is gewaardeerd, zodat je het beste deel niet mist om slechts een paar minuten te besparen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →