← Nieuwste papers
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

Het artikel introduceert Deco-G, een decodeerframework dat de prestaties van grote taalmodellen op complexe taken verbetert door probleemoplossing te ontkoppelen van rigide formateringsvereisten via een toegewijde Format Estimation Module die naleving waarborgt zonder het redeneren te hinderen.

Oorspronkelijke auteurs: Haikang Deng, Po-Nien Kung, Nanyun Peng

Gepubliceerd 2026-07-13
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haikang Deng, Po-Nien Kung, Nanyun Peng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot vraagt om een lastig wiskundig probleem op te lossen, maar je eist ook dat de robot het antwoord in een zeer specifiek, rigide formaat schrijft, zoals "Het uiteindelijke antwoord is 42." Meestal, wanneer je het "hard nadenken"-gedeelte combineert met het "perfect schrijven"-gedeelte in één grote instructie, raakt de robot in de war. Het is alsof je probeert te jongleren terwijl je over een koord loopt; het gebeurt vaak dat je de bal laat vallen (de wiskunde) of struikelt over het touw (het formaat).

Het artikel van Haikang Deng en collega's introduceert een nieuw systeem genaamd DECO-G om dit op te lossen. Zie DECO-G als een briljante samenwerking tussen twee specialisten: een Probleemoplosser en een Format Politieagent.

Het Probleem: De "Verstrengelde" Bende

Op de oude manier zou je de robot één gigantische prompt geven: "Los dit wiskundige probleem op EN zorg dat je het antwoord in een JSON-box schrijft." Het artikel stelt dat deze "verstrengeling" het brein van de robot schaadt. Ze suggereren dat wanneer de robot probeert beide tegelijkertijd te doen, hij fouten maakt in de wiskunde om aan de formateringsregels te voldoen.

De auteurs argumenteren expliciet tegen het idee dat het simpelweg vertellen van de robot om "voorzichtig te zijn" of het gebruik van rigide, vooraf gemaakte sjablonen (zoals het dwingen om stap voor stap een strikt JSON-schema te volgen) de beste oplossing is. Ze ontdekten dat deze rigide methoden de robot vaak midden in zijn gedachten afsnijden, wat leidt tot onsamenhangende antwoorden of foutieve wiskunde, zelfs als het formaat er perfect uitziet.

De Oplossing: De Twee-Teams Strategie

DECO-G splitst de taak op.

  1. De Probleemoplosser (De LLM): Dit is de hoofdrobot. Hij krijgt alleen de wiskundige opdracht. Hij maakt zich helemaal geen zorgen over het formaat. Hij denkt, redeneert en lost het probleem vrijuit op.
  2. De Format Politie (De FEM): Dit is een aparte, kleinere hulpmodule. Deze lost de wiskunde niet op. De enige taak is om de output van de robot te observeren en te fluisteren: "Hé, je komt bijna bij het einde, maar je moet 'Het uiteindelijke antwoord is' zeggen voordat je het getal geeft."

De magie gebeurt in de manier waarop ze communiceren. De Format Politie gebruikt een speciale "probabilistische lookahead" (een chique manier om in de toekomst te kijken) om te raden: "Als de robot nu 'Het' zegt, wat zijn de kansen dat hij de zin correct afmaakt?" Als de kansen laag zijn, stuurt de Politie de keuze van het volgende woord van de robot subtiel bij om hem weer op het juiste pad te krijgen, zonder hem te dwingen te stoppen met denken.

De Geheime Wapens

Om deze samenwerking snel te laten verlopen en de computer niet te vertragen, hebben de auteurs drie coole trucs geïntroduceerd:

  • Instruction-Aware Distillation: In plaats van de Format Politie te trainen op willekeurige, saaie chats, hebben ze de Politie specifiek getraind op hoe de robot zich gedraagt wanneer hij daadwerkelijk problemen probeert op te lossen. Dit maakt de Politie veel slimmer in het inschatten van wat de robot waarschijnlijk als volgende zal doen.
  • Flexible Trie Building: Stel je een kaart voor van alle mogelijke manieren waarop het antwoord eruit kan zien. Meestal worden deze kaarten enorm groot en rommelig als het antwoord verschillende lengtes kan hebben. De auteurs bouwden een "flexibele" kaart die paden samenvoegt, zodat de computer niet overweldigd raakt door het controleren van elke mogelijke optie.
  • HMM State Pruning: De Format Politie heeft een enorm brein met duizenden verborgen toestanden. De auteurs realiseerden zich dat de robot meestal alleen maar om een klein handjevol van die toestanden geeft. Daarom vertelden ze de Politie om de rest te negeren, wat de rekenkracht ongeveer 13 keer verminderde (van ongeveer 1,08 GFLOPs naar 0,08 GFLOPs per stap) terwijl de nauwkeurigheid bijna gelijk bleef.

Wat de Cijfers Zeggen

Het team heeft dit getest op drie verschillende uitdagingen:

  1. Wiskundige Problemen (GSM8k): Bij het oplossen van wiskunde voor het basisonderwijs presteerde DECO-G consequent beter dan de andere methoden. Bijvoorbeeld, op het Llama-3.1-8B model kreeg het 85,2% van de antwoorden goed terwijl het 100% aan het formaat voldeed. In contrast hiermee kreeg een rigide methode genaamd "Outlines" slechts 81,3% goed, terwijl een standaard "Prompt-Only" benadering 82,3% goed kreeg, maar het meest vaak faalde op het gebied van het formaat.
  2. Event Extraction: Wanneer gevraagd werd om specifieke details uit nieuwsberichten te halen, verbeterde DECO-G de scores voor het identificeren van wie wat deed (de "Argument Id" metriek steeg naar 39,4 voor Llama).
  3. LLM-as-a-Judge: Wanneer de robot samenvattingen moest beoordelen, hielp DECO-G om beter af te stemmen op menselijke beoordelaars, waarbij het de hoogste gemiddelde correlatiescores behaalde (zoals 0,418 voor Coherence voor Llama).

Het Oordeel

Het artikel suggereert dat door het "denken" te scheiden van het "formatteren", we het beste van beide werelden krijgen: antwoorden die zowel wiskundig correct als perfect geformatteerd zijn. De auteurs hebben dit gemeten over echte datasets en vonden dat DECO-G consequent beter presteert dan proberen alles in één keer te doen of het gebruik van rigide, gedwongen beperkingen.

Ze merken echter een paar kanttekeningen op. Dit systeem is geen toverstaf die direct op elke robot werkt; je moet een nieuwe "Format Politie" trainen voor elk specifiek robotmodel dat je gebruikt. Ook voor sommige modellen (zoals de Qwen-serie) is het brein van de robot zo gefocust dat je de Format Politie harder moet pushen (met een controlefactor van γ=2) om hem te laten luisteren.

Kortom, DECO-G suggereert dat als je wilt dat een robot een genie is in wiskunde én een perfectionist in formattering, je hem niet beide tegelijkertijd moet vragen. Geef hem een partner om de regels af te handelen, en kijk hoe hij schittert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →