← Ultimi articoli
💬 NLP

Decoupling Task-Solving and Output Formatting in LLM Generation

Il documento presenta Deco-G, un framework di decodifica che migliora le prestazioni dei grandi modelli linguistici su compiti complessi disaccoppiando la risoluzione del problema dai rigidi requisiti di formattazione attraverso un modulo dedicato di stima del formato che garantisce la conformità senza ostacolare il ragionamento.

Autori originali: Haikang Deng, Po-Nien Kung, Nanyun Peng

Pubblicato 2026-07-13
📖 5 min di lettura🧠 Approfondimento

Autori originali: Haikang Deng, Po-Nien Kung, Nanyun Peng

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di chiedere a un robot super intelligente di risolvere un problema matematico difficile, ma di pretendere anche che scriva la risposta in un formato molto specifico e rigido, come "La risposta finale è 42". Di solito, quando mescoli la parte del "pensa intensamente" con la parte del "scrivi perfettamente" in un unico grande comando, il robot si confonde. È come cercare di fare giocoleria mentre cammini su una fune: spesso fai cadere la palla (la matematica) o inciampi sulla corda (il formato).

Il documento di Haikang Deng e colleghi introduce un nuovo sistema chiamato DECO-G per risolvere il problema. Pensa a DECO-G come a una brillante collaborazione tra due specialisti: un Risolutore di Problemi e un Agente di Polizia del Formato.

Il Problema: Il caos "Entangled"

Nel vecchio metodo, fornivi al robot un unico comando gigante: "Risolvi questo problema matematico E assicurati di scrivere la risposta in un box JSON". Il documento sostiene che questo "entanglement" (intreccio) danneggia il cervello del robot. Suggerisce che quando il robot cerca di fare entrambe le cose contemporaneamente, inizia a commettere errori nella matematica solo per soddisfare le regole di formattazione.

Gli autori argomentano esplicitamente contro l'idea che basti semplicemente dire al robot di "fare attenzione" o usare template pre-confezionati e rigidi (come costringerlo a seguire uno schema JSON rigoroso passo dopo passo) sia la soluzione migliore. Hanno scoperto che questi metodi rigidi spesso interrompono il ragionamento del robot a metà, portando a risposte incoerenti o a calcoli errati, anche se il formato appare perfetto.

La Soluzione: La Strategia dei Due Team

DECO-G divide il lavoro.

  1. Il Risolutore di Problemi (L'LLM): Questo è il robot principale. Riceve solo il problema matematico. Non deve preoccuparsi affatto del formato. Deve solo pensare, ragionare e risolvere il problema liberamente.
  2. L'Agente di Polizia del Formato (Il FEM): Questo è un modulo ausiliario separato e più piccolo. Non risolve la matematica. Il suo unico compito è osservare l'output del robot e sussurrare: "Ehi, ti stai avvicinando alla fine, ma devi dire 'La risposta finale è' prima di dare il numero".

La magia avviene nel modo in cui comunicano. L'Agente di Polizia utilizza un particolare "lookahead probabilistico" (un modo sofisticato per sbirciare nel futuro) per indovinare: "Se il robot dice 'La' proprio ora, quali sono le probazioni che finirà la frase correttamente?". Se le probabilità sono basse, l'Agente di Polizia spinge gentilmente la scelta della parola successiva del robot per riportarlo in carreggiata senza costringerlo a smettere di pensare.

Le Armi Segrete

Per far sì che questa collaborazione funzioni velocemente e senza rallentare il computer, gli autori hanno introdotto tre trucchi geniali:

  • Distillazione Consapevole dell'Istruzione: Invece di addestrare l'Agente di Polizia su chat casuali e noiose, lo hanno addestrato specificamente su come il robot si comporta quando sta effettivamente cercando di risolvere problemi. Questo rende l'Agente molto più intelligente nel prevedere cosa farà il robot dopo.
  • Costruzione del Trie Flessibile: Immagina una mappa di tutti i possibili modi in cui la risposta potrebbe apparire. Di solito, queste mappe diventano enormi e disordinate se la lunghezza della risposta può variare. Gli autori hanno costruito una mappa "flessibile" che fonde i percorsi, in modo che il computer non venga sopraffatto dal controllo di ogni singola possibilità.
  • Potatura dello Stato HMM: L'Agente di Polizia ha un cervello enorme con migliaia di stati nascosti. Gli autori hanno capito che, la maggior parte delle volte, al robot interessa solo un piccolo gruppo di quegli stati. Così, hanno detto all'Agente di ignorare il resto, riducendo il lavoro computazionale di circa 13 volte (da circa 1,08 GFLOPs a 0,08 GFLOPs per step) mantenendo quasi la stessa accuratezza.

Cosa Dicono i Numeri

Il team ha testato questo sistema su tre diverse sfide:

  1. Problemi Matematici (GSM8k): Nel risolvere la matematica elementare, DECO-G ha costantemente superato gli altri metodi. Ad esempio, sul modello Llama-3.1-8B, ha ottenuto il 85,2% di risposte corrette mantenendo il 100% di conformità al formato. Al contrario, un metodo rigido chiamato "Outlines" ha ottenuto solo l'81,3% di risposte corrette, mentre un approccio "Solo Prompt" ha ottenuto l'82,3% ma ha fallito quasi sempre il formato.
  2. Estrazione di Eventi: Quando gli è stato chiesto di estrarre dettagli specifici da notizie, DECO-G ha migliorato i punteggi per l'identificazione di chi ha fatto cosa (la metrica "Argument Id" è salita a 39,4 per Llama).
  3. LLM-as-a-Judge: Quando il robot doveva valutare dei riassunti, DECO-G lo ha aiutato ad allinearsi meglio con i giudici umani, ottenendo i punteggi di correlazione media più alti (come 0,418 per la Coerenza su Llama).

Il Verdetto

Il documento suggerisce che, separando il "pensiero" dalla "formattazione", possiamo ottenere il meglio di entrambi i mondi: risposte che sono matematicamente corrette e perfettamente formattate. Gli autori hanno misurato questo attraverso dataset reali e hanno scoperto che DECO-G supera costantemente il tentativo di fare tutto insieme o di usare vincoli rigidi e forzati.

Tuttavia, segnalano alcune avvertenze. Questo sistema non è una bacchetta magica che funziona istantaneamente su qualsiasi robot; è necessario addestrare un nuovo "Agente di Polizia del Formato" per ogni specifico modello di robot che si utilizzi. Inoltre, per alcuni modelli (come la serie Qwen), il cervello del robot è così concentrato che è necessario spingere l'Agente di Polizia con più forza (usando un fattore di controllo di γ=2) per fargli ascoltare le regole.

In breve, DECO-G suggerisce che se vuoi un robot che sia un genio della matematica e un perfezionista della formattazione, non dovresti chiedergli di fare entrambe le cose contemporaneamente. Dagli un partner che gestisca le regole e guardalo brillare.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →