← Ultimi articoli
🤖 AI

XGrammar-2: Efficient Dynamic Structured Generation Engine for Agentic LLMs

XGrammar-2 è un motore di generazione strutturata ad alta efficienza progettato per carichi di lavoro dinamici di agenti LLM, che presenta un cambio di struttura attivato da tag e il riutilizzo della cache tra grammatiche per ottenere una compilazione oltre 6 volte più veloce e un overhead end-to-end vicino allo zero rispetto ai sistemi precedenti.

Autori originali: Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

Pubblicato 2026-05-27
📖 5 min di lettura🧠 Approfondimento

Autori originali: Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di essere uno chef (l'IA) che cerca di seguire una ricetta molto rigida. A volte, la ricetta è semplice: "Prepara un panino". Ma nel mondo degli agenti AI, la ricetta è spesso un insieme complesso e mutevole di istruzioni come: "Scrivi una frase, poi passa a un blocco di codice JSON per chiamare uno strumento meteo, poi torna a scrivere una frase, quindi passa a un formato specifico per una query al database".

Il problema è che le "cucine" tradizionali (motori AI) sono eccellenti nel seguire una ricetta fissa, ma faticano quando la ricetta cambia all'istante o quando lo chef deve passare istantaneamente tra dozzine di formati complessi diversi. Spesso devono fermarsi, riscrivere l'intero libro delle ricette da zero prima di poter iniziare a cucinare, il che rende tutto lento.

XGrammar-2 è un nuovo motore da cucina super-efficiente progettato specificamente per questi scenari caotici e dinamici. Ecco come funziona, utilizzando analogie semplici:

1. Il "Cambio Magico" (TagDispatch)

Il Problema: Immagina una ricetta che dice: "Continua a scrivere normalmente finché non vedi la parola 'STOP', poi passa a una modalità matematica, quindi torna indietro". Fare questo con i vecchi metodi è come cercare di scrivere un manuale di istruzioni enorme e aggrovigliato in cui ogni parola possibile porta a una pagina diversa. Diventa disordinato e gigantesco.

La Soluzione XGrammar-2: Hanno introdotto una funzionalità chiamata TagDispatch. Pensa a questo come a un cambio magico o a un semaforo.

  • L'IA scrive normalmente (luce verde).
  • Nel momento in cui vede un trigger specifico (come un tag <function=weather>), la luce diventa istantaneamente rossa e il motore sa esattamente quale "sotto-ricetta" (il formato JSON per il meteo) passare.
  • Una volta completata quella sotto-ricetta, la luce torna verde e l'IA riprende a scrivere normalmente.
  • Perché è fantastico: Invece di scrivere un manuale gigante e confuso, il motore segue semplicemente i semafori. Rende il passaggio tra testo libero e codice rigoroso istantaneo e facile.

2. La "Biblioteca Condivisa" (Cross-Grammar Cache)

Il Problema: Immagina di cucinare 100 piatti diversi. 90 di essi usano esattamente lo stesso passaggio "tritare le cipolle", ma il vecchio motore tratta ogni piatto come un compito completamente nuovo. Rimpara da zero come tritare le cipolle per ogni singolo piatto. Questo è uno spreco di tempo.

La Soluzione XGrammar-2: Hanno costruito una Biblioteca Condivisa (Cross-Grammar Cache).

  • Anche se i piatti finali (la grammatica completa) sono diversi, gli ingredienti e i passaggi (sotto-strutture) sono spesso gli stessi.
  • XGrammar-2 guarda i passaggi. Se vede: "Oh, ho già capito come tritare le cipolle per un piatto simile", non ricalcola. Prende semplicemente le cipolle già tritate dalla biblioteca.
  • Perché è fantastico: Impedisce al motore di fare la stessa matematica ripetutamente. Riutilizza il "lavoro" già svolto, anche se la richiesta complessiva è diversa.

3. Lo Chef "Just-in-Time" (JIT Compilation)

Il Problema: Nei vecchi tempi, prima di poter cucinare un singolo boccone, il motore doveva leggere l'intero libro delle ricette per ogni singola richiesta. Se la ricetta era enorme (come una richiesta di chiamata a strumenti con 500 strumenti possibili), il motore se ne stava lì per secondi solo a leggere il libro prima che iniziasse la cottura.

La Soluzione XGrammar-2: Usano un approccio Just-in-Time (JIT).

  • Invece di leggere tutto il libro prima, lo chef legge solo la pagina di cui ha bisogno in questo momento.
  • Mentre l'IA sta pensando alle prime parole (fase di "prefill"), il motore sta preparando silenziosamente le prossime pagine della ricetta.
  • Perché è fantastico: Nasconde il tempo di preparazione. Quando l'IA è pronta a pronunciare la parola successiva, il motore ha già preparato il passaggio successivo. Questo fa sì che la "prima parola" appaia quasi istantaneamente, anche per compiti complessi.

4. La "Mappa Compressa" (Repetition State Compression)

Il Problema: Alcune ricette hanno passaggi ripetitivi, come "Ripeti questa azione 1.000 volte". I vecchi motori avrebbero provato a disegnare una mappa con 1.000 punti separati per ogni passaggio. Questa mappa diventa enorme e rallenta tutto.

La Soluzione XGrammar-2: Usano la Repetition State Compression.

  • Invece di disegnare 1.000 punti, disegnano una grande freccia a "ciclo" e dicono: "Gira qui 1.000 volte".
  • Perché è fantastico: Mantiene la mappa piccola e semplice, indipendentemente da quante volte l'IA deve ripetere un passaggio. Questo impedisce al motore di rimanere intralciato da lunghe liste o cicli.

I Risultati: Cosa Hanno Scoperto?

Il documento ha testato questo nuovo motore contro i metodi migliori attuali:

  • Velocità: Compila la "ricetta" (la grammatica) 6 volte più velocemente rispetto ai motori precedenti.
  • Efficienza: Aggiunge quasi zero ritardo al tempo di risposta dell'IA. È così veloce che l'IA non nota nemmeno che è lì.
  • Compatibilità: Funziona perfettamente con sistemi AI popolari (come SGLang e vLLM) e gestisce compiti complessi come la chiamata a strumenti o il rispetto di formati di risposta rigorosi senza sforzo.

In sintesi, XGrammar-2 è come aggiornare il cervello di un'IA da un bibliotecario lento e rigido che deve rimettere a posto ogni libro prima di rispondere a una domanda, a un assistente super-veloce e flessibile che sa esattamente dove trovare la risposta, riutilizza conoscenze precedenti e cambia argomento istantaneamente senza perdere il ritmo.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →