← Ultimi articoli
🤖 machine learning

Mitigating Errors in LLM-Generated Web API Invocations via Retrieval-Augmented Generation and Constrained Decoding

Questo articolo propone e valuta la Generazione Aumentata dal Recupero (RAG) e la Decodifica Vincolata (CD) come strategie complementari per migliorare la correttezza delle invocazioni di API web generate da LLM, riscontrando che, mentre la RAG riduce efficacemente le allucinazioni nella generazione di invocazioni complete, la CD fornisce una prevenzione più affidabile dei parametri illegali e aumenta significativamente la correttezza complessiva in diversi scenari.

Autori originali: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

Pubblicato 2026-07-08
📖 5 min di lettura🧠 Approfondimento

Autori originali: Daniel Maninger, Leon Chemnitz, Jannis Brugger, Tushar Lamba, Amir Molzam Sharifloo, Mira Mezini

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover costruire una casa, ma invece di assumere un architetto esperto, chiedi a un assistente molto intelligente, colto ma leggermente distratto (il Large Language Model, o LLM) di scrivere le planimetrie per te.

Il problema è che le "regole" per costruire questa casa non sono nella testa dell'assistente. Sono scritte in un manuale enorme e complesso chiamato Specifica OpenAPI (un documento che dice esattamente quali porte aprire, quali chiavi usare e di che dimensione ordinare i mattoni).

Se chiedi semplicemente all'assistente di "costruire una porta", potrebbe indovinare la dimensione sbagliata, usare la chiave errata o inventare una porta che non esiste nel manuale. Questo si chiama allucinazione.

Questo articolo parla del dare a quell'assistente due strumenti specifici per smettere di inventare regole e iniziare a seguire il manuale perfettamente.

Il Problema: Il "Gioco dell'Indovinare"

I ricercatori hanno scoperto che quando chiedevano ai modelli di IA di scrivere codice per connettersi a servizi web (come inviare un messaggio su Slack o controllare un Google Calendar), l'IA commetteva errori costantemente.

  • Sceglieva la "porta" sbagliata (endpoint).
  • Cercava di usare una chiave che non esisteva.
  • Inventava funzionalità che non erano presenti nel manuale.

La Soluzione: Due Nuovi Strumenti

L'articolo testa due modi diversi per risolvere il problema, utilizzando un dataset di compiti di programmazione reali.

Strumento 1: Il "Foglietto Illustrativo" (Generazione Aumentata dalla Recupero - RAG)

L'Analogia: Immagina di stare sostenendo un esame, ma ti è permesso portare in aula un foglio specifico del libro di testo. Prima che l'IA scriva la sua risposta, un robot bibliotecario (il Recuperatore) guarda il manuale enorme, trova la pagina esatta riguardante la "Porta" di cui hai bisogno e la consegna all'IA.

  • Come ha funzionato: I ricercatori hanno costruito un sistema che recupera la parte rilevante del manuale API e la incolla nel prompt dell'IA.
  • Il Risultato: È stato un successo parziale.
    • Bene: Quando l'IA non sapeva quale porta scegliere, il foglietto illustrativo l'ha aiutata a trovare quella giusta. Ha impedito all'IA di inventare porte finte.
    • Male: Quando l'IA sapeva già quale porta scegliere, il foglietto illustrativo a volte l'ha confusa. L'IA vedeva una lista di 20 chiavi possibili nel foglietto e pensava: "Dovrei usarle tutte!". Anche se il compito ne richiedeva solo una, questo rendeva il codice disordinato e scorretto.
    • Verdetto: Aiuta a trovare la strada giusta, ma può rendere l'IA "troppo zelante" nell'usare opzioni extra di cui non ha bisogno.

Strumento 2: I "Binari" (Decodifica Vincolata - CD)

L'Analogia: Immagina che l'IA sia un treno. Di solito, il treno può andare ovunque sulla mappa, anche fuori dai binari in una palude (allucinazioni). La Decodifica Vincolata è come posare dei binari d'acciaio che portano solo a destinazioni valide. Il treno non può fisicamente uscire dai binari.

  • Come ha funzionato: I ricercatori hanno preso il manuale e lo hanno trasformato in un insieme di regole rigide (come un labirinto). Mentre l'IA cercava di digitare la parola successiva di codice, il sistema controllava: "Questa parola è permessa dalle regole?". Se l'IA cercava di digitare una porta falsa o una chiave errata, il sistema la bloccava e la costringeva a scegliere un'opzione valida.
  • Il Risultato: Questo è stato il vincitore netto.
    • Zero Allucinazioni: L'IA non poteva inventare un singolo URL, metodo o argomento falso. Era matematicamente impossibile per lei infrangere le regole.
    • Migliore Accuratezza: Poiché non poteva inventare nulla, il codice che scriveva era molto più probabile che fosse corretto.
    • Verdetto: Questo è lo strumento più affidabile. Costringe l'IA a essere obbediente al manuale.

Il Combo: "Foglietto Illustrativo" + "Binari"

I ricercatori hanno provato a usare entrambi gli strumenti contemporaneamente.

  • Il Risultato: Ha funzionato molto bene per alcuni modelli, ottenendo i punteggi più alti. Tuttavia, non è stato costante. A volte il "Foglietto Illustrativo" faceva sì che l'IA cercasse di usare troppe opzioni e, anche se i "Binari" impedivano di compiere mosse illegali, l'IA faceva comunque mosse non necessarie.
  • Verdetto: È potente, ma i "Binari" da soli sono più sicuri e costanti.

In Breve

L'articolo conclude che, sebbene l'IA sia bravissima a scrivere codice, è terribile nel seguire complessi manuali di regole esterni da sola.

  • RAG (Il Foglietto Illustrativo) è come dare all'IA un libro di riferimento. Aiuta, ma l'IA potrebbe distrarsi a causa dell'eccesso di informazioni.
  • CD (I Binari) è come costruire una gabbia attorno all'IA che permette solo mosse valide. È il modo più efficace per impedire all'IA di inventare regole.

I ricercatori affermano che, se volete che un'IA scriva codice per connettersi a servizi web senza rompersi, non dovete fare affidamento solo sulla memoria dell'IA. Dovete o darle il manuale giusto (RAG) o, meglio ancora, costringerla a seguire rigorosamente le regole (CD). L'approccio dei "Binari" è il modo più affidabile per garantire che il codice funzioni effettivamente.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →