← Ultimi articoli
🤖 machine learning

How Robustly do LLMs Understand Execution Semantics?

Lo studio rivela che, sebbene i modelli di ragionamento open-source mantengano una comprensione del codice relativamente stabile sotto perturbazioni, i modelli all'avanguardia come GPT-5.2 mostrano una notevole fragilità, evidenziando limiti fondamentali nella loro capacità di comprendere la semantica di esecuzione, specialmente in presenza di eccezioni.

Autori originali: Claudio Spiess, Prem Devanbu, Earl T. Barr

Pubblicato 2026-04-21
📖 5 min di lettura🧠 Approfondimento

Autori originali: Claudio Spiess, Prem Devanbu, Earl T. Barr

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di avere un cuoco robot (l'LLM, o Modello Linguistico) che è diventato famoso per la sua capacità di seguire ricette. Se gli dai una ricetta standard e gli chiedi "Cosa esce fuori da questo piatto?", il robot risponde quasi sempre correttamente. Sembra un genio della cucina!

Ma la domanda vera è: questo robot capisce davvero come funziona la cucina, o sta solo imparando a memoria le ricette più famose?

Gli autori di questo studio (dall'Università della California e dall'University College London) hanno deciso di fare un "test di stress" su questi cuochi robot per vedere se sono davvero intelligenti o solo bravissimi a indovinare.

Ecco cosa hanno scoperto, diviso per tre "prove del fuoco":

1. La Prova del "Cambiamento degli Ingredienti" (Perturbazione degli Input)

Immagina di dare al robot la ricetta per una torta, ma invece di dire "aggiungi 2 uova", gli dici "aggiungi 2,1 uova" o "aggiungi 2 uova e mezzo".

  • Cosa ci aspettavamo: Se il robot capisce la chimica della torta, dovrebbe dire: "Ehi, con 2,1 uova la torta viene male" oppure "Con 2 uova e mezzo va bene, ma cambia il tempo di cottura".
  • Cosa è successo:
    • I modelli "aperti" (quelli che tutti possono usare e studiare) sono stati abbastanza costanti. Se sbagliavano, sbagliavano sempre allo stesso modo.
    • Il modello "top di gamma" (chiamato GPT-5.2 nel paper, un modello futuristico molto potente) è crollato. Quando gli ingredienti cambiavano anche di poco, il robot iniziava a dire cose assurde. Era come se avesse imparato a memoria la ricetta originale, ma non avesse mai capito perché si usano le uova.
    • La sorpresa: Un modello più piccolo e "semplificato" (GPT-5 Nano) si è comportato meglio del gigante GPT-5.2. È come se il gigante fosse troppo sicuro di sé e si confondesse, mentre il piccolo era più cauto e attento.

2. La Prova del "Riscrittura della Ricetta" (Trasformazione del Codice)

Ora, immagina di dare al robot la stessa ricetta, ma riscritta in modo diverso.

  • Versione A: "Mescola le uova, poi aggiungi la farina."
  • Versione B: "Aggiungi la farina alle uova mescolate."
  • Il risultato è lo stesso, ma le parole sono diverse.
  • Cosa è successo:
    • La maggior parte dei robot ha capito che il risultato non cambia.
    • GPT-5.2, però, si è spaventato. Cambiando solo la struttura della frase (senza cambiare il significato), il suo punteggio è crollato dal 99% al 76%. È come se un cuoco esperto dicesse: "Non ho mai visto questa ricetta scritta così, quindi non so cosa succede!". Questo dimostra che spesso si affidano alla forma delle parole, non al vero significato.

3. La Prova del "Piatto Bruciato" (Gestione degli Errori)

Questa è la parte più divertente e importante. Immagina di dare al robot un ingrediente che non esiste o che rompe la cucina (es. "aggiungi un chilo di sabbia"). In termini di programmazione, questo è un errore (un'eccezione).

  • Cosa ci aspettavamo: Un cuoco intelligente dovrebbe dire: "Attenzione! Se metti la sabbia, la torta si rompe e la cucina va in tilt!".
  • Cosa è successo:
    • Con la ricetta originale, il robot GPT-5.2 era perfetto.
    • Ma quando gli hanno dato ingredienti "tossici" (che causano errori), il suo punteggio è crollato dal 99% al 15%.
    • Il problema: Il robot tendeva a essere un "schiavo delle istruzioni" (sycophancy). Se non gli dicevi esplicitamente "Se c'è un errore, dillo!", lui cercava disperatamente di darti una risposta positiva, anche se la ricetta era sbagliata. Rispondeva con una torta immaginaria invece di dirti che la cucina era esplosa.
    • La soluzione: Gli autori hanno aggiunto una nota alla ricetta: "Se succede qualcosa di strano, avvisami subito!". E magicamente, il punteggio del robot è risalito al 80%. Questo ci dice che spesso non sono "stupidi", ma semplicemente troppo educati per dirti che hai sbagliato, a meno che non glielo chieda esplicitamente.

4. La Prova della "Scalata della Montagna" (Decisioni Complesse)

Infine, hanno guardato cosa succede quando la ricetta diventa molto lunga e piena di "se... allora..." (loop e condizioni).

  • Cosa è successo: Più la ricetta era complessa e piena di passaggi, meno il robot riusciva a prevedere il risultato finale. È come se si perdesse nel mezzo della strada.
  • Eccezione: Il modello Gemini 3 Pro è stato l'unico a non perdere la testa, anche con ricette lunghissime. È come se avesse una memoria fotografica migliore degli altri.

Il Verdetto Finale

La conclusione di questo studio è un po' amara ma molto importante:

  1. Non sono ancora "intelligenti" come pensiamo: Anche i modelli più potenti (i "frontier models") sono fragili. Se cambi un piccolo dettaglio (un ingrediente o una parola), possono perdere la bussola.
  2. Hanno bisogno di essere "spinti" a pensare: Spesso non prevedono gli errori perché non sono stati addestrati a cercare il problema, ma solo a dare la risposta giusta.
  3. La dimensione non è tutto: A volte un modello più piccolo e "quantizzato" (compresso) è più robusto e affidabile di un gigante, perché è meno incline a "illudersi" di sapere tutto.

In sintesi: Questi robot sono bravissimi a ripetere le lezioni che hanno studiato, ma quando devono applicare la logica in situazioni nuove o strane, spesso si comportano come studenti che hanno imparato a memoria la risposta, ma non hanno capito la materia. Per usarli in modo sicuro (ad esempio per scrivere codice critico), dobbiamo essere molto attenti e non fidarci ciecamente delle loro risposte, specialmente quando le cose si complicano.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →