← Ultimi articoli
💬 NLP

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

Il paper introduce SlopCodeBench, un benchmark che dimostra come gli agenti di codifica attuali falliscano nel completare compiti iterativi a lungo termine a causa di un progressivo degrado della qualità del codice, caratterizzato da un aumento della verbosità e dell'erosione strutturale, evidenziando così le limitazioni delle attuali valutazioni basate sul tasso di successo.

Autori originali: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

Pubblicato 2026-03-27
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

🛠️ Il Problema: L'Architetto che non sa quando fermarsi

Immagina di assumere un architetto robot (l'Intelligenza Artificiale) per costruire una casa.

  • I vecchi test: Prima, si chiedeva al robot: "Costruisci questa stanza". Se la stanza era solida e non crollava, il robot riceveva un "Bravo!".
  • La realtà: Nella vita reale, non costruiamo una casa e poi basta. Dobbiamo aggiungere un piano, poi un garage, poi una piscina, poi un ascensore. Ogni volta che modifichiamo la casa, il robot deve lavorare su ciò che ha già costruito.

Il problema scoperto da questo studio è che, mentre i robot sono bravissimi a costruire la prima stanza, quando devono aggiungere le altre, iniziano a fare un disastro.

🗑️ Cos'è lo "Slop" (Lo Spazzatura)?

Il paper chiama questo fenomeno "Slop" (che in inglese significa "spazzatura" o "roba di scarsa qualità").

Immagina che il robot, invece di costruire un garage con le fondamenta giuste, decida di appoggiare un muro di mattoni sopra il tetto della cucina. Funziona per un attimo? Sì. Ma quando vuoi aggiungere la piscina? Il muro crolla, o peggio, il robot costruisce un'altra torre di mattoni sopra quella vecchia per nascondere il buco.

Con ogni nuova richiesta, la casa diventa:

  1. Più ingombrante: Ci sono muri inutili, doppioni e scale che non portano da nessuna parte (chiamato Verbosità).
  2. Più fragile: Tutto il peso della casa finisce su un'unica colonna che sta per spezzarsi (chiamato Erosione Strutturale).

📊 Il Nuovo Esperimento: SlopCodeBench

Gli autori hanno creato una nuova "palestra" per i robot, chiamata SlopCodeBench. Invece di farli costruire una cosa sola, hanno dato loro un compito che dura molto tempo:

  1. Fase 1: Costruisci un cercapersone per file Python.
  2. Fase 2: "Ah, ora devi farlo funzionare anche per JavaScript e C++".
  3. Fase 3: "Ora aggiungi la capacità di capire la struttura del codice".
  4. Fase 4: "Ora aggiungi il Go, il Rust e il Java".

Il robot deve usare il suo stesso codice per ogni nuova fase. Non può ricominciare da zero. Deve espandere la sua creazione precedente.

📉 Cosa è successo? (I Risultati)

I risultati sono stati scioccanti, come scoprire che il robot sta costruendo una torre di carte invece di un grattacielo:

  • Nessuno ha vinto: Nessun modello di intelligenza artificiale (nemmeno i più potenti) è riuscito a completare l'intero percorso senza fallire. Il migliore ha risolto solo il 17% dei passaggi totali.
  • Il codice diventa "Slop":
    • Il codice generato dagli AI è 2,2 volte più lungo e pieno di ripetizioni inutili rispetto a quello scritto da umani esperti.
    • La "struttura" del codice si degrada: le funzioni diventano mostri giganti di 1000 righe che fanno tutto, rendendo impossibile aggiungere nuove cose senza rompere tutto.
  • Il confronto con gli umani: Gli autori hanno confrontato il codice dei robot con quello di progetti reali mantenuti da umani (come Django o Scikit-learn).
    • Gli umani: Quando aggiungono una funzione, la casa rimane stabile.
    • I robot: Ogni volta che aggiungono una funzione, la casa diventa più instabile e disordinata. È come se ogni volta che il robot aggiunge un mattoncino, ne nascondesse dieci sotto il tappeto.

🚫 Perché i prompt "gentili" non funzionano?

Gli autori hanno provato a dire al robot: "Per favore, sii ordinato, non fare cose inutili, pianifica prima di agire".
È come dire a un bambino disordinato: "Per favore, non spargere i giocattoli".

  • Risultato: All'inizio, la stanza è un po' più ordinata. Ma dopo due o tre aggiunte, il robot ricomincia a fare disordine. Il "messaggio gentile" non cambia il modo in cui il robot pensa e costruisce. La degradazione è inevitabile con la tecnologia attuale.

💡 La Morale della Favola

Questo studio ci dice una cosa fondamentale: Non basta che il codice funzioni oggi.

Se un'IA scrive un codice che passa tutti i test, ma è così disordinato che domani non possiamo modificarlo senza distruggerlo, quel codice è un fallimento.

I vecchi test misuravano solo "funziona o no?". Il nuovo SlopCodeBench misura "quanto durerà?". E finora, la risposta è: pochissimo. Gli agenti di coding attuali sono come muratori che sanno posare un mattone perfettamente, ma non sanno come costruire un muro che regga il tempo.

In sintesi estrema:

L'IA è brava a scrivere la prima pagina di un libro, ma quando deve scrivere il capitolo 10 basandosi su quello che ha scritto al capitolo 1, inizia a ripetere le stesse frasi, a confondere i personaggi e a scrivere pagine che non hanno senso. Il codice diventa "spazzatura" (Slop) e diventa impossibile da mantenere.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →