← Ultimi articoli
🤖 AI

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

Questo articolo presenta un benchmark basato su un torneo che valuta i Large Language Models rispetto a studenti laureati su un complesso problema logistico guidato dal mercato, rivelando che gli agenti codificati da esseri umani superano significativamente le soluzioni generate da LLM, con la maggior parte degli agenti LLM che fallisce nel superare semplici baseline e persino nel degradare le strategie umane ottimali quando sollecitati a migliorarle.

Autori originali: Panayiotis Danassis, Naman Goel

Pubblicato 2026-06-05
📖 5 min di lettura🧠 Approfondimento

Autori originali: Panayiotis Danassis, Naman Goel

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

La Grande Domanda: Il "Vibe Coding" può battere un laureato?

Immagina di avere un assistente robotico super intelligente (un Large Language Model, o LLM) che può scrivere codice semplicemente parlandogli. Tu dici: "Costruiscimi un'app per le consegne" e lui scrive il codice in pochi secondi. Questo è chiamato "Vibe Coding".

La grande domanda che questo articolo si pone è: questo robot è davvero abbastanza intelligente da risolvere problemi aziendali reali, complessi e ad alto rischio, o è solo bravo a scrivere codice che sembra corretto ma fallisce quando le cose si complicano?

Per scoprirlo, i ricercatori hanno organizzato un enorme torneo di programmazione.

L'Arena: Il gioco "Asta, Ritiro e Consegna"

Invezione di chiedere ai robot di risolvere semplici problemi matematici (come "quanto fa 2+2?"), li hanno inseriti in una simulazione complessa chiamata Problema dell'Asta, del Ritiro e della Consegna (APDP).

Pensatelo come una partita di Scacchi Logistici ad alta posta in gioco:

  1. L'Asta: Diverse aziende (agenti) si contendono i lavori di consegna. I lavori vengono venduti uno alla volta. Devi indovinare quanto offrire come offerta. Se offri troppo, perdi soldi. Se offri troppo poco, potresti vincere il lavoro ma perdere denaro sulla consegna. Devi indovinare cosa faranno i tuoi concorrenti.
  2. La Pianificazione: Una volta vinto un lavoro, devi capire il miglior percorso per i tuoi camion per ritirare e consegnare i pacchi. Hai spazio limitato nei camion e non puoi infrangere le regole.
  3. L'Obiettivo: Il vincitore è l'azienda che genera il maggior profitto (Soldi guadagnati dalle offerte meno i costi di guida).

Questo non riguarda solo lo scrivere codice che non vada in crash; si tratta di scrivere codice che pensi strategicamente, preveda il futuro e superi in astuzia gli avversari.

I Concorrenti

I ricercatori hanno messo due squadre l'una contro l'altra:

  • Team Umano: 17 agenti scritti da studenti laureandi di un'università (EPFL) prima che esistessero gli strumenti di programmazione AI. Questi studenti hanno passato settimane a pensare, pianificare e programmare a mano.
  • Team AI: 40 agenti scritti dai modelli AI più avanzati al mondo (come GPT-5, Claude, Gemini) usando il "Vibe Coding". I ricercatori hanno dato all'IA le stesse identiche istruzioni ricevute dagli studenti.

I Risultati: Gli Umani vincono a mani basse

I risultati sono stati sorprendenti e chiari:

  1. I primi 5 sono umani: In ogni singolo torneo, i primi 5 posti sono stati occupati dagli studenti umani. Gli agenti IA non sono riusciti a scalare la classifica dei primi 5.
  2. AI vs. Il Baseline "Senza Cervello": I ricercatori hanno creato un agente IA molto semplice e stupido (basicamente un indovino casuale). 33 dei 40 agenti IA hanno perso contro questo semplice agente. L'IA era così scarsa nella strategia che una calcolatrice di base l'ha battuta.
  3. Il Disastro del "Fix-it": In un test finale, i ricercatori hanno preso il codice vincente degli umani e hanno chiesto alla migliore IA di "migliorarlo". L'IA ha cercato di perfezionare il codice, ma invece di migliorarlo, lo ha reso peggio. La versione migliorata è scesa dal 1° al 10° posto.

Perché l'IA è fallita?

L'articolo spiega che mentre l'IA è brava con la sintassi (scrivere codice senza errori di ortografia), fatica con il ragionamento (capire il "perché" e il "come" di strategie complesse).

  • Il Fallimento dell' "Eurisitica Ammissibile": In un test più semplice, all'IA è stato chiesto di usare un trucco matematico specifico (ricerca A*) per trovare il percorso migliore. L'IA continuava a dimenticare la regola più basilare di questo trucco, anche quando i ricercatori glielo dicevano esplicitamente. È come chiedere a uno chef di preparare una torta, ma lui dimentica che le uova sono un ingrediente fondamentale, anche dopo essere stato avvisato.
  • Il Bug del "Time-Out": Gli agenti IA spesso rimanevano bloccati in loop o impiegavano troppo tempo per pensare, causando la perdita dell'asta perché finivano il tempo. Il codice umano non faceva questo.
  • Mancanza di Strategia: Gli agenti IA spesso facevano offerte alla cieca o pianificavano percorsi che sprecavano carburante. Non riuscivano a "leggere la stanza" o a prevedere cosa stessero facendo i loro concorrenti.

In sintesi

L'articolo conclude che gli LLM non sono ancora "Programmatori di livello universitario".

Sono eccellenti nello scrivere codice che funziona (senza errori di sintassi), ma sono attualmente terribili nello scrivere codice che compete in scenari complessi del mondo reale che richiedono pianificazione a lungo termine e strategia.

L'Analogia:
Immaginate di avere un robot che sa scrivere una ricetta perfetta per una torta. Sa esattamente quante tazze di farina servono. Ma se gli chiedete di gestire una pasticceria in una città dove i prezzi cambiano ogni minuto, i concorrenti cercano di rubarvi i clienti e avete un budget limitato, il robot probabilmente fallirà. Può scrivere la ricetta, ma non può gestire l'attività.

I ricercatori dicono che è tempo di smettere di controllare solo se il codice "funziona" (supera un test) e iniziare a controllare se il codice può effettivamente vincere nel mondo reale.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →