← Ultimi articoli
💬 NLP

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

Questo articolo presenta ClassEval-Pro, un benchmark rigoroso e trasversale a più domini composto da 300 task di generazione di codice a livello di classe, validato da un ensemble di LLM e da suite di test ad alta copertura, che rivela come i modelli LLM all'avanguardia attuali abbiano difficoltà nella creazione di codice compositivo a causa di errori logici e di dipendenza, raggiungendo un Pass@1 massimo di soli 45,6%.

Autori originali: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

Pubblicato 2026-04-30
📖 5 min di lettura🧠 Approfondimento

Autori originali: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di insegnare a uno chef robot come cucinare.

Il Vecchio Metodo (Livello Funzione):
Fino ad ora, i ricercatori hanno testato questi chef AI chiedendo loro di preparare un singolo ingrediente semplice, come "tritare una cipolla" o "far bollire l'acqua". L'AI è eccellente in questo. Può tritare le cipolle perfettamente il 90% delle volte. È come testare se il robot sa maneggiare un singolo strumento.

Il Pezzo Mancante (Livello Classe):
Ma nel mondo reale, cucinare non riguarda solo tritare una cosa. Riguarda costruire un intero piatto dove gli ingredienti devono funzionare insieme. Serve una salsa che sappia quanto sale è stato aggiunto, una guarnizione che corrisponda al piatto principale e una strategia di presentazione che tenga tutto insieme. Questo è ciò che il documento definisce "creazione composita di codice". È la capacità di costruire una "classe" completa e organizzata (un'unità autonoma di software) dove più parti comunicano correttamente tra loro.

Il Problema:
Gli autori affermano che non avevamo un buon test per questa abilità del "piatto intero". I vecchi test erano troppo semplici e i pochi test esistenti erano stati creati da esseri umani, il che è lento, costoso e le ricette potrebbero essere state trapelate all'AI durante il suo addestramento (come se l'AI barasse memorizzando le risposte del test).

La Soluzione: ClassEval-Pro
Il team ha costruito un nuovo, massiccio test chiamato ClassEval-Pro. Ecco come l'hanno realizzato, usando un'analogia creativa:

  1. Gli Ingredienti (Dati): Invece di scrivere ricette a mano, sono andati in una gigantesca biblioteca digitale (GitHub) e hanno preso ricette scritte dopo gennaio 2025. Questo garantisce che l'AI non le abbia mai viste prima, quindi è un test equo.
  2. La Ciotola per Mescolare (Cross-Dominio): Non hanno mescolato solo ingredienti simili. Hanno costretto l'AI a mescolare mondi completamente diversi. Immagina di chiedere al robot di costruire una "Calcolatrice Finanziaria" che debba anche gestire un "Inventario di Videogiochi". Deve far funzionare la logica del denaro e la logica del gioco insieme in un unico programma coerente.
  3. La Degustazione (Validazione): Prima ancora che il test inizi, usano una giuria di giudici AI per verificare se la ricetta ha senso e se i "test di degustazione" del test (test del codice) coprono almeno il 90% della ricetta. Se la ricetta è rotta, la scartano.

I Risultati: Gli Chef Robot Faticano
Hanno chiesto a cinque dei più intelligenti chef AI (come GPT-5.1, Gemini e Qwen) di preparare questi piatti complessi.

  • Il Punteggio: Anche lo chef migliore ha ottenuto circa il 45% dei piatti corretti. È un enorme calo rispetto al 90% ottenuto su compiti semplici come "tritare una cipolla".
  • Il Divario: C'era una grande differenza tra lo chef migliore e quello peggiore. Il migliore ha ottenuto il 45% di correttezza, mentre il più debole solo il 28%. Questo dimostra che il test è bravo a distinguere gli chef forti da quelli deboli.
  • La Trappola del "Metodo": Interessante notare che gli chef spesso potevano scrivere correttamente i singoli passaggi (come "tritare la cipolla" o "aggiungere il sale"). Ma quando provavano a mettere tutto insieme in un unico piatto funzionante, le cose si disfacevano. La cipolla era tritata, ma il sale era stato aggiunto alla pentola sbagliata.

Come Hanno Cercato di Aiutare (Strategie)
I ricercatori hanno provato a dare agli chef diversi modi di approcciare la cottura:

  • L'approccio "Dal Basso verso l'Alto": "Inizia con gli ingredienti base, poi costruisci la salsa, poi la guarnizione." Questo ha aiutato gli chef più deboli a migliorare significativamente.
  • L'approccio "Dall'Alto verso il Basso": "Pianifica prima l'intero menu, poi cucina." Questo ha aiutato gli chef più forti.
  • L'approccio "Compositivo": "Scrivi la ricetta della salsa, poi quella della guarnizione, poi incollale insieme." È stato un disastro. Gli chef si sono confusi quando hanno provato a incollare i pezzi e il loro tasso di successo è crollato quasi a zero (1,3% per un modello).

Cosa è Andato Storto? (Gli Errori)
Il team ha esaminato 500 piatti falliti per vedere cosa era andato storto. Hanno trovato due problemi principali:

  1. Errori Logici (56%): Il robot capiva le parole ma sbagliava il significato. (es. "Se l'utente è offline, dagli un messaggio di successo" invece di un messaggio di errore).
  2. Errori di Dipendenza (38%): Le parti non si adattavano. (es. La ricetta della salsa richiedeva un ingrediente che la ricetta della guarnizione non aveva, oppure usavano nomi diversi per la stessa ciotola).

La Grande Lezione
Il documento conclude che mentre l'AI è straordinaria nel scrivere piccoli frammenti isolati di codice, è ancora molto scarsa nell'orchestrare un intero sistema. La parte più difficile non è scrivere il codice per una singola funzione; è assicurarsi che quella funzione comunichi correttamente con le altre funzioni, condivida i dati giusti e non rompa l'intero sistema.

ClassEval-Pro è il nuovo "concorso di cucina" che finalmente costringe questi chef AI a dimostrare di poter gestire un'intera cucina, non solo di tritare un singolo ortaggio.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →