Comparing AI Coding Agents: A Task-Stratified Analysis of Pull Request Acceptance
Questo studio empirico analizza 7.156 pull request per rivelare che, sebbene Devin mostri una tendenza temporale positiva unica nell'accettazione, il tipo di compito è il fattore dominante che influenza i tassi di successo, con OpenAI Codex che dimostra le prestazioni elevate più coerenti attraverso diverse categorie, nonostante nessun singolo agente eccellere in tutti i tipi di compito.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di essere il manager di un cantiere edile molto attivo. Invece di operai umani, hai cinque diversi robot AI (OpenAI Codex, GitHub Copilot, Devin, Cursor e Claude Code) in grado di scrivere codice, correggere bug e redigere documentazione. Il tuo obiettivo è capire quale robot sia il migliore nel ottenere l'approvazione dei suoi lavori da parte degli ispettori del cantiere (il "tasso di accettazione delle Pull Request").
Questo articolo è come un dettagliato pagelle che confronta questi cinque robot nel corso di diversi mesi. Ecco cosa hanno scoperto, spiegato in modo semplice:
1. Il "Tipo di Lavoro" Conta Più del Robot
La sorpresa più grande non è stato quale robot fosse il più veloce, ma che tipo di lavoro stavano svolgendo.
- L'Analogia: Immagina di chiedere a un robot di "scrivere una poesia" rispetto a "costruire un ponte". Scrivere una poesia è solitamente più facile da approvare rispetto a costruire un ponte.
- La Scoperta: L'articolo ha rilevato che il tipo di compito è il fattore più importante.
- Quando ai robot è stato chiesto di fare documentazione (come scrivere manuali o commenti), sono stati approvati nell'82% dei casi.
- Quando è stato chiesto loro di costruire nuove funzionalità (come aggiungere una nuova stanza a una casa), sono stati approvati solo nel 66% dei casi.
- La Lezione: Se giudichi un robot solo in base al suo punteggio complessivo, potresti essere ingannato. Un robot che svolge principalmente compiti facili di "scrittura di poesie" sembrerà una superstar, anche se è terribile nel "costruire ponti".
2. Nessun Singolo Robot Vince in Tutte le Categorie
Non esiste un "miglior robot" per tutto. Ognuno ha una superpotenza specifica.
- OpenAI Codex: È l'affidabile tuttofare. Ha performato costantemente bene in quasi ogni tipo di lavoro, senza mai scendere sotto un punteggio decente.
- Claude Code: È lo Specialista in Documentazione. È stato il migliore nella scrittura di manuali e nella creazione di nuove funzionalità, ma dobbiamo fare attenzione perché non ha svolto molti altri compiti in questo studio.
- Cursor: È il Riparatore di Bug. Quando si trattava di riparare cose rotte, è stato il performer migliore.
- Devin: Questo robot ha iniziato lentamente ma è migliorato nel tempo. È stato l'unico a mostrare una chiara tendenza di miglioramento settimana dopo settimana, salendo da circa il 60% di approvazione all'80%.
3. Il Tempo Cambia le Cose (Ma Non per Tutti)
I ricercatori hanno osservato questi robot per mesi per vedere se imparavano o miglioravano.
- L'Analogia: Pensa a uno studente che sostiene un test ogni settimana.
- Devin è come lo studente che studia sodo e continua a ottenere punteggi più alti ogni settimana.
- Gli altri sono come studenti che sono già intelligenti; iniziano con punteggi alti e restano alti, ma non mostrano molti miglioramenti nel tempo. Restano semplicemente costanti.
4. Perché il "Punteggio Globale" è Ingannevole
L'articolo mette in guardia dal guardare un singolo "punteggio medio" per un robot.
- L'Analogia: Immagina due chef. Lo Chef A cucina solo semplici insalate (che tutti amano). Lo Chef B cucina solo complessi stufati piccanti (che sono più difficili da preparare correttamente). Se guardi solo la "valutazione media dei clienti", lo Chef A potrebbe sembrare migliore. Ma questo non significa che lo Chef A sia uno chef migliore; significa solo che gli sono stati dati ingredienti più facili.
- La Scoperta: I ricercatori hanno dovuto separare i robot in base al tipo di lavoro che svolgevano per ottenere un confronto equo. Una volta fatto ciò, hanno scoperto che il robot "migliore" cambiava a seconda che il lavoro fosse correggere un bug, scrivere un test o aggiornare un documento.
Riepilogo
Se vuoi assumere un assistente di codifica AI, non chiedere semplicemente: "Chi è il migliore?".
- Se hai bisogno di correzioni di bug, guarda Cursor o OpenAI Codex.
- Se hai bisogno di nuove funzionalità o documentazione, Claude Code o OpenAI Codex potrebbero essere la tua scelta migliore.
- Se vuoi un robot che sembra imparare e migliorare nel tempo, Devin è quello da tenere d'occhio.
Il punto principale è che il contesto è il re. Non puoi giudicare uno strumento senza sapere esattamente quale lavoro gli viene chiesto di svolgere.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.