A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
Questo studio confronta ChatGPT 03-mini e DeepSeek-R1 su compiti di programmazione di Codeforces, rivelando che, sebbene entrambi i modelli si comportino in modo simile sui problemi facili e abbiano difficoltà con quelli difficili, ChatGPT supera significativamente DeepSeek-R1 nelle sfide di difficoltà media.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina due studenti brillanti ma molto diversi seduti per una serie di esami di programmazione. Uno è ChatGPT (nello specifico la versione o3-mini), uno studente ben noto e altamente addestrato che ha letto quasi ogni libro della biblioteca. L'altro è DeepSeek-R1, una nuova sfidante open-source proveniente dalla Cina, nota per il suo intenso focus sul ragionamento logico e sui puzzle matematici.
I ricercatori dell'Università di Bergen hanno deciso di metterli alla prova utilizzando una "palestra" per programmatori chiamata Codeforces. Hanno assegnato a entrambi gli studenti 29 problemi, che spaziavano da semplici esercizi di riscaldamento a maratone estenuanti, chiedendo loro di scrivere codice C++ per risolverli.
Ecco come si è svolta la sfida, suddivisa per difficoltà:
1. Il Riscaldamento (Compiti Facili)
Pensa a questi come a semplici problemi aritmetici o puzzle logici di base.
- Il Risultato: Entrambi gli studenti hanno fatto un ottimo lavoro. Erano come due atleti di alto livello che corrono una gara di 100 metri; entrambi hanno completato la gara con successo.
- Il Rovescio della Medaglia: Sebbene entrambi abbiano ottenuto le risposte corrette, DeepSeek a volte è stato leggermente più lento e ha utilizzato un po' più di "energia" (memoria) rispetto a ChatGPT, ma entrambi hanno attraversato il traguardo.
2. La Mezza Distanza (Compiti Medi)
È qui che la gara è diventata interessante. Questi problemi richiedevano un po' più di strategia e pianificazione.
- ChatGPT: Questo studente è stato il chiaro vincitore qui. Ha risolto correttamente circa il 55% di questi problemi. Era come un maratoneta esperto che sa esattamente come gestire il proprio ritmo.
- DeepSeek: Questo studente ha faticato significativamente, risolvendo solo circa il 18% dei problemi di difficoltà media. Era come se si fosse confuso a metà gara, inciampato nei propri piedi o dimenticato le regole.
- Perché? Il documento suggerisce che ChatGPT potrebbe aver avuto più pratica con questo specifico tipo di dati di "programmazione competitiva" durante il suo addestramento, dandogli un vantaggio iniziale.
3. L'Ultra-Maratona (Compiti Difficili)
Questi erano le sfide più ardue, che richiedevano logica complessa e multi-step.
- Il Risultato: Entrambi gli studenti hanno incontrato un muro.
- ChatGPT è riuscito a risolvere solo 1 su 9 problemi difficili.
- DeepSeek non è riuscito a risolvere nessuno dei problemi difficili (0%).
- La Metafora: Immagina di chiedere a entrambi gli studenti di costruire un grattacielo da zero senza un progetto. Entrambi si sono bloccati. ChatGPT ha provato a costruire alcuni piani prima che la struttura crollasse (errori di runtime), mentre DeepSeek spesso non è riuscito nemmeno a iniziare le fondamenta (errori di compilazione) o ha esaurito l'energia (limiti di memoria) prima di finire.
Il Consumo di "Energia" (Memoria e Tempo)
I ricercatori hanno anche esaminato quanto "carburante" (memoria del computer) e tempo ogni studente ha utilizzato.
- ChatGPT è stato generalmente più veloce ed efficiente con le sue risorse sui compiti facili e medi.
- DeepSeek a volte ha utilizzato una quantità enorme di memoria o ha impiegato molto tempo per pensare, specialmente sui compiti difficili. In un caso, DeepSeek ha impiegato così tanto tempo a pensare a un problema da andare incontro a un timeout completo.
La Conclusione
Il documento conclude che, sebbene DeepSeek-R1 sia un nuovo contendente potente in grado di gestire bene i compiti semplici, ChatGPT o3-mini è attualmente il "allenatore" migliore per le sfide di programmazione di difficoltà media. Tuttavia, quando i problemi diventano davvero difficili, entrambi i modelli hanno bisogno di aiuto umano. Non sono ancora pronti a risolvere i puzzle più difficili da soli.
Nota Importante dallo Studio:
I ricercatori hanno chiesto a ogni studente di provare il problema una sola volta (un tentativo "single-shot"). Non hanno permesso loro di riprovare se fallivano o di chiedere suggerimenti. Il documento nota che se agli umani fosse stato permesso di guidarli o se avessero utilizzato una versione diversa e più specializzata di DeepSeek (chiamata DeepSeek-Coder), i risultati sarebbero potuti essere diversi. Ma basandosi su questo test specifico, ChatGPT è uscito avanti nel terreno di mezzo, mentre entrambi hanno faticato al livello più alto.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.