A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
Cette étude compare ChatGPT 03-mini et DeepSeek-R1 sur des tâches de programmation Codeforces, révélant que si les deux modèles obtiennent des performances similaires sur les problèmes faciles et éprouvent des difficultés avec les plus complexes, ChatGPT surpasse nettement DeepSeek-R1 sur les défis de difficulté moyenne.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez deux étudiants brillants mais très différents s'asseyant pour une série d'examens de programmation. L'un est ChatGPT (spécifiquement la version o3-mini), un étudiant bien connu et hautement entraîné qui a lu presque tous les livres de la bibliothèque. L'autre est DeepSeek-R1, un nouveau challenger open-source venu de Chine, connu pour son intense focalisation sur le raisonnement logique et les énigmes mathématiques.
Les chercheurs de l'Université de Bergen ont décidé de les mettre à l'épreuve en utilisant une « salle de sport » pour programmeurs appelée Codeforces. Ils ont soumis aux deux étudiants 29 problèmes, allant de simples échauffements à des marathons épuisants, et leur ont demandé d'écrire du code C++ pour les résoudre.
Voici comment s'est déroulée la confrontation, décomposée par niveau de difficulté :
1. L'Échauffement (Tâches Faciles)
Imaginez cela comme de simples problèmes d'arithmétique ou des énigmes logiques de base.
- Le Résultat : Les deux étudiants ont très bien travaillé. Ils étaient comme deux athlètes de haut niveau courant un sprint de 100 mètres ; ils ont tous deux terminé la course avec succès.
- La Nuance : Bien que tous deux aient trouvé les bonnes réponses, DeepSeek a parfois été un peu plus lent et a utilisé un peu plus « d'énergie » (mémoire) que ChatGPT, mais ils ont tous deux franchi la ligne d'arrivée.
2. La Demi-Fond (Tâches Moyennes)
C'est ici que la course devient intéressante. Ces problèmes nécessitaient un peu plus de stratégie et de planification.
- ChatGPT : Cet étudiant a été le clair vainqueur ici. Il a résolu correctement environ 55 % de ces problèmes. Il était comme un coureur de marathon chevronné qui sait exactement comment gérer son allure.
- DeepSeek : Cet étudiant a beaucoup peiné, ne résolvant qu'environ 18 % des problèmes de niveau moyen. C'était comme s'il s'était perdu en cours de route, trébuchait sur ses propres pieds ou oubliait les règles.
- Pourquoi ? L'article suggère que ChatGPT aurait pu avoir plus d'entraînement avec ce type spécifique de données de « programmation compétitive » durant son apprentissage, lui donnant une avance.
3. L'Ultra-Marathon (Tâches Difficiles)
Il s'agissait des défis les plus ardus, exigeant une logique complexe et multi-étapes.
- Le Résultat : Les deux étudiants ont buté sur un mur.
- ChatGPT a réussi à résoudre seulement 1 problème sur 9 parmi les plus difficiles.
- DeepSeek n'a réussi à résoudre aucun des problèmes difficiles (0 %).
- La Métaphore : Imaginez demander aux deux étudiants de construire un gratte-ciel à partir de zéro sans plan. Ils sont tous deux restés bloqués. ChatGPT a essayé de construire quelques étages avant que la structure ne s'effondre (erreurs d'exécution), tandis que DeepSeek n'a souvent même pas pu commencer les fondations (erreurs de compilation) ou a manqué d'énergie (limites de mémoire) avant de terminer.
La Consommation « d'Énergie » (Mémoire et Temps)
Les chercheurs ont également examiné la quantité de « carburant » (mémoire informatique) et de temps utilisés par chaque étudiant.
- ChatGPT a généralement été plus rapide et plus efficace avec ses ressources sur les tâches faciles et moyennes.
- DeepSeek a parfois utilisé une quantité massive de mémoire ou a pris très longtemps pour réfléchir, en particulier sur les tâches difficiles. Dans un cas, DeepSeek a pris tellement de temps pour réfléchir à un problème qu'il a dépassé le délai imparti.
La Conclusion
L'article conclut que si DeepSeek-R1 est un nouveau contender puissant capable de bien gérer les tâches simples, ChatGPT o3-mini est actuellement le meilleur « coach » pour les défis de programmation de difficulté moyenne. Cependant, lorsque les problèmes deviennent vraiment difficiles, les deux modèles ont besoin de l'aide humaine. Ils ne sont pas encore prêts à résoudre les énigmes les plus complexes par eux-mêmes.
Note Importante de l'Étude :
Les chercheurs ont demandé à chaque étudiant de tenter le problème une seule fois (une tentative « en un seul coup »). Ils ne leur ont pas permis de réessayer en cas d'échec ni de demander des indices. L'article note que si les humains avaient été autorisés à les guider ou s'ils avaient utilisé une version différente et plus spécialisée de DeepSeek (appelée DeepSeek-Coder), les résultats auraient pu être différents. Mais sur la base de ce test spécifique, ChatGPT s'est imposé dans la zone intermédiaire, tandis que les deux ont peiné au niveau supérieur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.