← Nieuwste papers
🤖 AI

A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks

Deze studie vergelijkt ChatGPT 03-mini en DeepSeek-R1 op Codeforces-programmeertaken en onthult dat, hoewel beide modellen vergelijkbaar presteren bij makkelijke problemen en worstelen met moeilijke, ChatGPT DeepSeek-R1 significant overtreft bij uitdagingen van gemiddelde moeilijkheidsgraad.

Oorspronkelijke auteurs: Ronas Shakya, Sam Urmian, Mohammad Khalil

Gepubliceerd 2026-05-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ronas Shakya, Sam Urmian, Mohammad Khalil

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je twee briljante maar zeer verschillende studenten voor die plaatsnemen voor een reeks programmeerexamens. De ene is ChatGPT (specifiek de o3-mini-versie), een bekende, hoogopgeleide student die bijna elk boek in de bibliotheek heeft gelezen. De andere is DeepSeek-R1, een nieuwere, open-source uitdager uit China die bekendstaat om zijn intense focus op logisch redeneren en wiskundige raadsels.

De onderzoekers van de Universiteit van Bergen besloten hen op de proef te stellen met een "sportschool" voor programmeurs genaamd Codeforces. Ze gaven beide studenten 29 problemen, variërend van simpele warming-ups tot zware marathons, en vroegen hen C++-code te schrijven om deze op te lossen.

Zo verliep de confrontatie, opgesplitst per moeilijkheidsgraad:

1. De Warming-Up (Eenvoudige Taken)

Beschouw deze als simpele rekenproblemen of basislogische raadsels.

  • Het Resultaat: Beide studenten deden het uitstekend. Ze waren als twee topsporters die een 100-meter sprint rennen; ze finishten beiden de race succesvol.
  • De Vangst: Hoewel beide het juiste antwoord hadden, liep DeepSeek soms iets langzamer en gebruikte het iets meer "energie" (geheugen) dan ChatGPT, maar ze staken beiden de finishlijn over.

2. De Middenafstand (Gemiddelde Taken)

Hier werd de race interessant. Deze problemen vereisten iets meer strategie en planning.

  • ChatGPT: Deze student was hier de duidelijke winnaar. Ze loste ongeveer 55% van deze problemen correct op. Ze was als een doorgewinterde marathonloper die precies weet hoe ze haar tempo moet houden.
  • DeepSeek: Deze student had aanzienlijke moeite, met slechts ongeveer 18% van de gemiddelde problemen opgelost. Het was alsof ze halverwege de race in de war raakte, over haar eigen voeten struikelde of de regels vergat.
  • Waarom? Het artikel suggereert dat ChatGPT tijdens haar training meer praktijkervaring had met dit specifieke type "competitieve programmering"-data, wat haar een voorsprong gaf.

3. De Ultra-Marathon (Moeilijke Taken)

Dit waren de zwaarste uitdagingen, die complexe, meerstapslogica vereisten.

  • Het Resultaat: Beide studenten liepen tegen een muur aan.
    • ChatGPT slaagde erin slechts 1 van de 9 moeilijke problemen op te lossen.
    • DeepSeek slaagde er niet in enkele van de moeilijke problemen op te lossen (0%).
  • De Metafoor: Stel je voor dat je beide studenten vraagt om zonder blauwdruk een wolkenkrabber van de grond af te bouwen. Ze bleven beiden steken. ChatGPT probeerde een paar verdiepingen te bouwen voordat de constructie instortte (runtime-fouten), terwijl DeepSeek vaak niet eens het fundament kon leggen (compilatiefouten) of de energie opgaf (geheugengrenzen) voordat het klaar was.

Het "Energie"-verbruik (Geheugen en Tijd)

De onderzoekers keken ook hoeveel "brandstof" (computergeheugen) en tijd elke student gebruikte.

  • ChatGPT was over het algemeen sneller en efficiënter in haar middelen bij de eenvoudigere en gemiddelde taken.
  • DeepSeek gebruikte soms een enorme hoeveelheid geheugen of nam zeer lang de tijd om na te denken, vooral bij de moeilijke taken. In één geval duurde het voor DeepSeek zo lang om over een probleem na te denken dat het volledig op tijd uitliep.

De Conclusie

Het artikel concludeert dat DeepSeek-R1 een krachtige nieuwe uitdager is die eenvoudige taken goed aankan, maar ChatGPT o3-mini momenteel de betere "coach" is voor programmeeruitdagingen van gemiddelde moeilijkheidsgraad. Echter, wanneer de problemen echt moeilijk worden, hebben beide modellen menselijke hulp nodig. Ze zijn nog niet klaar om de zwaarste raadsels alleen op te lossen.

Belangrijke Opmerking uit het Onderzoek:
De onderzoekers vroegen elke student om het probleem slechts eenmaal te proberen (een "single-shot"-poging). Ze lieten ze niet opnieuw proberen als ze faalden of om hints vragen. Het artikel merkt op dat als mensen hen hadden mogen begeleiden of als ze een andere, meer gespecialiseerde versie van DeepSeek hadden gebruikt (genaamd DeepSeek-Coder), de resultaten anders hadden kunnen zijn. Maar op basis van deze specifieke test kwam ChatGPT als winnaar uit de strijd op het gemiddelde niveau, terwijl beiden worstelden op het hoogste niveau.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →