A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks
Diese Studie vergleicht ChatGPT 03-mini und DeepSeek-R1 bei Codeforces-Programmiertasks und zeigt, dass beide Modelle bei einfachen Problemen ähnlich gut abschneiden und bei schwierigen Aufgaben Schwierigkeiten haben, ChatGPT jedoch bei mittelschweren Herausforderungen DeepSeek-R1 deutlich übertrifft.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich zwei brillante, aber sehr unterschiedliche Studierende vor, die sich einer Reihe von Programmierprüfungen stellen. Der eine ist ChatGPT (speziell die o3-mini-Version), ein bekannter, hochtrainierter Student, der fast jedes Buch in der Bibliothek gelesen hat. Der andere ist DeepSeek-R1, ein neuerer, quelloffener Herausforderer aus China, der für seinen intensiven Fokus auf logisches Schlussfolgern und mathematische Rätsel bekannt ist.
Die Forscher der Universität Bergen beschlossen, sie in einer „Turnhalle" für Programmierer namens Codeforces auf die Probe zu stellen. Sie gaben beiden Studierenden 29 Aufgaben, die von einfachen Aufwärmübungen bis hin zu zermürbenden Marathons reichten, und forderten sie auf, C++-Code zu schreiben, um sie zu lösen.
Hier ist, wie sich das Duell nach Schwierigkeitsgrad aufgeschlüsselt entwickelte:
1. Das Aufwärmen (Einfache Aufgaben)
Stellen Sie sich diese als einfache Rechenaufgaben oder grundlegende Logikrätsel vor.
- Das Ergebnis: Beide Studierenden leisteten hervorragende Arbeit. Sie waren wie zwei Spitzensportler beim 100-Meter-Lauf; beide beendeten das Rennen erfolgreich.
- Der Haken: Obwohl beide die richtigen Antworten fanden, lief DeepSeek manchmal etwas langsamer und verbrauchte etwas mehr „Energie" (Speicher) als ChatGPT, aber beide überquerten die Ziellinie.
2. Der Mittelstreckenlauf (Mittelschwere Aufgaben)
Hier wurde das Rennen interessant. Diese Probleme erforderten etwas mehr Strategie und Planung.
- ChatGPT: Dieser Studierende war hier der klare Gewinner. Er löste etwa 55 % dieser Probleme korrekt. Er war wie ein erfahrener Marathonläufer, der genau weiß, wie er sein Tempo einteilen muss.
- DeepSeek: Dieser Studierende hatte erhebliche Schwierigkeiten und löste nur etwa 18 % der mittelschweren Probleme. Es war, als wäre er auf halbem Weg des Rennens verwirrt worden, über die eigenen Füße gestolpert oder hätte die Regeln vergessen.
- Warum? Die Studie legt nahe, dass ChatGPT während seines Trainings möglicherweise mehr Übung mit diesem spezifischen Typ von Daten für „wettbewerbsorientierte Programmierung" hatte, was ihm einen Vorsprung verschaffte.
3. Der Ultramarathon (Schwere Aufgaben)
Dies waren die härtesten Herausforderungen, die komplexe, mehrstufige Logik erforderten.
- Das Ergebnis: Beide Studierenden stießen an eine Wand.
- ChatGPT schaffte es, nur 1 von 9 schweren Problemen zu lösen.
- DeepSeek scheiterte daran, keines der schweren Probleme zu lösen (0 %).
- Die Metapher: Stellen Sie sich vor, Sie bitten beide Studierenden, ein Wolkenkratzer von Grund auf ohne Bauplan zu errichten. Beide blieben stecken. ChatGPT versuchte, ein paar Etagen zu bauen, bevor die Struktur kollabierte (Laufzeitfehler), während DeepSeek oft nicht einmal das Fundament legen konnte (Kompilierungsfehler) oder vor dem Abschluss die Energie ausging (Speichergrenzen).
Der „Energie"-Verbrauch (Speicher und Zeit)
Die Forscher untersuchten auch, wie viel „Treibstoff" (Computerspeicher) und Zeit jeder Studierende verbrauchte.
- ChatGPT war bei den einfacheren und mittelschweren Aufgaben im Allgemeinen schneller und effizienter mit seinen Ressourcen.
- DeepSeek verbrauchte manchmal eine massive Menge an Speicher oder benötigte sehr lange zum Nachdenken, insbesondere bei den schweren Aufgaben. In einem Fall brauchte DeepSeek so lange zum Nachdenken über ein Problem, dass es vollständig abgelaufen war (Timeout).
Das Fazit
Die Studie kommt zu dem Schluss, dass DeepSeek-R1 zwar ein mächtiger neuer Anwärter ist, der einfache Aufgaben gut bewältigen kann, ChatGPT o3-mini jedoch derzeit der bessere „Trainer" für Programmierherausforderungen mittlerer Schwierigkeit ist. Wenn die Probleme jedoch wirklich schwierig werden, benötigen beide Modelle menschliche Hilfe. Sie sind noch nicht bereit, die schwierigsten Rätsel allein zu lösen.
Wichtiger Hinweis aus der Studie:
Die Forscher baten jeden Studierenden nur einmal, das Problem zu versuchen (ein „Single-Shot"-Versuch). Sie ließen sie nicht erneut versuchen, wenn sie scheiterten, oder nach Hinweisen fragen. Die Studie stellt fest, dass die Ergebnisse anders hätten ausfallen können, wenn Menschen sie hätten leiten dürfen oder wenn sie eine andere, spezialisiertere Version von DeepSeek (DeepSeek-Coder genannt) verwendet hätten. Aber basierend auf diesem spezifischen Test lag ChatGPT im mittleren Bereich vorne, während beide auf dem höchsten Niveau Schwierigkeiten hatten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.