← Últimos artículos
🤖 AI

A Showdown of ChatGPT vs DeepSeek in Solving Programming Tasks

Este estudio compara ChatGPT 03-mini y DeepSeek-R1 en tareas de programación de Codeforces, revelando que, aunque ambos modelos rinden de manera similar en problemas fáciles y tienen dificultades con los difíciles, ChatGPT supera significativamente a DeepSeek-R1 en desafíos de dificultad media.

Autores originales: Ronas Shakya, Sam Urmian, Mohammad Khalil

Publicado 2026-05-21
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ronas Shakya, Sam Urmian, Mohammad Khalil

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina dos estudiantes brillantes pero muy diferentes sentándose para una serie de exámenes de programación. Uno es ChatGPT (específicamente la versión o3-mini), un estudiante bien conocido y altamente entrenado que ha leído casi todos los libros de la biblioteca. El otro es DeepSeek-R1, un nuevo retador de código abierto procedente de China, conocido por su intenso enfoque en el razonamiento lógico y los acertijos matemáticos.

Los investigadores de la Universidad de Bergen decidieron ponerlos a prueba utilizando un "gimnasio" para programadores llamado Codeforces. Les asignaron a ambos estudiantes 29 problemas, que iban desde sencillos ejercicios de calentamiento hasta maratones agotadoras, y les pidieron escribir código en C++ para resolverlos.

Así es como se desarrolló el enfrentamiento, desglosado por dificultad:

1. El Calentamiento (Tareas Fáciles)

Piensa en estos como problemas aritméticos simples o acertijos de lógica básica.

  • El Resultado: Ambos estudiantes lo hicieron muy bien. Fueron como dos atletas de primer nivel corriendo una carrera de 100 metros; ambos cruzaron la meta con éxito.
  • El Detalle: Aunque ambos obtuvieron las respuestas correctas, DeepSeek a veces corrió un poco más lento y utilizó un poco más de "energía" (memoria) que ChatGPT, pero ambos cruzaron la línea de meta.

2. La Media Distancia (Tareas Medias)

Aquí es donde la carrera se puso interesante. Estos problemas requerían un poco más de estrategia y planificación.

  • ChatGPT: Este estudiante fue el claro ganador aquí. Resolvió correctamente aproximadamente el 55% de estos problemas. Fue como un maratonista experimentado que sabe exactamente cómo dosificar su esfuerzo.
  • DeepSeek: Este estudiante tuvo dificultades significativas, resolviendo solo alrededor del 18% de los problemas medios. Fue como si se hubiera confundido a mitad de la carrera, tropezado con sus propios pies o olvidado las reglas.
  • ¿Por qué? El documento sugiere que ChatGPT podría haber tenido más práctica con este tipo específico de datos de "programación competitiva" durante su entrenamiento, lo que le dio una ventaja inicial.

3. La Ultra-Maratón (Tareas Difíciles)

Estos fueron los desafíos más difíciles, que requerían lógica compleja y de múltiples pasos.

  • El Resultado: Ambos estudiantes chocaron contra un muro.
    • ChatGPT logró resolver solo 1 de 9 problemas difíciles.
    • DeepSeek no logró resolver ninguno de los problemas difíciles (0%).
  • La Metáfora: Imagina pedirle a ambos estudiantes que construyan un rascacielos desde cero sin un plano. Ambos se quedaron atascados. ChatGPT intentó construir unos pocos pisos antes de que la estructura colapsara (errores de ejecución), mientras que DeepSeek a menudo ni siquiera pudo comenzar los cimientos (errores de compilación) o se quedó sin energía (límites de memoria) antes de terminar.

El Consumo de "Energía" (Memoria y Tiempo)

Los investigadores también examinaron cuánto "combustible" (memoria de la computadora) y tiempo utilizó cada estudiante.

  • ChatGPT fue generalmente más rápido y eficiente con sus recursos en las tareas fáciles y medias.
  • DeepSeek a veces utilizó una cantidad masiva de memoria o tardó mucho tiempo en pensar, especialmente en las tareas difíciles. En un caso, DeepSeek tardó tanto en pensar sobre un problema que se agotó el tiempo completamente.

La Conclusión

El documento concluye que, aunque DeepSeek-R1 es un nuevo contendiente poderoso que puede manejar bien las tareas simples, ChatGPT o3-mini es actualmente el mejor "entrenador" para desafíos de programación de dificultad media. Sin embargo, cuando los problemas se vuelven verdaderamente difíciles, ambos modelos necesitan ayuda humana. Aún no están listos para resolver los acertijos más difíciles por sí solos.

Nota Importante del Estudio:
Los investigadores solo pidieron a cada estudiante que intentara el problema una vez (un intento de "disparo único"). No les permitieron intentarlo de nuevo si fallaban ni pedir pistas. El documento señala que si se hubiera permitido a los humanos guiarlos o si hubieran utilizado una versión diferente y más especializada de DeepSeek (llamada DeepSeek-Coder), los resultados podrían haber sido diferentes. Pero basándose en esta prueba específica, ChatGPT salió por delante en el terreno medio, mientras que ambos tuvieron dificultades en el nivel superior.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →