← Últimos artículos
🤖 AI

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

Este artículo presenta un banco de pruebas basado en torneos que evalúa a los modelos de lenguaje de gran tamaño frente a estudiantes de posgrado en un problema logístico complejo impulsado por el mercado, revelando que los agentes codificados por humanos superan significativamente a las soluciones generadas por LLM, con la mayoría de los agentes de LLM fallando en superar incluso los puntos de referencia simples e incluso degradando las estrategias humanas óptimas cuando se les pide que las mejoren.

Autores originales: Panayiotis Danassis, Naman Goel

Publicado 2026-06-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Panayiotis Danassis, Naman Goel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Pregunta: ¿Puede el "Vibe Coding" Vencer a un Estudiante de Posgrado?

Imagina que tienes un asistente robot superinteligente (un Modelo de Lenguaje Extenso, o LLM) que puede escribir código con solo hablarle. Dices: "Constrúyeme una aplicación de entregas", y el robot escribe el código en segundos. Esto se llama "Vibe Coding".

La gran pregunta que plantea este artículo es: ¿Es este robot realmente lo suficientemente inteligente como para resolver problemas de negocio reales, complejos y de alto riesgo, o es solo bueno escribiendo código que parece correcto pero falla cuando las cosas se complican?

Para averiguarlo, los investigadores organizaron un torneo de programación gigante.

La Arena: El Juego de "Subasta, Recogida y Entrega"

En lugar de pedirle a los robots que resuelvan problemas matemáticos simples (como "¿cuánto es 2+2?"), los pusieron en una simulación compleja llamada Problema de Subasta, Recogida y Entrega (APDP).

Piensa en esto como un juego de Ajedrez Logístico de alto nivel:

  1. La Subasta: Varias empresas (agentes) están pujando por trabajos de entrega. Los trabajos se venden uno por uno. Tienes que adivinar cuánto pujar. Si pujas demasiado alto, pierdes dinero. Si pujas demasiado bajo, podrías ganar el trabajo pero perder dinero en la entrega. Tienes que adivinar qué harán tus competidores.
  2. La Planificación: Una vez que ganas un trabajo, tienes que decidir la mejor ruta para que tus camiones recojan y entreguen los paquetes. Tienes espacio limitado en los camiones y no puedes romper las reglas.
  3. El Objetivo: El ganador es la empresa que genera más beneficio (Dinero ganado por las pujas menos el coste de conducir).

Esto no se trata solo de escribir código que no se bloquee; se trata de escribir código que piense estratégicamente, prediga el futuro y supere a sus oponentes.

Los Concursantes

Los investigadores enfrentaron a dos equipos:

  • Equipo Humano: 17 agentes escritos por estudiantes de posgrado de una universidad (EPFL) antes de que existieran las herramientas de codificación por IA. Estos estudiantes pasaron semanas pensando, planificando y programando a mano.
  • Equipo IA: 40 agentes escritos por los modelos de IA más avanzados del mundo (como GPT-5, Claude, Gemini) usando "Vibe Coding". Los investigadores les dieron exactamente las mismas instrucciones que recibieron los estudiantes.

Los Resultados: Los Humanos Ganan, Por Diferencia

Los resultados fueron sorprendentes y claros:

  1. Los 5 Mejores son Humanos: En cada uno de los torneos, los cinco primeros puestos fueron ocupados por los estudiantes humanos. Los agentes de IA no pudieron entrar en el top 5.
  2. IA vs. El "Línea Base" Sin Cerebro: Los investigadores crearon un agente de IA muy simple y torpe (básicamente un adivinador aleatorio). 33 de los 40 agentes de IA perdieron contra este agente simple. La IA era tan mala en estrategia que una calculadora básica la venció.
  3. El Desastre del "Arreglo": En una prueba final, los investigadores tomaron el código ganador de los humanos y le pidieron a la mejor IA que lo "mejorara". La IA intentó retocar el código, pero en lugar de mejorarlo, lo hizo peor. La versión mejorada cayó del primer al décimo lugar.

¿Por qué Falló la IA?

El artículo explica que, si bien la IA es excelente en la sintaxis (escribir código sin errores ortográficos), tiene dificultades con el razonamiento (entender el "por qué" y el "cómo" de las estrategias complejas).

  • El Fallo de la "Heurística Admisible": En una prueba más sencilla, se le pidió a la IA que utilizara un truco matemático específico (búsqueda A*) para encontrar el mejor camino. La IA olvidaba constantemente la regla más básica de este truco, incluso cuando los investigadores se lo decían explícitamente. Es como pedirle a un chef que hornee un pastel pero que olvide que los huevos son un ingrediente clave, incluso después de habérselo dicho.
  • El Error de "Tiempo de Espera": Los agentes de IA a menudo se quedaban atrapados en bucles o tardaban demasiado en pensar, lo que causaba que perdieran la subasta porque se les agotaba el tiempo. El código humano no hacía esto.
  • Falta de Estrategia: Los agentes de IA a menudo pujaban a ciegas o planificaban rutas que desperdiciaban combustible. No podían "leer la situación" ni predecir lo que hacían sus competidores.

La Conclusión

El artículo concluye que los LLM aún no son "Programadores de Nivel de Posgrado".

Son excelentes escribiendo código que funciona (que no tiene errores de sintaxis), pero actualmente son pésimos escribiendo código que compite en escenarios complejos del mundo real que requieren planificación a largo plazo y estrategia.

La Analogía:
Imagina que tienes un robot que puede escribir una receta perfecta para un pastel. Sabe exactamente cuántas tazas de harina usar. Pero si le pides que dirija una panadería en una ciudad donde los precios cambian cada minuto, los competidores intentan robarle los clientes y tiene un presupuesto limitado, el robot probablemente quebrará. Puede escribir la receta, pero no puede dirigir el negocio.

Los investigadores dicen que es hora de dejar de comprobar solo si el código "funciona" (pasa una prueba) y empezar a comprobar si el código realmente puede ganar en el mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →