← Últimos artículos
💬 NLP

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

Este artículo presenta ClassEval-Pro, un riguroso punto de referencia transversal de 300 tareas de generación de código a nivel de clase validado por un conjunto de modelos de lenguaje grandes y suites de pruebas de alta cobertura, que revela que los modelos de lenguaje grandes más avanzados actuales tienen dificultades para crear código composicional debido a errores de lógica y dependencias, logrando un mejor Pass@1 de solo 45,6%.

Autores originales: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

Publicado 2026-04-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un chef robot cómo cocinar.

La Vieja Forma (Nivel de Función):
Hasta ahora, los investigadores han probado principalmente a estos chefs de IA pidiéndoles que preparen un solo ingrediente simple, como "picar una cebolla" o "hervir agua". La IA es excelente en esto. Puede picar cebollas perfectamente el 90% de las veces. Esto es como probar si el robot puede manejar una sola herramienta.

La Pieza Faltante (Nivel de Clase):
Pero en el mundo real, cocinar no se trata solo de picar una cosa. Se trata de construir un plato completo donde los ingredientes necesitan trabajar juntos. Necesitas una salsa que sepa cuánto sal se añadió, un adorno que combine con el plato principal y una estrategia de presentación que mantenga todo unido. Esto es lo que el artículo llama "creación de código composicional". Es la capacidad de construir una "clase" completa y organizada (una unidad de software autocontenida) donde múltiples partes se comunican correctamente entre sí.

El Problema:
Los autores dicen que no teníamos una buena prueba para esta habilidad de "plato completo". Las pruebas antiguas eran demasiado simples, y las pocas pruebas que existían fueron hechas por humanos, lo cual es lento, costoso y las recetas podrían haberse filtrado a la IA durante su entrenamiento (como si la IA hiciera trampa memorizando las respuestas de la prueba).

La Solución: ClassEval-Pro
El equipo construyó una nueva y masiva prueba llamada ClassEval-Pro. Así es como la crearon, usando una analogía creativa:

  1. Los Ingredientes (Datos): En lugar de escribir recetas a mano, fueron a una gigantesca biblioteca digital (GitHub) y tomaron recetas escritas después de enero de 2025. Esto asegura que la IA no las haya visto antes, por lo que es una prueba justa.
  2. El Tazón de Mezcla (Transversal de Dominios): No solo mezclaron ingredientes similares. Fueron obligados a mezclar mundos completamente diferentes. Imagina pedirle al robot que construya una "Calculadora Financiera" que también tenga que gestionar un "Inventario de Videojuegos". Tiene que hacer que la lógica del dinero y la lógica del juego funcionen juntas en un solo programa coherente.
  3. La Prueba de Sabor (Validación): Antes de que la prueba comience, utilizan un panel de jueces de IA para verificar si la receta tiene sentido y si las "pruebas de sabor" de la prueba (pruebas de código) cubren al menos el 90% de la receta. Si la receta está rota, la desechan.

Los Resultados: Los Chefs Robot Luchan
Pidieron a cinco de los chefs de IA más inteligentes (como GPT-5.1, Gemini y Qwen) que prepararan estos platos complejos.

  • La Puntuación: Incluso el mejor chef solo logró preparar correctamente alrededor del 45% de los platos. Eso es una gran caída desde el 90% que obtienen en tareas simples de "picar una cebolla".
  • La Brecha: Hubo una gran diferencia entre el mejor chef y el peor. El mejor obtuvo un 45% de aciertos, mientras que el más débil solo logró un 28%. Esto demuestra que la prueba es buena para distinguir entre chefs fuertes y débiles.
  • La Trampa del "Método": Curiosamente, los chefs a menudo podían escribir los pasos individuales correctamente (como "picar la cebolla" o "añadir sal"). Pero cuando intentaban unir todo en un solo plato funcional, las cosas se desmoronaban. La cebolla estaba picada, pero la sal se añadió a la olla equivocada.

Cómo Intentaron Ayudar (Estrategias)
Los investigadores probaron dar a los chefs diferentes formas de abordar la cocina:

  • El enfoque "De Abajo hacia Arriba": "Comienza con los ingredientes base, luego prepara la salsa, luego el adorno". Esto ayudó a los chefs más débiles a mejorar significativamente.
  • El enfoque "De Arriba hacia Abajo": "Planifica todo el menú primero, luego cocina". Esto ayudó a los chefs más fuertes.
  • El enfoque "Composicional": "Escribe la receta de la salsa, luego la receta del adorno, luego pégalos juntos". Esto fue un desastre. Los chefs se confundieron al intentar unir las piezas y su tasa de éxito se desplomó a casi cero (1.3% para un modelo).

¿Qué Salió Mal? (Los Errores)
El equipo examinó 500 platos fallidos para ver qué salió mal. Encontraron dos problemas principales:

  1. Errores Lógicos (56%): El robot entendió las palabras pero se equivocó en el significado. (Por ejemplo: "Si el usuario está desconectado, dale un mensaje de éxito" en lugar de un mensaje de error).
  2. Errores de Dependencia (38%): Las partes no encajaban. (Por ejemplo: La receta de la salsa pedía un ingrediente que la receta del adorno no tenía, o usaban nombres diferentes para el mismo tazón).

La Gran Conclusión
El artículo concluye que, aunque la IA es increíble escribiendo pequeños fragmentos de código aislados, sigue siendo muy mala orquestando un sistema completo. La parte más difícil no es escribir el código para una sola función; es asegurarse de que esa función se comunique correctamente con las otras funciones, comparta los datos adecuados y no rompa todo el sistema.

ClassEval-Pro es el nuevo "concurso de cocina" que finalmente obliga a estos chefs de IA a demostrar que pueden dirigir una cocina completa, no solo picar una sola verdura.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →