← Últimos artículos
📊 statistics

Benchmarking AI Performance on End-to-End Data Science Projects

Este estudio presenta un nuevo benchmark de 40 proyectos de ciencia de datos integrales para evaluar modelos de IA, revelando que, aunque estos pueden realizar tareas rutinarias de nivel inicial, su desempeño en tareas que requieren juicio varía significativamente y exige verificación humana.

Autores originales: Evelyn Hughes, Rohan Alexander

Publicado 2026-02-17
📖 4 min de lectura☕ Lectura para el café

Autores originales: Evelyn Hughes, Rohan Alexander

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que la ciencia de datos es como cocinar un banquete completo, no solo picar verduras. Un buen científico de datos no solo sabe escribir código (como picar cebollas), sino que también debe saber elegir los ingredientes, planear el menú, cocinar el plato, probar que sabe bien, ponerlo en un plato bonito y escribir una receta que cualquiera pueda seguir.

Este artículo es como un examen de cocina para las Inteligencias Artificiales (IA). Los autores, Evelyn y Rohan, querían ver si las IAs actuales podían cocinar todo el banquete solas, desde el principio hasta el final, o si solo eran buenas picando verduras.

Aquí tienes los puntos clave explicados de forma sencilla:

1. El Problema: Las IAs son "Cocineros de una sola tarea"

Antes, las pruebas para ver si una IA era inteligente se centraban en tareas pequeñas: "¿Puedes escribir una función de código?" o "¿Puedes resolver este problema de matemáticas?".

  • La analogía: Era como probar a un cocinero solo pidiéndole que pelara una patata. Si lo hacía bien, decíamos: "¡Es un gran chef!". Pero en la vida real, un chef tiene que hacer el menú, comprar los ingredientes, cocinar, servir y limpiar.
  • La realidad: Las IAs actuales son excelentes siguiendo recetas paso a paso, pero a menudo se pierden cuando tienen que tomar decisiones creativas o explicar por qué hicieron algo.

2. La Prueba: 40 Menús Completos

Para poner a prueba a las IAs, los autores crearon un "examen" con 40 proyectos completos.

  • La tarea: Pedirle a la IA que usara datos reales de la ciudad de Toronto, limpiara esos datos, hiciera gráficos, escribiera un código en Python y redactara un informe final (como un artículo de periódico).
  • El estándar: Compararon el trabajo de las IAs con el de estudiantes universitarios de último año. Si un estudiante obtiene un 80%, se considera un trabajo de "A-" (muy bueno).

3. Los Resultados: ¿Quién ganó el concurso?

Las IAs fueron a la cocina y empezaron a cocinar. Los resultados fueron muy variados, como si mezclaras a un chef novato con un maestro:

  • Los "Maestros Chef" (Claude Opus 4.6, GPT-5.2, Gemini 3 Flash): Estos modelos obtuvieron notas de 80% a 85%. ¡Se comportaron casi como estudiantes universitarios excelentes! Podían seguir instrucciones, escribir código limpio y hacer gráficos decentes.
  • Los "Ayudantes de Cocina" (Grok-4, Gemini 3 Pro, Llama 4): Obtuvieron notas medias (entre 50% y 70%). Podían hacer el trabajo básico, pero les faltaba pulir los detalles o entendían mal algunas instrucciones.
  • El "Chef Antiguo" (GPT-4o): Este modelo, que antes era el rey, ahora quedó muy atrás con un 32%. Se quedó atascado en tareas simples y no logró completar el banquete.

4. ¿Dónde fallaron las IAs? (Los detalles que importan)

Aquí es donde la analogía se pone interesante. Las IAs eran muy buenas en lo mecánico, pero malas en lo humano:

  • Lo que hacían bien (Seguir la receta): Si les decías "Escribe un título" o "Haz una lista de ingredientes", lo hacían perfecto. Eran como robots siguiendo un manual.
  • Lo que les costaba (La creatividad y el juicio):
    • El Abstracto (La sinopsis): Les costaba mucho resumir todo el trabajo en pocas palabras. Escribían cosas vacías o repetitivas.
    • Las Citas (Los créditos): A veces inventaban referencias bibliográficas que no existían (alucinaciones) o ponían signos de interrogación en lugar de los datos reales.
    • La "Medición" (Explicar el origen): Les costaba explicar cómo un fenómeno del mundo real (como "la pobreza") se convierte en un número en una hoja de cálculo. Les faltaba contexto.
    • El Juicio: Si había que decidir qué gráfico era el mejor para contar una historia, a menudo elegían el incorrecto.

5. La Conclusión: ¿Podemos confiar en ellas?

El mensaje final es como decir: "Las IAs son excelentes asistentes, pero no son jefes de cocina todavía".

  • Pueden hacer el trabajo aburrido: Pueden escribir el código, limpiar los datos y hacer los gráficos rápidos.
  • Pero necesitan supervisión: No puedes dejarlas solas. Si no las revisas, podrían inventar datos, citar libros que no existen o explicar mal los resultados.
  • El futuro: Las IAs más nuevas se acercan mucho al nivel de un buen estudiante universitario, pero aún les falta la "sabiduría" y el "sentido común" de un experto humano para tomar decisiones importantes.

En resumen: Las IAs han aprendido a cocinar muy rápido y a seguir recetas complejas, pero todavía necesitan a un humano (un "sommelier" o crítico) para asegurarse de que el plato final tenga sabor, sentido y no esté envenenado por errores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →