← Últimos artículos
💬 NLP

Evaluating LLMs on Real-World Software Performance Optimization

Este artículo presenta SWE-Pro, un riguroso benchmark a nivel de repositorio derivado de 102 optimizaciones de expertos que revela que los modelos de lenguaje extensos actuales fallan significativamente al intentar igualar el rendimiento de nivel humano en la optimización de software del mundo real, logrando ganancias insignificantes en comparación con las sustanciales aceleraciones y reducciones de memoria entregadas por ingenieros expertos.

Autores originales: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

Publicado 2026-06-25
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ezgi Sarıkayak, Wenchao Gu, Hesham Ghonim, Chunyang Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: El "Chef Veloz" frente al "Maestro Chef"

Imagina que tienes una cocina de un restaurante masiva y con mucho movimiento (un código de software del mundo real). Contratas a un equipo de Chefs de IA (Modelos de Lenguaje Grande o LLM) para ayudar a los Maestros Chefs (expertos humanos) a cocinar más rápido y a usar menos energía.

Los Maestros Chefs saben exactamente cómo picar verduras de manera eficiente, organizar la despensa para ahorrar pasos y ajustar la temperatura de la estufa para ahorrar combustible. Tienen años de experiencia.

Los Chefs de IA son increíblemente inteligentes. Pueden leer la receta, entender los ingredientes e incluso escribir nuevas recetas que se ven perfectas en el papel. Pero la gran pregunta que plantea este artículo es: ¿Pueden estos Chefs de IA realmente hacer que la cocina funcione más rápido y use menos energía en el mundo real, o solo hacen que las cosas se vean bien sin mejorar realmente la velocidad?

El problema: Las pruebas anteriores eran demasiado simples

Anteriormente, los investigadores probaban a los Chefs de IA dándoles una tarea única y diminuta: "Pica esta única zanahoria".

  • El fallo: En una cocina real, no solo picas una zanahoria. Picas 10, 1,000 o 100,000. A veces las zanahorias están mojadas; a veces están congeladas.
  • El resultado: Las pruebas antiguas eran como juzgar a un chef por lo bien que pica una sola zanahoria en una habitación silenciosa. No probaban si el chef podía manejar una hora punta con 1,000 pedidos, o si el chef accidentalmente usaba demasiada agua (memoria) mientras intentaba ser rápido.

El artículo argumenta que estas pruebas antiguas eran demasiado fáciles y no detectaban el "ruido" (fluctuaciones aleatorias) que ocurre en las computadoras reales.

La solución: SWE-Pro (El simulador de la "Cocina Real")

Los autores construyeron una prueba nueva y mucho más difícil llamada SWE-Pro. Piensa en esto como una simulación de alta tecnología de una cocina caótica y real.

  1. Recetas Reales: No inventaron tareas ficticias. Analizaron 102 ejemplos reales donde expertos humanos habían optimizado con éxito el código en proyectos de código abierto famosos (como pandas, scikit-learn y xarray). Estas son las recetas del "Estándar de Oro".
  2. La Prueba de Esfuerzo: En lugar de probar a la IA con una sola entrada, SWE-Pro los prueba en muchos escenarios diferentes.
    • Analogía: No es solo "pica 10 zanahorias". Es "pica 10 zanahorias", luego "pica 100", luego "pica 10,000", y hazlo con zanahorias mojadas, zanahorias congeladas y zanahorias de diferentes tamaños.
  3. El Filtro de Ruido: Las computadoras son desordenadas. A veces un programa corre lento solo porque la computadora estaba pensando en otra cosa (como un camarero que deja caer una bandeja). SWE-Pro ejecuta las pruebas una y otra vez, utilizando un "filtro de ruido" estadístico especial para asegurar que, si la IA dice "soy más rápida", sea realmente cierto y no solo un golpe de suerte.
  4. Dos Métricas: Miden dos cosas:
    • Velocidad: Qué tan rápido se sirve la comida (Tiempo de ejecución/Runtime).
    • Memoria: Cuánto espacio de encimera y almacenamiento usa el chef (Pico de Memoria y Uso de Memoria Ponderado en el Tiempo).

Los Resultados: Los Chefs de IA tienen dificultades

Cuando sometieron a los mejores modelos de IA (como GPT-5.2, Claude Sonnet 4.6, etc.) a esta rigurosa prueba de la "Cocina Real", los resultados fueron sorprendentes y decepcionantes.

  • Los Expertos Humanos (Estándar de Oro): Cuando los humanos optimizaron el código, lograron mejoras masivas.
    • Analogía: El Maestro Chef redujo el tiempo de cocción 15 veces y redujo el espacio de encimera necesario 171 veces. Encontraron formas ingeniosas de reorganizar la cocina que ahorraron enormes cantidades de recursos.
  • Los Chefs de IA:
    • Velocidad: Los modelos de IA apenas hicieron diferencia. En la mayoría de los casos, sus "mejoras" fueron tan pequeñas que no podían distinguirse del ruido aleatorio.
    • Memoria: Los modelos de IA casi nunca lograron ahorrar memoria. Fueron casi inexistentes en esta área.
    • El Problema de la "Falta de Señal": Incluso cuando la IA escribía código que pasaba las pruebas básicas (la comida sabía bien), rara vez producía una mejora de velocidad medible. Era como un chef que pica las zanahorias ordenadamente pero tarda exactamente el mismo tiempo que antes.
    • La Regresión: A veces, la IA hacía las cosas más lentas. ¡Un modelo (GPT-5.2) de hecho hizo el código un 30% más lento en promedio!

La Conclusión Clave

El artículo concluye que, si bien la IA es excelente escribiendo código que parece correcto y sigue las reglas, actualmente es muy mala en la ingeniería profunda y compleja requerida para hacer que el software corra significativamente más rápido o use menos memoria en escenarios del mundo real.

  • La Brecha: Hay una brecha enorme entre lo que la IA puede hacer hoy y lo que pueden hacer los ingenieros humanos expertos.
  • El Cuello de Botella: El problema no es que la IA no pueda lograr una gran mejora si tiene suerte (puede hacerlo, en casos raros). El problema es que la IA no puede encontrar de manera confiable las oportunidades para realizar esas mejoras en primer lugar.

En resumen: Si le pides a una IA que "haga este software más rápido", podría escribir un parche que se vea bien, pero no esperes que realmente acelere tu computadora o ahorre tu memoria. Por ahora, ese trabajo todavía pertenece a los expertos humanos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →