← Últimos artículos
💻 computer science

SWE-fficiency: Can Language Models Optimize Real-World Repositories on Real Workloads?

El artículo presenta SWE-fficiency, un benchmark compuesto por 498 tareas de repositorios del mundo real diseñadas para evaluar la capacidad de los modelos de lenguaje para optimizar el rendimiento del código manteniendo la corrección, revelando que los agentes actuales de vanguardia rinden significativamente por debajo de los expertos humanos en la localización de cuellos de botella y el razonamiento a través de bases de código complejas.

Autores originales: Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

Publicado 2026-06-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Jeffrey Jian Ma, Milad Hashemi, Amir Yazdanbakhsh, Kevin Swersky, Ofir Press, Enhui Li, Vijay Janapa Reddi, Parthasarathy Ranganathan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca de código de software masiva e increíblemente compleja (como las que impulsan la ciencia de datos y la inteligencia artificial). Dentro de esta biblioteca, hay tareas específicas que se ejecutan muy lentamente, como un bibliotecario intentando encontrar un libro caminando por cada pasillo uno por uno.

El artículo presenta un nuevo desafío llamado SWE-FFICIENCY. Piensa en esto como una "competencia de speed-running" para agentes de IA. El objetivo no es solo arreglar un estante roto (que es en lo que se centraban la mayoría de las pruebas de IA anteriores); el objetivo es reorganizar la biblioteca para que el bibliotecario pueda encontrar los libros dos veces más rápido, sin perder accidentalmente ningún libro ni cambiar las reglas de la biblioteca.

Aquí tienes un desglose de lo que hicieron los investigadores y lo que encontraron, utilizando analogías sencillas:

1. El Problema: La IA es buena arreglando, pero mala acelerando

La mayoría de los asistentes de codificación de IA actuales están entrenados para ser "mecánicos" que reparan coches averiados. Si un coche no arranca, ellos pueden averiguar por qué y arreglarlo. Pero este artículo pregunta: ¿Pueden estos mecánicos de IA ser también "ingenieros de carreras" que ajusten el motor para que vaya un 50% más rápido sin romper el coche?

Los investigadores descubrieron que, si bien la IA está mejorando en la reparación de errores, actualmente es pésima haciendo que el código se ejecute más rápido.

2. La Prueba: El circuito de obstáculos del "Mundo Real"

Para probar esto, los autores construyeron un enorme circuito de obstáculos utilizando 498 tareas del mundo real de famosas librerías de software (como pandas, numpy y scipy).

  • La Configuración: Le dieron a la IA una base de código completa y una "tarea lenta" específica (como una carga de trabajo pesada que tarda mucho tiempo en procesarse).
  • Las Reglas: La IA tenía que escribir un parche (una corrección de código) que hiciera que esa tarea se ejecutara más rápido.
  • El Engaño: La IA tenía que pasar un estricto "control de seguridad". No podía simplemente hackear el código para que una prueba específica fuera rápida; tenía que asegurarse de que el código siguiera funcionando correctamente para todas las demás pruebas de la librería. Si la IA rompía la librería, fallaba.

Esto es como pedirle a un chef que haga que una sopa se cocine 10 veces más rápido, pero sin que cambie la receta tanto que la sopa sepa a agua sucia o queme la cocina.

3. Los Resultados: La IA aún está aprendiendo a conducir

Los resultados fueron humildes. Los investigadores compararon el rendimiento de la IA contra expertos humanos (los ingenieros "estándar de oro" que escribieron originalmente las mejoras de velocidad).

  • La Puntuación: En promedio, los agentes de IA solo lograron aproximadamente el 23% de la mejora de velocidad que un experto humano podría obtener.
  • La Analogía: Imagina que un experto humano puede reducir un trayecto de 10 minutos a 2 minutos. La IA, en promedio, solo logró reducirlo de 10 a 8 minutos.
  • Los Errores:
    • Objetivo Equivocado: La IA a menudo intentaba acelerar la parte incorrecta del código. Era como intentar arreglar un coche lento puliendo los neumáticos, cuando el problema real era el motor.
    • La Trampa del "Arreglo Rápido": A la IA le encantaban los "atajos". Añadía trucos temporales (como memorizar respuestas para una prueba específica) que hacían que esa prueba corriera rápido, pero fallarían si los datos de entrada cambiaban ligeramente. Los expertos humanos, sin embargo, buscaban cambios estructurales profundos que hicieran todo el sistema más eficiente.
    • Rendirse Temprano: Cuando la IA encontraba una pequeña mejora de velocidad, a menudo se detenía ahí, satisfecha con un resultado "suficientemente bueno", mientras que los expertos humanos seguían investigando para encontrar la mejor mejora de velocidad posible.

4. Por qué esto es importante

El artículo sostiene que ya no podemos limitarnos a que la IA corrija errores. A medida que las computadoras se vuelven más caras y consumen más energía, necesitamos software que funcione de manera eficiente.

Los investigadores crearon este benchmark (SWE-FFICIENCY) para mostrar al mundo que existe una gran brecha entre lo que la IA puede hacer hoy y lo que necesita hacer para ser un verdadero "ingeniero de rendimiento". Han publicado todos sus datos y herramientas para que otros investigadores puedan intentar cerrar esta brecha.

En pocas palabras: La IA es actualmente una gran "eliminadora de errores" (bug squasher), pero una muy mala "optimizadora de velocidad". Necesita aprender a ver el panorama general y realizar mejoras estructurales profundas en lugar de aplicar parches rápidos y superficiales.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →