← Últimos artículos
💬 NLP

SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring

El artículo presenta SWE-Bench ProMax, un benchmark multilingüe de 170 tareas de refactorización de código a gran escala rigurosamente curadas, diseñado para superar las fallas y la saturación de las evaluaciones existentes, demostrando que los agentes de IA de vanguardia actuales todavía tienen dificultades con los desafíos complejos de la ingeniería de software que preservan el comportamiento.

Autores originales: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

Publicado 2026-08-11
📖 3 min de lectura☕ Lectura para el café

Autores originales: Yuling Shi, Jinghan Xu, Kelin Fu, Wenhao Zeng, Shilin He, Lei Zhang, Yue Liu, Zelin Zhao, Terry Yue Zhuo, Jialun Cao, Siyu Ye, Tianyu Liu, Kai Cai, Shing-Chi Cheung, Xiaodong Gu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un mundo donde las computadoras están aprendiendo a ser ingenieros de software. Durante años, los científicos han puesto a prueba a estos "agentes de codificación de IA" pidiéndoles que resuelvan acertijos diminutos y aislados, como escribir una sola función para sumar dos números. Es como probar a un piloto haciendo que un avión ruede por la pista de aterrizaje. Pero el software real no se construye línea por línea; es una ciudad masiva e interconectada de código donde cambiar una señal de tráfico podría requerir actualizar mapas, semáforos y horarios de autobuses en toda la metrópolis. La gran pregunta que se hacen los investigadores es: ¿Pueden estos agentes de IA lidiar con la realidad desordenada y compleja de reescribir grandes fragmentos de software sin romper nada? Este es el reino de la "refactorización de código": el arte de reorganizar el cableado interno de un edificio sin cambiar cómo se encienden las luces para las personas en su interior.

Presentamos SWE-Bench ProMax, una nueva prueba superdesafiante diseñada para ver si los agentes de IA están listos para las grandes ligas. Las pruebas anteriores eran como un videojuego en "Modo Fácil", donde la IA a menudo podía confiar en memorizar respuestas o resolver problemas que eran demasiado simples. Los creadores de este nuevo benchmark se dieron cuenta de que si las pruebas son demasiado fáciles o están mal diseñadas, las puntuaciones altas de la IA son solo una ilusión de inteligencia. Así que construyeron un desafío de "Modo Difícil". Reunieron 170 desafíos de software del mundo real de siete lenguajes de programación diferentes (incluyendo Python, Java, C++ y Rust). Estos no son arreglos pequeños; son remodelaciones masivas donde la IA debe coordinar cambios en un promedio de 11.4 archivos diferentes y reescribir más de 260 líneas de código, todo esto mientras asegura que el software se comporte exactamente de la misma manera que antes.

Los resultados son un baño de realidad para la industria de la IA. Cuando los modelos de IA más inteligentes y costosos fueron lanzados a esta arena, no superaron la prueba con éxito. El mejor modelo logró resolver solo el 41.2% de las tareas. Esto sugiere que, si bien la IA está mejorando en tareas pequeñas, todavía lucha con la coordinación compleja y de múltiples pasos requerida para la ingeniería del mundo real. Curiosamente, el artículo encontró que gastar más dinero en un modelo no siempre significaba mejores resultados; algunos modelos de código abierto más económicos funcionaron casi tan bien como los gigantes costosos. ¿La razón principal por la que la IA falló? Tendía a ser un trabajador "parcial". Reparaba el problema principal pero olvidaba actualizar los archivos de soporte, como reparar una tubería con fugas pero olvidar avisar al medidor de agua, causando que todo el sistema fallara. Este benchmark demuestra que la verdadera maestría en ingeniería de software para la IA es todavía un trabajo en progreso, que requiere un nivel de planificación y coordinación entre archivos que los agentes actuales aún no han logrado dominar del todo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →