← Últimos artículos
💬 NLP

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

Para abordar la contaminación crítica de datos y los casos de prueba inadecuados en los benchmarks existentes como SWE-bench, el artículo presenta SWE-MERA, un benchmark dinámico y continuamente actualizado que aprovecha una canalización automatizada para curar problemas reales de GitHub, ofreciendo un marco de evaluación riguroso y fiable para los modelos de lenguaje de gran tamaño en tareas de ingeniería de software.

Autores originales: Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot cómo arreglar un videojuego roto. Durante mucho tiempo, la mejor forma de probar al robot era darle una lista específica de niveles rotos que todo el mundo ya había visto. Pero aquí está el problema: el robot solo estaba memorizando las respuestas en lugar de aprender realmente a arreglar las cosas. Era como un estudiante que memoriza la clave de respuestas del examen de matemáticas del año pasado, pero fracasa en el nuevo porque los números cambiaron.

Esto es exactamente lo que pasó con SWE-bench, una popular prueba para las habilidades de programación de la IA. El artículo revela que esta vieja prueba tenía filtraciones de respuestas. Alrededor del 32,67% de las correcciones "exitosas" fueron simplemente la IA copiando soluciones que ya había visto, y otro 31,08% pasaron porque las pruebas eran demasiado débiles para detectar errores reales. Era una regla rota.

Entra SWE-MERA, el nuevo y dinámico desafiante. Piensa en SWE-MERA no como un libro de texto estático, sino como un servidor de videojuegos vivo y palpitante que se actualiza cada mes. En lugar de usar acertijos viejos y memorizados, busca constantemente problemas nuevos y reales en internet (específicamente en GitHub, donde millones de personas comparten código).

Cómo funciona la nueva prueba

Los autores construyeron una tubería de robot súper organizada para encontrar estos problemas frescos. Es como una búsqueda del tesoro de alta tecnología con siete reglas estrictas para asegurar que las pistas sean reales:

  1. Elige el patio de recreo adecuado: Solo busca proyectos de Python populares y activos (con al menos 10 estrellas y 10 forks).
  2. Empareja las pistas: Encuentra un problema específico (un "issue") y la solución exacta (un "pull request") que lo arregló, asegurándose de que sean un par perfecto uno a uno.
  3. Verifica el tamaño: Ignora notas diminutas y proyectos enormes y desordenados, manteniendo solo aquellos que son adecuados.
  4. Verifica la corrección: Comprueba que la solución realmente cambia el código y añade una prueba para demostrar que funciona.
  5. Construye el laboratorio: Intenta construir el proyecto en un contenedor seguro e aislado (como un sandbox digital) para ver si las pruebas pasan.
  6. Ejecuta la misión completa: Ejecuta toda la tarea de principio a fin para asegurarse de que sea reproducible.
  7. El Juez de IA: Finalmente, otra IA (el modelo Qwen3-32B) actúa como un profesor estricto, calificando la tarea en una escala de 1 a 10 por corrección y completitud. Si una tarea es demasiado fácil, demasiado difícil o está mal explicada, se descarta.

¿El resultado? Una colección masiva de alrededor de 10,000 tareas potenciales, con 728 muestras de alta calidad listas para ir ahora mismo.

Los resultados: ¿Quién gana realmente?

Los investigadores pusieron a prueba una docena de las IAs de programación más inteligentes con estos problemas frescos. No solo le pidieron a la IA que resolviera el problema una vez; le dieron seis intentos para arreglar el error, con oportunidades para pensar y volver a revisar su trabajo.

Los resultados fueron reveladores:

  • El máximo exponente: El modelo DeepSeek-R1-0528 fue el campeón, arreglando aproximadamente el 27,8% de los problemas en su primer intento y el 40,2% dentro de los seis intentos.
  • El segundo lugar: Devstral-Small-2505 quedó en segundo lugar, resolviendo el 17,2% en el primer intento y el 28,2% en total.
  • Los que sufren: Incluso los modelos grandes y potentes como Llama-3.3-70B (que es excelente charlando pero no está construido específicamente para código) solo lograron un 8,7% en el primer intento. El modelo más pequeño, Qwen2.5-Coder-7B, solo pudo arreglar un 2,7% en el primer intento.

El artículo sugiere que estas nuevas pruebas dinámicas son mucho mejores para distinguir entre una IA inteligente y una que memoriza. Por ejemplo, algunos modelos que se veían geniales en las pruebas antiguas en realidad lo hicieron peor en las nuevas tareas de 2025, sugiriendo que solo estaban memorizando las respuestas antiguas.

Lo que esta prueba no hace

Es importante saber qué deja fuera este nuevo benchmark. El artículo establece explícitamente que esta prueba no mide qué tan legible, mantenible o seguro es el código. Tampoco prueba el trabajo en equipo o qué tan bien trabajan un humano y un robot juntos. Se trata estrictamente de: "¿Puede el robot arreglar el error y hacer que las pruebas pasen?".

Además, los autores advierten que, debido a que estos problemas se recolectan automáticamente, algunos podrían ser un poco extraños o carecer de la sutileza creativa de un acertijo escrito por un humano. También hay un pequeño riesgo de que la IA haya visto un problema similar en sus datos de entrenamiento, aunque el sistema intenta prevenir eso.

El panorama general

Los autores están seguros de que SWE-MERA es una forma mucho más justa de medir el progreso. Al refrescar constantemente la prueba con desafíos nuevos y no vistos, evita que la IA haga trampa memorizando respuestas. Incluso han construido una tabla de clasificación pública donde cualquiera puede ver cómo su robot de programación se compara con los mejores del mundo, con un deslizador que permite ver cómo cambia el rendimiento a lo largo del tiempo.

En resumen, SWE-MERA es el "aire fresco" que el campo necesitaba. Se aleja de los libros de texto polvorientos y memorizados para entrar en una arena dinámica y en constante cambio donde solo los agentes de codificación verdaderamente adaptables pueden sobrevivir.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →