← Últimos artículos
🤖 AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench presenta un conjunto de evaluación de 115 tareas complejas de codificación de largo alcance basadas en actualizaciones reales de versiones de código abierto para demostrar que los agentes de IA de vanguardia actuales tienen dificultades significativas con el desarrollo de software a gran escala y multiobjetivo, resolviendo menos del 40% de las tareas incluso con los modelos más avanzados.

Autores originales: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Publicado 2026-05-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un equipo de desarrolladores junior superinteligentes impulsados por IA. Quieres saber si pueden manejar un trabajo real: no solo corregir un solo error tipográfico en una receta, sino reescribir completamente un libro de cocina masivo de 500 páginas para agregar nuevos capítulos, cambiar cómo se miden los ingredientes y reparar hornos rotos, todo mientras se mantienen las recetas antiguas funcionando para las personas que aún usan la versión anterior.

Eso es exactamente de lo que trata el artículo ROADMAPBENCH.

Aquí está el desglose del artículo en términos sencillos:

1. El Problema: El "Error Tipográfico" vs. La "Reconstrucción"

Durante mucho tiempo, hemos probado los asistentes de codificación con IA en tareas pequeñas y fáciles. Es como preguntar: "¿Puedes corregir esta oración en este párrafo?". La IA usualmente dice: "¡Sí!" y obtiene una A+.

Pero en el mundo real, el desarrollo de software no se trata de corregir una oración. Se trata de renovar un rascacielos. Tienes que cambiar la fontanería, el cableado eléctrico y los sistemas de elevadores en 50 pisos diferentes, todos a la vez, sin que el edificio colapse.

Los autores se dieron cuenta de que las pruebas existentes eran demasiado fáciles. Era como pedirle a un arquitecto que arregle una fuga en un grifo, cuando el trabajo real consiste en diseñar un nuevo ala para un hospital. Así que construyeron una nueva prueba, mucho más difícil, llamada ROADMAPBENCH.

2. La Nueva Prueba: El Desafío de "Actualización de Versión"

En lugar de pedirle a la IA que corrija un error, ROADMAPBENCH le entrega una hoja de ruta.

  • La Configuración: La IA se introduce en un taller digital con una versión antigua de un proyecto de software real (como una herramienta de código abierto popular).
  • La Misión: Se le entrega a la IA un documento de "hoja de ruta". Este documento dice: "En la próxima versión de este software, necesitamos agregar estas 5 nuevas características, cambiar cómo funcionan estas 3 cosas y corregir estos 2 errores".
  • La Escala: Esto no es un cambio pequeño. En promedio, la IA tiene que reescribir 3,700 líneas de código en 51 archivos diferentes. Es como pedirle a la IA que reescriba todo el guion de una película, cambie los disfraces y vuelva a grabar las escenas, todo de una sola vez.
  • Las Reglas: La IA no puede mirar la "clave de respuestas" (la nueva versión del software). Tiene que resolverlo solo con las instrucciones.

3. Los Resultados: La IA Sigue Siendo un "Junior"

Los investigadores probaron 13 de los modelos de IA más inteligentes disponibles (incluyendo las versiones más recientes de empresas como Anthropic, OpenAI y Google). Sometieron estos modelos a la prueba ROADMAPBENCH.

El resultado fue sobrio:

  • Incluso la IA más inteligente (Claude-Opus-4.7) solo tuvo éxito en el 39.1% de las tareas.
  • La IA más débil tuvo éxito en solo el 5.2% de las tareas.

La Metáfora:
Si le pidieras a un desarrollador junior humano que remodelara una casa y solo terminara el trabajo correctamente 4 veces de cada 10, dirías: "Aún está aprendiendo". El artículo muestra que incluso nuestra IA más avanzada sigue en la fase de "aprendizaje" cuando se trata de proyectos de software complejos y a largo plazo.

4. ¿Dónde Fallan?

El artículo no solo contó los fracasos; analizó por qué fallaron. Encontraron un patrón basado en lo "inteligente" que era la IA:

  • Los Modelos Más Fuertes: Por lo general, lograron que el código se compilara (construyera) y podían escribir la mayoría de las características. Pero fallaron en los detalles. Es como si construyeran una casa perfecta, pero el pomo de la puerta estuviera del lado incorrecto, o el interruptor de luz no encendiera realmente la luz. Entendían el panorama general pero se perdían en la lógica minuciosa y precisa.
  • Los Modelos Más Débiles: A menudo ni siquiera podían construir la casa. Olvidaban instalar el techo, o intentaban poner la cocina en el sótano. Fallaron en el nivel básico de construcción.

5. Por Qué Esto Importa (Según el Artículo)

Los autores argumentan que debemos dejar de probar la IA con "correcciones de errores tipográficos" porque nos da una falsa sensación de seguridad. Solo porque una IA puede corregir un error no significa que pueda construir una nueva característica.

ROADMAPBENCH es una nueva regla honesta. Nos dice que, aunque la IA está mejorando, la capacidad de manejar proyectos de software largos, complejos y de múltiples pasos sigue siendo un desafío enorme e irresuelto. La IA es actualmente como un aprendiz muy talentoso que puede seguir instrucciones bien durante unos pasos, pero se confunde cuando el proyecto se vuelve demasiado grande y complejo.

Resumen

  • Pruebas Antiguas: "¿Puedes corregir esta única palabra rota?" (IA: ¡Sí!)
  • ROADMAPBENCH: "Aquí hay un plan para actualizar todo un sistema de software. ¿Puedes hacerlo?" (IA: Puedo intentarlo, pero probablemente me equivoque en los detalles o olvide un paso.)
  • Conclusión: Aún no hemos llegado allí. La IA es inteligente, pero aún no está lista para ser la ingeniera principal en un proyecto de software importante.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →