← Últimos artículos
💬 NLP

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

El paper introduce SlopCodeBench, un nuevo benchmark que demuestra que los agentes de codificación actuales carecen de la disciplina de diseño necesaria para tareas iterativas, ya que su código se degrada progresivamente en calidad y estructura a medida que se extiende, un fenómeno que los benchmarks tradicionales de "una sola ejecución" no logran capturar.

Autores originales: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

Publicado 2026-03-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un arquitecto de software (un agente de IA) al que le pides construir una casa.

En los exámenes tradicionales de programación, le decimos: "Aquí están los planos de una casa de una planta. Constrúyela y asegúrate de que tenga tres habitaciones y una cocina". Si la casa se mantiene en pie y tiene las habitaciones, el arquitecto aprueba.

Pero en la vida real, la construcción no es así. Primero pides una casa de una planta. Luego, un año después, quieres añadir un segundo piso. Luego, una piscina. Después, un sistema de seguridad inteligente. Y así sucesivamente.

El problema que descubren los autores de este paper es que, aunque la IA es muy buena construyendo la primera planta, cuando le pides que añada el segundo piso sobre lo que ella misma construyó, la casa empieza a convertirse en un desastre.

Aquí te explico el "SlopCodeBench" (el banco de pruebas del "basurero de código") usando analogías sencillas:

1. El Problema: La "Casa de Cartón"

Los investigadores crearon un juego donde la IA debe construir un programa paso a paso.

  • Paso 1: Haz un buscador de código que funcione solo para Python.
  • Paso 2: Ahora, haz que también funcione para JavaScript y C++.
  • Paso 3: Ahora, añade reglas complejas para encontrar patrones en el código.
  • Paso 4: Ahora, añade corrección automática de errores.

En cada paso, la IA tiene que modificar su propio código anterior. No puede empezar de cero.

Lo que sucede:
Al principio, la IA hace un trabajo decente. Pero a medida que añade nuevas funciones, empieza a "pegar" parches sobre parches. En lugar de rediseñar la estructura para que sea sólida, simplemente añade más ladrillos encima de los viejos, crea pasillos sin salida y duplica instrucciones.

El resultado es un código que funciona (pasa las pruebas), pero que es un desastre para mantener. Es como si, para añadir una ventana al segundo piso, tuvieras que demoler la pared de la cocina, poner una escalera de mano en el pasillo y dejar cables colgando por todas partes.

2. Las Dos Enfermedades del Código

El paper mide dos cosas específicas que hacen que el código se degrade (se vuelva "slop" o basura):

  • La Verbosidad (El "Ruido"):
    Imagina que tienes que decirle a un robot cómo hacer un sándwich.

    • Humano: "Pon pan, jamón, queso".
    • IA degradada: "Toma el pan. Abre el paquete de pan. Saca una rebanada. Ponla en la mesa. Ahora toma el jamón. Abre el paquete de jamón. Saca una loncha. Ponla sobre el pan. Ahora toma el queso..."
      La IA empieza a escribir líneas innecesarias, variables que no usa y comentarios que nadie necesita. El código se infla como un globo, pero no añade valor real.
  • La Erosión Estructural (El "Colapso"):
    Imagina que tienes una biblioteca. Al principio, los libros están ordenados por género.
    Con el tiempo, la IA empieza a tirar todos los libros nuevos en la misma estantería, sin importar el género. Luego, para encontrar un libro, tiene que revisar 500 libros apilados desordenadamente en una sola pila gigante.
    En programación, esto significa que la IA mete toda la lógica compleja en una sola función gigante (un "monstruo" de código) en lugar de crear funciones pequeñas y ordenadas. El código se vuelve tan denso y complicado que nadie (ni siquiera la IA) puede entenderlo o modificarlo sin romperlo.

3. Los Resultados: El Fracaso Total

Los autores probaron 11 de las IAs más inteligentes del mundo (como GPT-4, Claude, etc.) con este juego de construcción.

  • Ninguna IA logró terminar el juego: Ninguna pudo construir la casa completa desde el principio hasta el final sin que el código se volviera inmanejable.
  • La calidad cae en picada: A medida que avanzaban los pasos, el código se volvía más ruidoso y más desordenado.
  • Comparación con humanos: Compararon el código de la IA con el de repositorios reales mantenidos por humanos (como las herramientas que usan millones de personas).
    • El código de la IA es 2.2 veces más ruidoso que el humano.
    • La IA acumula "basura" con cada paso, mientras que los humanos tienden a mantener la casa ordenada con el tiempo.

4. ¿Podemos arreglarlo con un "Pegamento" (Prompts)?

Los investigadores probaron algo interesante: ¿Qué pasa si le decimos a la IA: "Por favor, sé ordenado, no repitas cosas y planifica antes de escribir"?

  • Resultado: La IA empieza el juego un poco más ordenada (el primer piso está más limpio).
  • Pero... A medida que avanza y tiene que añadir el segundo y tercer piso, vuelve a cometer los mismos errores. El "desorden" vuelve a acumularse a la misma velocidad.
  • Conclusión: Darle mejores instrucciones al principio no soluciona el problema de fondo. La IA carece de la disciplina de diseño necesaria para pensar a largo plazo.

En Resumen

Este paper nos dice una verdad incómoda: Las IAs actuales son excelentes arquitectos para edificios de una sola planta, pero son pésimos ingenieros para rascacielos.

Si confiamos en ellas para construir software complejo que evolucione con el tiempo, estamos construyendo sobre cimientos de arena. El código funcionará hoy, pero mañana será un "basurero" (slop) imposible de mantener, mucho más caro y peligroso que el código escrito por humanos.

La lección: No basta con que el código "funcione". En el desarrollo de software real, la capacidad de extender y mantener el código es más importante que la capacidad de crearlo desde cero. Y ahí es donde las IAs actuales aún no están listas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →