← Últimos artículos
🤖 AI

What Do Evolutionary Coding Agents Evolve?

Este artículo presenta EvoTrace, un conjunto de datos de trazas de codificación evolutiva, y EvoReplay, una metodología basada en la reproducción, para revelar que las mejoras de rendimiento en agentes de codificación evolutiva a menudo provienen de mecanismos diversos como el reajuste o la reutilización de conocimientos existentes en lugar de una innovación algorítmica genuina, lo cual se evidencia mediante el ciclo determinista frecuente de líneas de código.

Autores originales: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

Publicado 2026-05-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un equipo de programadores de IA intentando resolver un rompecabezas complejo, como diseñar una nueva forma de empaquetar círculos en una caja o escribir un motor de videojuegos más rápido. En lugar de que una sola persona trabaje sola, utilizan un sistema llamado Codificación Evolutiva.

Así es como funciona: la IA genera un fragmento de código, lo prueba y ve qué tan bien puntúa. Luego, realiza pequeños cambios (mutaciones) en ese código, prueba la nueva versión y conserva los que funcionan mejor. Repite esto miles de veces, "evolucionando" el código con el tiempo, de manera muy similar a como la naturaleza evoluciona a los animales.

Durante un tiempo, todos asumieron que estos agentes de IA estaban descubriendo formas brillantes y completamente nuevas de pensar para resolver problemas. Pero este artículo plantea una pregunta simple y escéptica: "¿Qué están evolucionando realmente?"

Para responder a esto, los investigadores construyeron un enorme "grabador de caja negra" llamado EvoTrace. Piensa en ello como una caja negra de vuelo para estos experimentos de IA. No solo registra la puntuación final; registra cada paso individual, cada línea de código añadida o eliminada, cada indicación que vio la IA y cada error que cometió. También construyeron una herramienta llamada EvoReplay, que les permite pausar el experimento, rebobinarlo y preguntar: "¿Qué pasaría si cambiamos esto en particular?"

Estos son los cuatro hallazgos principales que descubrieron, explicados con analogías cotidianas:

1. El "Ajustador" vs. El "Arquitecto"

Cuando la IA obtiene una puntuación mejor, ¿qué cambió realmente?

  • La Realidad: La mayoría de las veces, la IA no está inventando una nueva estrategia. Solo está ajustando las perillas.
  • La Analogía: Imagina que tienes una radio. La IA pasa el 90% de su tiempo subiendo y bajando el volumen, o ajustando ligeramente el dial de sintonía (cambiando un número de 1.85 a 1.90). Rara vez decide construir una radio completamente nueva desde cero.
  • El Hallazgo: Los cambios que realmente conducen a grandes saltos en la puntuación (como añadir una nueva biblioteca o reescribir completamente una sección de código) son raros. La IA pasa la mayor parte de su energía en ajustes diminutos y aburridos.

2. El "Jardinero Olvidadizo" (Ciclado)

Este fue el descubrimiento más sorprendente.

  • La Realidad: La IA sigue eliminando líneas de código, solo para añadirlas de nuevo unos pasos después.
  • La Analogía: Imagina a un jardinero que arranca una mala hierba, se aleja y luego regresa cinco minutos después para plantar exactamente la misma mala hierba en exactamente el mismo lugar. Lo hace una y otra vez.
  • El Hallazgo: Aproximadamente el 30% del nuevo código que la IA añade es en realidad código que había eliminado anteriormente. Es como si la IA tuviera una memoria a corto plazo, olvidando lo que acaba de desechar y perdiendo tiempo "reevolucionando" las mismas ideas. Esto ocurre en casi todas las ejecuciones, sin importar qué modelo de IA se utilice.

3. El "Fantasma en la Máquina" (Reproducibilidad)

Si le pides a la IA que resuelva el problema nuevamente usando exactamente las mismas instrucciones, ¿obtendrá el mismo resultado?

  • La Realidad: No.
  • La Analogía: Imagina a un chef que prepara una sopa perfecta. Si le pides que la vuelva a preparar usando exactamente la misma receta y los mismos ingredientes, hará una sopa diferente. No se verá igual y los ingredientes podrían estar en un orden distinto.
  • El Hallazgo: Sin embargo, aunque el código parezca diferente, la sopa sabe igual. La IA puede reproducir la alta puntuación usando un fragmento de código completamente diferente. Esto significa que la "puntuación" es real, pero la solución específica es solo un afortunado sorteo de un sombrero, no una obra maestra única.

4. El "Afinador Simple" (La Brecha de Ajuste)

¿Cuánto del éxito de la IA se debe realmente a encontrar los números correctos, en lugar de encontrar un nuevo algoritmo?

  • La Realidad: Una gran parte de la mejora proviene de un ajuste matemático simple.
  • La Analogía: Imagina una carrera de coches. La IA pasa semanas construyendo un nuevo motor sofisticado (la estructura). Pero los investigadores descubrieron que si tomaban un motor mediocre y pasaban unas pocas horas ajustando la mezcla de combustible y la presión de los neumáticos (los hiperparámetros), podían obtener casi la misma velocidad.
  • El Hallazgo: En muchas tareas matemáticas, un programa informático simple que solo ajusta los números de una solución "promedio" puede igualar o incluso superar la puntuación final de la búsqueda evolutiva compleja. La IA no necesariamente descubrió una nueva forma de resolver el problema; simplemente encontró la configuración perfecta para una forma antigua.

El Panorama General

El artículo concluye que cuando vemos a estos agentes de IA obtener mejores puntuaciones, no debemos asumir automáticamente que están "descubriendo nueva ciencia".

A menudo, simplemente están:

  1. Ajustando números (Ajuste de hiperparámetros).
  2. Olvidando y recordando el mismo código (Ciclado).
  3. Sobreajustándose a la prueba (memorizando las respuestas del examen en lugar de aprender la lección).

Los autores argumentan que para entender realmente si estos agentes son inteligentes, necesitamos observar el viaje (la traza), no solo el destino (la puntuación final). Necesitamos saber si están construyendo una casa nueva o simplemente reorganizando los muebles en la vieja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →