← Últimos artículos
🤖 machine learning

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

Este artículo demuestra que los métodos de evaluación basados en la repetición estática fallan fundamentalmente al evaluar los enrutadores de agentes de LLM porque la sustitución de las salidas del modelo en las trayectorias registradas ignora la divergencia en cascada de las acciones subsiguientes del agente, lo que conduce a métricas de rendimiento engañosas que no reflejan los resultados del mundo real.

Autores originales: Ashritha Gonuguntla

Publicado 2026-08-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Ashritha Gonuguntla

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el capitán de una nave espacial navegando por un campo de asteroides traicionero. Tienes una flota de diferentes pilotos de IA: algunos son rápidos y económicos pero cometen errores pequeños, mientras que otros son lentos, costosos e increíblemente precisos. Para ahorrar combustible, decides cambiar de piloto a mitad del viaje basándote en lo que está sucediendo en ese momento. Si el camino está despejado, usas al piloto económico; si aparece un asteroide masivo, cambias al experto. Este es el sueño del "enrutamiento agéntico" (agentic routing) en el mundo de los Grandes Modelos de Lenguaje (LLM). Estos modelos son los cerebros detrás de los agentes de IA que pueden escribir código, resolver problemas matemáticos o jugar juegos mediante una serie de pasos. La gran pregunta para los ingenieros es: ¿Cómo sabemos si nuestra estrategia de cambio de piloto realmente funciona?

Tradicionalmente, los científicos han probado estas estrategias como un director de cine revisando un guion. Observan un viaje registrado (una "trayectoria") donde un solo piloto voló todo el camino. Luego, fingen: "¿Qué pasaría si hubiéramos cambiado al piloto en el paso 10?". Simplemente pegan las respuestas registradas del nuevo piloto en el guion antiguo y ven si el final se ve bien. Esto se llama "evaluación de reproducción" (replay evaluation). Es barato, rápido y asume que si cambias al piloto en el paso 10, el resto del viaje de la nave habría permanecido exactamente igual que en el registro original. Pero en el mundo real, una nave espacial es un bucle cerrado: la acción del piloto en el paso 10 cambia la vista en el paso 11, lo que cambia la decisión en el paso 12, y así sucesivamente. Si el nuevo piloto ve un campo de asteroides diferente debido a su propia acción anterior, todo el guion cambia. Este artículo plantea una pregunta simple y aterradora: ¿Está nuestro método de probar mediante "guiones de película" midiendo en realidad la realidad equivocada?

Los investigadores de la Universidad Carnegie Mellon decidieron dejar de adivinar y empezar a probar. En lugar de editar un guion de película, construyeron una máquina del tiempo. Tomaron agentes de IA reales resolviendo problemas de ingeniería de software y, en momentos específicos, "bifurcaron" la línea temporal. Crearon dos universos paralelos: uno donde el piloto original continuaba y otro donde introdujeron a un piloto diferente. Crucialmente, no se limitaron a pegar nuevas respuestas en la vieja historia; dejaron que el nuevo piloto tomara realmente el control, interactuara con el entorno informático y viera qué sucedía realmente después. Realizaron alrededor de 900 de estos experimentos paralelos para ver cuánto divergían las historias.

Los resultados fueron un choque para el sistema. La suposición de que el resto del viaje permanece igual era completamente errónea. Cuando cambiaban los modelos, el nuevo piloto no solo tomaba el control del camino existente; reescribía todo el futuro. En las etapas iniciales de una tarea, cambiar los modelos causaba que el agente cambiara de opinión en el 74% al 77% de sus acciones inmediatamente posteriores. Para cuando los investigadores observaron todo el viaje, el nuevo piloto había reescrito del 61% al 94% de todos los pasos que siguieron al cambio. Para ponerlo en perspectiva, si cambiaras de piloto en un videojuego, el mundo del juego cambiaría tan drásticamente que el "guion" que intentabas leer estaría describiendo un nivel que ya no existe.

El estudio también descubrió que el método de "reproducción" es peligrosamente ciego ante el éxito. En sus experimentos, observaron cinco momentos específicos donde cambiar un piloto realmente cambió el resultado de la misión: salvando una tarea fallida o perdiendo una resuelta. El viejo método de "guion de película" pasó por alto cada uno de estos momentos críticos. Predijo el fallo cuando el nuevo piloto en realidad tuvo éxito, y predijo el éxito cuando el nuevo piloto en realidad falló. El parche de código que el nuevo piloto escribió realmente no se parecía en nada al parche que el método de reproducción predijo; eran esencialmente no relacionados.

Además, los investigadores descubrieron que el "ruido" en el sistema depende en gran medida de cómo se ejecutan los modelos. Incluso utilizando el mismo modelo dos veces, los resultados no siempre eran idénticos. Si el modelo se servía usando un tipo de compresión de hardware (FP8), las ejecuciones de "control" (donde no hubo cambio) divergían el 90% de las veces. Pero con un método de compresión diferente (AWQ), las ejecuciones se mantenían casi idénticas. Esto significa que incluso la base de comparación es inestable, haciendo que el método de "reproducción" sea aún menos fiable.

El artículo concluye que la forma actual de probar el enrutamiento de IA está puntuando el mundo equivocado. El método de "reproducción" es como juzgar a un chef leyendo una receta que escribió ayer, ignorando el hecho de que los ingredientes en la cocina han cambiado. El autor sugiere que para comprender verdaderamente cómo enrutar agentes de IA, debemos dejar de pretender que el futuro es fijo y empezar a probar ejecutando los agentes en realidades paralelas y ramificadas. Han publicado sus herramientas y datos para que otros dejen de adivinar y empiecen a ver la forma verdadera, caótica y fascinante en que estos agentes de IA se comportan realmente cuando las reglas del juego cambian.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →