← Últimos artículos
💻 computer science

Feedback That Backfires: Why Small Language Model Agents Repeat the Call They Just Watched Fail

Este artículo revela que los agentes de modelos de lenguaje pequeños tienen una probabilidad significativamente mayor de repetir llamadas a herramientas fallidas cuando el fallo se registra literalmente en la transcripción, un efecto contraproducente impulsado principalmente por la forma superficial de la acción fallida en lugar del mensaje de error, lo cual puede mitigarse eficazmente reemplazando la llamada bruta por una descripción del fallo generada en tiempo de ejecución.

Autores originales: Esmail Gumaan

Publicado 2026-08-26
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Esmail Gumaan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un asistente digital que puede usar herramientas para resolver problemas, como buscar un contacto, revisar un calendario o escribir un fragmento de código. Para hacer esto, el asistente sigue un bucle simple: piensa en una acción, intenta realizarla y luego lee el resultado. Si la acción falla, el sistema registra exactamente lo que el asistente intentó hacer y el mensaje de error que recibió, y luego le pide al asistente que lo intente de nuevo. Este método, conocido como el bucle del agente, es la forma estándar en que estos sistemas aprenden de sus errores. La lógica parece sólida: si le dices a una persona "intentaste abrir una puerta cerrada con llave y no funcionó", esa persona no intentará abrir la misma puerta cerrada de nuevo. Buscarán una llave diferente o una puerta diferente. Durante años, los ingenieros han asumido que los modelos informáticos pequeños, que impulsan a muchos de estos asistentes, se comportarían de la misma manera. Creían que mostrarle al modelo el mensaje de error le enseñaría a evitar ese error específico.

Un investigador de la Universidad de Passau, en Alemania, decidió probar este supuesto con extrema precisión. No se limitó a observar cómo los asistentes fallaban y tenían éxito; midió la probabilidad matemática exacta de que el modelo eligiera la misma acción errónea antes y después de ver el error. Realizó estas pruebas en seis modelos informáticos pequeños diferentes, que iban desde muy diminutos hasta de tamaño moderado, en dos entornos distintos: uno donde los modelos intentaban usar herramientas de oficina simuladas y otro donde intentaban reparar programas informáticos dañados. El investigador quería saber si el mensaje de error realmente corregía el comportamiento del modelo.

Lo que encontró fue lo opuesto a lo que todos esperaban. En lugar de aprender del fallo, los modelos se volvieron significativamente más propensos a repetir exactamente el mismo error. Cuando el sistema le mostraba al modelo el intento fallido y el mensaje de error, la probabilidad interna del modelo de elegir esa misma acción fallida aumentaba drásticamente. En las pruebas de llamada a herramientas, la probabilidad de que el modelo repitiera la llamada fallida subió de un bajo seis por ciento a más del cincuenta por ciento. En casi todos los casos que el investigador probó, el mensaje de error no actuó como una advertencia; actuó como un imán, atrayendo al modelo de vuelta hacia la mismísima acción que acababa de fallar.

El investigador se preguntó entonces por qué estaba sucediendo esto. Sospechaba que los modelos podrían ser simplemente demasiado pequeños para comprender el mensaje de error. Sin embargo, su investigación reveló un culpable diferente. Descubrió que el problema no era el significado del error, sino la presencia del texto en sí. Cuando la acción fallida se escribía en el registro, la maquinaria interna del modelo, que está diseñada para copiar patrones que ve, se aferraba al texto de la acción fallida. Este efecto de copia era tan fuerte que sobrepasaba el mensaje real sobre el fallo. Incluso cuando el investigador reemplazó el mensaje de error largo y detallado con una nota simple que decía "esto falló", el modelo seguía repitiendo el error. Pero cuando eliminaron el texto de la acción fallida por completo y lo reemplazaron con una descripción de lo que salió mal, el modelo dejó de repetir el error.

Este hallazgo cambió radicalmente la forma en que se construyen estos sistemas. El consejo común para arreglar un agente atascado ha sido eliminar el intento fallido del historial y dejar que el modelo comience de nuevo, con la esperanza de limpiar la "contaminación". El investigador descubrió que esto era en realidad lo peor que se podía hacer. Al eliminar el fallo, el sistema restauraba las condiciones exactas que causaron el error en primer lugar, garantizando que el modelo cometiera el mismo error de nuevo. La solución, descubrió, no era eliminar el historial, sino cambiarlo. Si el sistema mantenía el registro del fallo pero reemplazaba el texto bruto del comando fallido con una descripción generada por el sistema, la repetición se detenía.

El estudio también probó una solución más obvia: simplemente decirle al modelo en sus instrucciones que no repitiera la acción fallida. Este enfoque, que suena lógico para un humano, tuvo casi ningún efecto. El modelo no podía seguir fácilmente una regla que le decía que ignorara un texto específico que estaba justo frente a él. El investigador concluyó que el problema no era una falta de inteligencia en el modelo, sino un fallo en cómo se presentaba la información. El método estándar de mostrar la acción fallida junto con el mensaje de error crea un impulso poderoso de copiar, que es más fuerte que el impulso de aprender del error.

Al realizar estos experimentos en un procesador estándar sin tarjetas gráficas especializadas, el investigador demostró que este comportamiento es una propiedad fundamental de cómo funcionan estos modelos pequeños, no un error que requiera una potencia de cálculo masiva para corregirse. Su trabajo sugiere que, para construir asistentes digitales fiables, los ingenieros deben dejar de tratar la acción fallida como una lección útil para ser leída y empezar a tratarla como un patrón peligroso que debe ocultarse. La solución es estructural: el contexto después de un fallo debe verse diferente al contexto antes del fallo, pero la diferencia no puede ser la acción fallida en sí. Al eliminar el texto bruto del error y mantener solo el diagnóstico, el sistema puede romper el ciclo de repetición y permitir que el modelo realmente avance.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →