← Últimos artículos
🤖 AI

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

Evo-Harness introduce un marco de agentes de autoevolución que aborda el desafío de aprender de interacciones ruidosas y de un solo paso en tareas novedosas del mundo real mediante el empleo de la compilación de habilidades de contexto a arnés para destilar experiencias en arneses de habilidades reutilizables y estructurados para una mejora continua entre dominios.

Autores originales: Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing L
Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing Lu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, que evoluciona rápidamente, ha surgido un tipo específico de software conocido como agente de modelo de lenguaje extenso, el cual se ha convertido en una poderosa herramienta para resolver problemas complejos. Estos agentes pueden leer instrucciones, planificar pasos, utilizar herramientas digitales e interactuar con sitios web o sistemas informáticos de forma muy similar a como lo haría un humano. Sin embargo, un desafío persistente ha limitado su potencial: cuando estos agentes fallan en una tarea, a menudo tratan ese fallo como un callejón sin salida. No aprenden naturalmente del error para evitar repetirlo más adelante. Los métodos tradicionales para enseñar a estos sistemas suelen consistir en recopilar miles de intentos pasados y analizarlos de forma externa para encontrar patrones, un proceso que es lento y que a menudo está desconectado del flujo de trabajo en tiempo real. En muchas situaciones prácticas, un agente se enfrenta a una tarea nueva y difícil una sola vez, con una única oportunidad de tener éxito o fallar, lo que deja poco margen para la lenta acumulación de datos que requiere el aprendizaje tradicional.

Los investigadores han propuesto ahora una nueva forma para que estos trabajadores digitales mejoren sobre la marcha, un método que llaman aprendizaje de arnés en línea (online harness learning). En lugar de intentar reentrenar el cerebro central del agente, que suele ser fijo e inalterable, le adjuntan una guía externa que evoluciona con cada nueva experiencia. Esta guía, o "arnés", actúa como una colección estructurada de lecciones aprendidas de intentos previos. Cuando el agente falla, el sistema no solo almacena el error; recopila activamente los detalles desordenados de ese fallo para convertirlos en una regla clara y reutilizable. Esta regla se añade entonces a la guía, lista para ayudar al agente a navegar desafíos similares en el futuro. El objetivo es transformar un error ruidoso y de una sola vez en una pieza de sabiduría limpia y accionable que pueda aplicarse a través de diferentes tipos de tareas.

Para probar esta idea, los investigadores construyeron un sistema llamado Evo-Harness y lo sometieron a prueba en cinco bancos de pruebas distintos y exigentes. Estas pruebas variaron desde la navegación por sitios web complejos hasta la gestión de repositorios de código de software, la ejecución de instrucciones precisas de línea de comandos y el uso de diversas herramientas digitales. En cada escenario, el agente recibió un flujo de tareas, una tras otra, sin oportunidad de pausar y reentrenar su modelo subyacente. El sistema fue diseñado para tomar el contexto bruto de cada intento —las instrucciones dadas, las acciones realizadas, el resultado y cualquier retroalimentación recibida— y destilarlo en una lección estructurada. Si el agente fallaba, un proceso especializado reflexionaba sobre qué había salido mal, proponiendo una nueva regla o una modificación de una existente. Otro proceso decidía entonces si añadir esta nueva regla, fusionarla con el conocimiento existente o descartarla si era demasiado específica para ese único intento fallido.

Los resultados de este experimento fueron sorprendentes. Los agentes que utilizaban la guía evolutiva superaron consistentemente a aquellos que no la utilizaban, y también vencieron a otros métodos que dependían de la simple recuperación de ejemplos pasados o del almacenamiento de memorias no estructuradas. En un banco de pruebas centrado en tareas de línea de comandos, la mejora fue particularmente dramática, con tasas de éxito que saltaron de aproximadamente un 63 por ciento a más de un 73 por ciento. Esto sugiere que la capacidad de compilar experiencias ruidosas de un solo intento en una guía estructurada es especialmente valiosa cuando las tareas requieren una secuencia de operaciones precisas, como inspeccionar archivos o recuperarse de errores. El estudio también encontró que el tipo de guía que generaba el sistema variaba según la tarea. Para la navegación web, la guía se llenaba de procedimientos de flujo de trabajo; para la ingeniería de software, se centraba en pasos de verificación y recuperación; y para las tareas de razonamiento, capturaba la lógica específica del dominio. Esta adaptabilidad indica que el sistema no solo está memorizando respuestas, sino que está aprendiendo la estructura subyacente de cómo resolver problemas.

Un conocimiento crítico de la investigación es que no toda la retroalimentación es igual. El sistema funcionó mejor cuando recibió retroalimentación clara y fundamentada del entorno, como un mensaje de error específico o un resultado de una prueba, en lugar de cuando se le pidió que juzgara su propio éxito. Cuando el agente intentaba generar su propia retroalimentación sin evidencia externa, su rendimiento de hecho cayó por debajo de la línea base, lo que sugiere que el autojuicio puede introducir confusión. Además, el estudio reveló que el tamaño y la capacidad del cerebro del agente importaban. Los modelos más fuertes eran mejores interpretando y siguiendo la guía evolucionada, obteniendo significativamente más de la guía que los modelos más débiles. Curiosamente, un modelo más pequeño podía a veces escribir una guía que ayudaba a un modelo más grande y capaz, pero lo contrario no siempre era cierto. Si el agente que resolvía la tarea no era lo suficientemente sofisticado para entender la guía, la información adicional no ayudaba e incluso podía obstaculizar el rendimiento.

Los investigadores también exploraron cómo se podían transferir estas habilidades aprendidas. Descubrieron que una guía creada por un modelo podía ser útil para otro, y que las habilidades aprendidas en un conjunto de tareas de entrenamiento podían mejorar el rendimiento en tareas de prueba no vistas. Sin embargo, el enfoque más efectivo era actualizar la guía continuamente a medida que el agente trabajaba a través del flujo de tareas. Esta adaptación en tiempo real permitió al sistema ajustarse a las peculiaridades específicas y los modos de fallo del entorno actual, superando incluso a las mejores guías preentrenadas. El estudio concluye que la clave para los agentes con capacidad de automejora no reside en el reentrenamiento constante de sus modelos centrales, sino en la construcción de un sistema externo robusto que pueda convertir el caos de los fallos del mundo real en un conjunto de instrucciones claro y organizado. Al tratar la guía como un documento vivo que crece y se refina con cada interacción, estos agentes digitales pueden aprender a manejar la naturaleza impredecible del trabajo complejo del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →