← Últimos artículos
🤖 AI

VCE-Skill: Enhancing Skill Self-Evolution with Version-Change Experience

El artículo propone VCE-Skill, un nuevo marco que mejora la autoevolución de las habilidades del agente al fusionar adaptativamente trayectorias de ejecución específicas de la tarea con experiencias estructuradas y destiladas de historiales de versiones de habilidades públicas, lo que resulta en mejoras significativas de rendimiento y capacidades de transferencia entre modelos más sólidas.

Autores originales: Jianming Chen, Xuanbin Ye, Yawen Wang, Junjie Wang, Qing Wang, Fanjiang XU

Publicado 2026-08-18
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Jianming Chen, Xuanbin Ye, Yawen Wang, Junjie Wang, Qing Wang, Fanjiang XU

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, que evoluciona rápidamente, los investigadores están enseñando a los programas informáticos a actuar más como asistentes humanos. Estos programas, a menudo llamados agentes, no solo responden preguntas; realizan tareas utilizando herramientas, siguiendo instrucciones y gestionando archivos. Para que estos agentes sean fiables, los desarrolladores les otorgan "habilidades". Piense en una habilidad como una caja de herramientas portátil que contiene un conjunto de instrucciones, scripts y recursos que el agente puede recoger y utilizar cada vez que se enfrenta a un tipo específico de problema. Sin embargo, al igual que un humano aprende de sus errores, estas herramientas rara vez son perfectas cuando se crean por primera vez. A medida que el mundo cambia y surgen nuevos desafíos, las instrucciones dentro de estas cajas de herramientas deben ser actualizadas, parcheadas y mejoradas. La pregunta central para los científicos es cómo automatizar este proceso de mejora para que los agentes puedan enseñarse a sí mismos para ser mejores con el tiempo.

Durante algún tiempo, el enfoque estándar para esta automejora ha sido dejar que el agente intente una tarea, observar dónde falla y luego reescribir las instrucciones basándose en ese fallo específico. Este método depende enteramente de la evidencia recopilada durante el intento actual. Si bien esto funciona, tiene un punto ciego: solo ve los errores que ocurren en este preciso momento. Pierde las lecciones más amplias que otros desarrolladores han aprendido a lo largo de años manteniendo herramientas similares. Un equipo de investigadores de la Academia China de Ciencias y la Universidad de Post y Telecomunicaciones de Beijing se dio cuenta de que este enfoque estrecho dejaba sin aprovechar una vasta biblioteca de conocimiento. Se propusieron investigar si la historia de los cambios realizados en herramientas de software públicas podía enseñarle a un agente algo que su propia experiencia inmediata no pudiera.

Los investigadores comenzaron comparando dos fuentes diferentes de información. La primera fuente era los intentos recientes del agente en una tarea, lo que proporcionaba una visión detallada pero estrecha de lo que salió mal. La segunda fuente era la historia pública de los cambios realizados en herramientas similares por desarrolladores humanos a lo largo del tiempo. Cuando analizaron estas dos fuentes de forma paralela, descubrieron una diferencia clara y útil. Los propios intentos del agente se centraban principalmente en corregir errores inmediatos y específicos en cómo llamaba a las herramientas o leía las instrucciones. En contraste, la historia pública contenía una variedad mucho más amplia de mejoras, incluyendo cambios en cómo se organizaban los datos, cómo se estructuraban los scripts y cómo la herramienta manejaba situaciones inesperadas. Los registros públicos ofrecían una perspectiva más amplia, mientras que los registros propios del agente ofrecían una realidad fundamentada y específica de la tarea. Las dos fuentes no se repetían; en cambio, llenaban los vacíos la una de la otra.

Para poner en práctica este conocimiento, el equipo desarrolló un nuevo sistema llamado VCE-Skill. Este sistema actúa como un puente entre la experiencia actual del agente y la sabiduría colectiva del pasado. El proceso ocurre en dos etapas principales. Primero, el sistema toma la historia bruta y desordenada de cambios de los repositorios públicos y la limpia. Elimina los detalles específicos que solo se aplican a un proyecto y los destila en lecciones generales y reutilizables. Por ejemplo, si muchos desarrolladores han añadido una comprobación para asegurar que un archivo existe antes de intentar abrirlo, el sistema aprende esto como una regla general en lugar de un arreglo único. Estas lecciones destiladas se almacenan en una biblioteca estructurada de experiencia.

En la segunda etapa, el agente intenta una tarea y genera sus propias ideas de mejora basadas en lo que sucedió. El sistema luego busca en su biblioteca de lecciones destiladas y selecciona las que son más relevantes para el problema actual. No se limita a copiar las lecciones antiguas o ignorar las propias ideas del agente. En su lugar, mezcla cuidadosamente ambas. Si el agente tiene dificultades con un problema común que la historia pública ha resuelto muchas veces antes, el sistema se inclina fuertemente hacia esa sabiduría externa. Si el agente se enfrenta a un error único y extraño que nunca se había visto antes, el sistema confía más en la observación propia del agente. Este equilibrio no es fijo; el sistema ajusta constantemente cuánto confía en la biblioteca externa frente a la propia experiencia del agente, dependiendo de si los cambios están haciendo que el agente rinda mejor.

Los resultados de este enfoque fueron probados a través de cinco tipos diferentes de tareas, que van desde responder preguntas complejas y gestionar hojas de cálculo hasta controlar robots en entornos virtuales. Los investigadores utilizaron cuatro modelos de lenguaje extensos diferentes para actuar como los agentes. En cada caso, añadir esta experiencia externa al bucle de automejora del agente condujo a un mejor rendimiento. Los agentes obtuvieron puntuaciones más altas en promedio, con mejoras que oscilaron entre aproximadamente tres y cinco puntos a través de las diversas pruebas. Más importante aún, las habilidades que fueron mejoradas usando este método demostraron ser más robustas. Cuando los investigadores tomaron una habilidad que había sido evolucionada con este nuevo método y la probaron en un modelo de computadora diferente al que fue entrenada, esta funcionó significetivamente mejor que las habilidades que solo habían aprendido de sus propios errores inmediatos. Esto sugiere que, al incorporar las lecciones más amplias de la historia pública, los agentes aprendieron principios más generales que podrían aplicarse en nuevas situaciones, en lugar de simplemente memorizar cómo solucionar un error específico.

El estudio no afirma que la vieja forma de aprender de los errores sea inútil. La propia experiencia del agente sigue siendo esencial para comprender los detalles específicos de la tarea en cuestión. El nuevo método simplemente añade una capa de contexto que el agente no podría encontrar por sí mismo. Al tratar la historia de los cambios de software público como una valiosa fuente de conocimiento previo, los investigadores han demostrado que los agentes pueden aprender a evolucionar de manera más efectiva. Han demostrado que el camino hacia un agente más inteligente y fiable no consiste solo en observar lo que sucede en el momento, sino también en comprender la larga historia de cómo se han mejorado herramientas similares a lo largo del tiempo. Este enfoque ofrece una forma práctica de hacer que la inteligencia artificial sea más adaptable, asegurando que las herramientas que utiliza no sean solo funcionales para hoy, sino lo suficientemente robustas para el futuro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →