← Últimos artículos
🤖 AI

OpenSkill: Open-World Self-Evolution for LLM Agents

Este artículo presenta OpenSkill, un marco que permite a los agentes de LLM realizar un arranque automático de su propia evolución en despliegues de mundo abierto mediante la síntesis de habilidades transferibles y señales de verificación a partir de recursos externos sin depender de la supervisión de la tarea objetivo.

Autores originales: Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

Publicado 2026-06-08
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhiling Yan, Dingjie Song, Hanrong Zhang, Wei Liang, Yuxuan Zhang, Yutong Dai, Lifang He, Philip S. Yu, Ran Xu, Xiang Li, Lichao Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que contratas a un aprendiz brillante pero sin experiencia para resolver un rompecabezas complejo. Normalmente, para enseñarle, le darías un libro de texto, una lista de "qué hacer y qué no hacer", o un profesor a su lado para decirle: "¡Buen trabajo!" o "Inténtalo de nuevo".

OpenSkill es una nueva forma de entrenar a estos aprendices de IA (llamados agentes de LLM) cuando no tienes nada de eso. Solo les das la instrucción del rompecabezas y el internet. Ellos tienen que enseñarse a sí mismos, descubrir qué aprender e incluso construir su propio "profesor" para revisar su trabajo, todo sin echar un vistazo a la clave de respuestas.

Aquí se explica este proceso utilizando analogías sencillas:

El Problema: La "Habitación Silenciosa"

La mayoría de los métodos actuales de entrenamiento de IA asumen que la IA tiene un ciclo de ayuda: intenta algo, recibe una puntuación y lo intenta de nuevo. Pero en el mundo real (el "mundo abierto"), a menudo solo recibes una tarea y un montón de recursos desordenados (sitios web, manuales, repositorios de código). No tienes una clave de respuestas, y no tienes a un humano calificando su trabajo.

Si la IA intenta aprender de sus propias suposiciones, podría simplemente convencerse a sí misma de que tiene razón cuando se equivoca. Es como intentar aprender un nuevo idioma hablando solo en una habitación sin un diccionario.

La Solución: OpenSkill

Los investigadores construyeron un marco llamado OpenSkill que actúa como una guía de supervivencia autosuficiente para la IA. Funciona en tres etapas principales:

1. La Fase del "Bibliotecario" (Adquisición de Conocimiento)

En lugar de confiar en lo que la IA ya recuerda (que puede estar desactualizado o ser erróneo), OpenSkill envía a la IA al "mundo abierto" (internet, documentación, repositorios de código).

  • La Analogía: Imagina que la IA es un detective. En lugar de adivinar al culpable, va a la biblioteca, lee cada informe policial, manual técnico y artículo de noticias relacionado con el caso. Reúne los hechos brutos que necesita para construir un plan.

2. La Fase del "Dojo Virtual" (Evolución Libre de Filtraciones)

Esta es la parte más ingeniosa. La IA necesita practicar, pero no puede usar la clave de respuestas real. Por lo tanto, OpenSkill construye un Verificador Virtual.

  • La Analogía: Piensa en esto como un "Dojo" o un gimnasio de práctica. La IA escribe un conjunto de reglas (habilidades) para resolver el rompecabezas. Luego, una IA separada e independiente actúa como un árbitro estricto.
  • Cómo funciona el Árbitro: El árbitro no conoce la clave de respuestas. En su lugar, revisa el trabajo de la IA comparándolo con hechos duros que encontró en la biblioteca anteriormente.
    • Ejemplo: Si la tarea es analizar un conjunto de datos, el árbitro verifica: "¿Contó la IA las filas correctamente? ¿La suma de los números coincide con el total conocido?"
    • Es como un profesor de matemáticas que verifica si tu respuesta es un número par o si cae dentro de un rango realista, sin saber el número específico que debías encontrar.
  • Si la IA falla, el árbitro dice: "Te saltaste un paso" o "Necesitas buscar esta regla específica de nuevo". La IA entonces corrige sus reglas e intenta de nuevo. Este ciclo ocurre hasta que la IA pasa todas las pruebas "virtuales".

3. La Fase del "Examen Final" (Evaluación Zero-Shot)

Una vez que la IA ha pulido sus habilidades en el Dojo Virtual, se le envía al mundo real para resolver la tarea real.

  • La Analogía: La IA toma el examen final. La verdadera clave de respuestas solo se revela después de que el examen ha terminado. Los investigadores descubrieron que la IA, habiendo practicado con su propio "árbitro" autoconstruido, se desempeñó increíblemente bien, superando a menudo otros métodos que dependían de habilidades preescritas o retroalimentación humana.

Por qué esto es importante (Los Resultados)

Los investigadores probaron esto en tres tipos diferentes de desafíos (codificación de software, razonamiento social y experimentos científicos) utilizando dos modelos de IA diferentes.

  • Funciona sin hacer trampa: La IA nunca vio las respuestas reales durante su entrenamiento. Construyó su propia "verdad" a partir de hechos públicos.
  • Es portable: Las "habilidades" que la IA aprendió (las reglas que escribió) son como un libro físico. Puedes tomar el libro escrito por una IA y dárselo a una IA completamente diferente y más débil, y aun así funcionará. La IA no solo "memorizó" la respuesta; aprendió un método.
  • Supera a la competencia: En casi todas las pruebas, OpenSkill obtuvo una puntuación más alta que otros métodos que intentaron aprender sin esta configuración específica de "árbitro virtual".

La Conclusión

OpenSkill es un sistema que enseña a los agentes de IA a ser autosuficientes. Demuestra que una IA puede pasar de no saber nada sobre una tarea específica a convertirse en una experta, simplemente:

  1. Leyendo el manual (Mundo Abierto).
  2. Construyendo su propio examen de práctica basado en hechos (Verificador Virtual).
  3. Practicando hasta pasar esa prueba.
  4. Y luego resolviendo el problema real.

Demuestra que no necesitas un profesor humano o una clave de respuestas oculta para enseñar a una IA cómo mejorar; solo necesitas darle las herramientas adecuadas para que revise su propio trabajo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →