← Últimos artículos
💬 NLP

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

Este artículo presenta ORBIT, un marco de aprendizaje por refuerzo meta-multitarea que mejora significativamente las capacidades de aprendizaje en contexto y en línea de los grandes modelos de lenguaje, permitiendo que modelos de código abierto más pequeños igualen el rendimiento de modelos propietarios avanzados como GPT-5.2 en entornos interactivos no vistos.

Autores originales: Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El gran problema: El genio "amnésico"

Imagina que tienes a un estudiante brillante que se ha leído todos los libros de la biblioteca. Es un genio respondiendo preguntas basadas en lo que ya ha leído. Sin embargo, si lo pones en un videojuego nuevo o en un laberinto que nunca ha visto, le cuesta mucho.

Si comete un error en la primera ronda, realmente no "aprende" de ello para la siguiente ronda. Trata cada nuevo intento como si fuera el primero, olvidando las lecciones de los intentos anteriores. Este es el estado actual de muchos Modelos de Lenguaje Extensos (LLMs). Son excelentes en tareas estáticas (como escribir un ensayo), pero malos en el aprendizaje en línea (online learning): la capacidad de comprender las cosas sobre la marcha mediante la interacción con el mundo, cometiendo errores y ajustando su estrategia en tiempo real.

La solución: ORBIT (El entrenador de "la práctica hace al maestro")

Los autores crearon un nuevo método de entrenamiento llamado ORBIT. Piensa en ORBIT no como un profesor que te da las respuestas, sino como un entrenador que obliga al estudiante a jugar al mismo juego una y otra vez, pero con un giro: al estudiante se le permite llevar un cuaderno de sus intentos anteriores.

En este entrenamiento:

  1. La configuración: La IA juega un juego (como un laberio o un rompecabezas) varias veces.
  2. La regla: Después de que el primer intento falla, la IA no recibe un "reinicio" donde lo olvida todo. En su lugar, ve el historial completo de su primer intento (dónde se quedó atascada, qué intentó) escrito en su "ventana de contexto" (su memoria a corto plazo).
  3. El objetivo: La IA no solo es recompensada por ganar la primera vez. Es recompensada por aprender a aprender. Obtiene puntos por usar su cuaderno para descubrir una mejor estrategia para el segundo y tercer intento.

La analogía: Aprender a jugar "Mastermind"

Imagina un juego llamado Mastermind, donde tienes que adivinar un código secreto de clavijas de colores.

  • Sin ORBIT: Haces una suposición de un código. Es incorrecta. Lo intentas de nuevo, pero vuelves a proponer exactamente el mismo código porque realmente no procesaste por qué el primero falló. Estás atrapado en un bucle.
  • Con ORBIT: Haces una suposición de un código. Es incorrecta. Antes de tu siguiente intento, miras tu "cuaderno" (el historial del juego). Te dices a ti mismo: "Bien, en mi primer intento, puse Rojo en el primer lugar y estaba mal. En mi segundo intento, probé Azul y también estaba mal. Así que sé que la primera clavija no es Roja ni Azul. Debería probar con Verde".

ORBIT entrena a la IA para que realice este tipo de reflexión de forma automática, sin necesidad de que un humano le diga que "piense en sus errores".

Cómo lo probaron

Los investigadores tomaron un modelo de IA de código abierto relativamente pequeño (llamado Qwen3-14B) y lo entrenaron usando este método ORBIT en algunos juegos sencillos (como el Buscaminas y el Blackjack).

Luego, lo lanzaron a juegos completamente nuevos que nunca había visto (como un Laberinto complejo y Mastermind).

  • El resultado: La IA entrenada no solo adivinaba al azar. En el primer intento, podría fallar. Pero en el segundo y tercer intento, utilizó el historial de sus fallos para navegar por el laberinto o descifrar el código mucho mejor.
  • La comparación: Funcionó tan bien que igualó las capacidades de una IA comercial masiva y de alto nivel (GPT-5.2) y superó a los métodos de entrenamiento estándar que usualmente solo enseñan a la IA a resolver un problema específico sin aprender de los errores pasados.

La sorpresa del "Escalamiento" (Scaling)

El artículo también encontró algo interesante sobre el tamaño. Probaron versiones más pequeñas y más grandes de la IA.

  • IA pequeña: Buena para resolver el rompecabezas inmediatamente.
  • IA grande: Sorprendentemente, la IA más grande estaba dispuesta a "desperdiciar" el primer intento solo para recopilar información (exploración). Intentaría algunas cosas para ver qué pasaba, lo anotaría y luego usaría ese conocimiento para arrasar con el rompecabezas en el segundo y tercer intento.
  • La conclusión: Los modelos más grandes entrenados de esta manera son incluso mejores en esta estrategia de "aprender sobre la marcha".

Qué significa esto (Estrictamente basado en el artículo)

El artículo afirma que:

  1. El entrenamiento funciona: Puedes enseñar a una IA a aprender de sus propias interacciones sin cambiar su cerebro (pesos) durante la tarea real. Aprende enteramente a través de su memoria de intentos pasados.
  2. Es generalizable: Esta habilidad se transfiere a entornos nuevos y no vistos. La IA no solo memorizó el laberinto; aprendió la habilidad de explorar y adaptarse.
  3. La simplicidad gana: No necesitaron bancos de memoria externos complejos ni prompts escritos por humanos para decirle a la IA que "reflexione". El propio método de entrenamiento fue suficiente para que la IA comenzara naturalmente a resumir sus fallos pasados y a planificar mejores movimientos.

En resumen, ORBIT convierte a una IA estática y de "conocimiento de libros" en un agente con "astucia de calle" que puede comprender nuevas reglas y entornos mediante el ensayo, el error y el recuerdo de lo que sucedió antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →