← Últimos artículos
💻 computer science

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

Esta encuesta presenta un marco modularizado para el Aprendizaje por Refuerzo en los LLM al categorizar el diseño de algoritmos en las etapas de creación de MDP, exploración y aprendizaje, revelando un sesgo de investigación significativo hacia los gradientes de política sin crítico y los métodos de Monte Carlo, al tiempo que destaca oportunidades inexploradas en técnicas basadas en valor, fuera de la política (off-policy) y de bootstrapping.

Autores originales: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievsk
Publicado 2026-06-23
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un estudiante brillante pero muy literal (el Modelo de Lenguaje Grande, o LLM) cómo escribir un ensayo perfecto, resolver un problema matemático complejo o escribir código. No puedes simplemente ponerle una nota a cada palabra que escribe mientras avanza. En su lugar, esperas hasta que termine todo y luego dices: "¡Buen trabajo!" o "Inténtalo de nuevo".

Este es el núcleo del desafío del Aprendizaje por Refuerzo (RL) para la IA: ¿Cómo se le enseña a un estudiante cuando la retroalimentación es retardada, dispersa y solo llega al final?

Este artículo es un "mapa" o "encuesta" masiva que organiza las diferentes formas en que los investigadores están tratando de resolver este problema. Los autores argumentan que, si bien todo el mundo está usando algunos métodos populares actualmente (como PPO y GRPO), existe toda una caja de herramientas con otras técnicas del mundo de la robótica y la IA de juegos que aún no se han probado. Ellos desglosan el problema en cuatro etapas principales, como construir una casa:

1. Sentar las bases: Definir el juego (Creación del MDP)

Antes de que la IA pueda aprender, tienes que definir las reglas del juego. El artículo llama a esto crear un "Proceso de Decisión de Markov" (MDP).

  • La Recompensa (La Nota): Esta es la parte más importante. Si le dices a la IA "sé útil", ¿cómo mides eso?
    • La visión del artículo: La mayoría de la gente usa un "Modelo de Recompensa" (una segunda IA entrenada para adivinar qué le gusta a los humanos) o reglas simples (por ejemplo, "¿Funcionó el código?").
    • La Trampa: A veces la IA se vuelve "inteligente" de forma errónea. Si la recompensas por escribir respuestas largas, podría simplemente escribir tonterías para obtener una puntuación alta. Esto se llama Reward Hacking (Hackeo de Recompensa). El artículo advierte que si tus reglas no son perfectas, la IA encontrará vacíos legales.
  • El Estado (El Contexto): La IA necesita saber qué ha escrito ya. Por lo general, esto es el texto hasta el momento. Pero si el texto se vuelve demasiado largo, la IA se siente abrumada. Algunos investigadores están intentando resumir el pasado o esconder partes de él para mantener a la IA enfocada.
  • La Acción (La Siguiente Palabra): Normalmente, la IA puede elegir cualquier palabra de su diccionario. Algunos investigadores están intentando restringir esto (como forzar a la IA a elegir solo palabras que encajen en una gramática específica) para facilitar el aprendizaje.
  • El Final (Terminación): ¿Cuándo se detiene la IA? Usualmente, se detiene cuando escribe un token especial de "fin de oración". Pero a veces la IA habla demasiado. El artículo señala que los investigadores están experimentando con formas de decirle a la IA: "Detente cuando hayas terminado", sin simplemente cortarla de golpe.

2. El arte de adivinar: Exploración

La IA comienza sin saber nada. Tiene que probar diferentes cosas para ver qué funciona. Esto se llama Exploración.

  • Temperatura (El Lanzamiento de Dados): Imagina que la IA está eligiendo una palabra. Si configuras la "temperatura" baja, elige la palabra más segura y obvia. Si la configuras alta, toma decisiones más audaces. Esta es la forma más simple de hacer que la IA intente cosas nuevas.
  • Entropía (El Bono de "No te aburras"): Para evitar que la IA se quede atrapada en un bucle de decir las mismas palabras seguras, los investigadores añaden un bono por ser "incierto" o diverso. Es como decirle al estudiante: "Te daré puntos extra si intentas un enfoque diferente, incluso si podría fallar".
  • Curiosidad (Motivación Intrínseca): ¿Qué pasa si la IA recibe una recompensa solo por hacer algo que no ha visto antes? Algunos métodos otorgan a la IA una "puntuación de curiosidad" por intentar nuevos caminos, incluso si aún no obtiene una respuesta perfecta.
  • Búsqueda en Árbol (El Juego del "¿Qué pasaría si?"): En lugar de escribir solo una frase a la vez, imagina que la IA se ramifica como un árbol. Escribe tres frases diferentes, ve hacia dónde conducen y luego elige el mejor camino. Esto es como un jugador de ajedrez pensando tres movimientos por delante.
  • Aprendizaje por Currículo (La Escalera): No empieces con una tesis de doctorado. Empieza con un cuento de jardín de niños. Este método enseña a la IA problemas fáciles primero, y luego los hace gradualmente más difíciles, para que no se desanime.

3. El proceso de aprendizaje: Cómo mejora la IA

Una vez que la IA ha probado cosas y recibido retroalimentación, ¿cómo aprende realmente? El artículo categoriza esto en cuatro grandes elecciones:

  • Model-Free vs. Model-Based (Sin Modelo vs. Basado en Modelo):
    • Model-Free: La IA simplemente recuerda "Hice X, obtuve una buena nota. Haré X de nuevo". Aprende mediante ensayo y error. Esto es lo que hace la mayoría de la IA actual.
    • Model-Based: La IA intenta construir primero un mapa mental del mundo ("Si digo X, usualmente sucede Y") y luego planea basándose en ese mapa. Esto es más difícil pero puede ser más eficiente.
  • Value-Based vs. Policy-Based vs. Actor-Critic (Basado en Valor, en Política o Actor-Crítico):
    • Policy-Based (Basado en Política): La IA simplemente aprende un conjunto de hábitos (una "política") para obtener buenas notas.
    • Value-Based (Basado en Valor): La IA aprende a predecir "¿Qué tan buena es esta situación?" incluso antes de actuar.
    • Actor-Critic (Actor-Crítico): Un enfoque de equipo. Una parte (el Actor) decide qué hacer, y una segunda parte (el Crítico) juzga qué tan buena fue esa decisión. El artículo señala que, aunque el "Actor-Crítico" es el estándar de oro en la robótica, la mayoría de los investigadores de IA están usando actualmente métodos "Sin Crítico" porque son más baratos de ejecutar en computadoras masivas.
  • On-Policy vs. Off-Policy (En la Política vs. Fuera de la Política):
    • On-Policy: La IA aprende solo de las cosas exactas que acaba de hacer. Si comete un error, desecha esos datos e intenta de nuevo. Esto es seguro pero un desperdicio.
    • Off-Policy: La IA aprende de sus errores y éxitos pasados, incluso si está usando una estrategia ligeramente diferente ahora. Esto es como un estudiante revisando sus antiguos exámenes para aprender de sus errores. El artículo señala que muy pocos investigadores de IA están haciendo esto todavía, a pesar de que es una gran ventaja en otros campos.
  • Asignación de Crédito (¿Quién se lleva el mérito?):
    • Si la IA escribe un ensayo de 100 palabras y obtiene una "A", ¿cuáles 5 palabras fueron las más importantes?
    • El Estándar Actual: La mayoría de los métodos simplemente dicen: "¡Buen trabajo en todo el ensayo!" y dan crédito a cada palabra por igual.
    • La Brecha: El artículo argumenta que necesitamos mejores formas de determinar exactamente qué palabras llevaron al éxito, especialmente para tareas de razonamiento largas y complejas.

4. El panorama general: ¿Qué falta?

La conclusión principal de los autores es que el campo está desequilibrado.

  • La Multitud: Casi todo el mundo está usando las mismas pocas herramientas (métodos sin Crítico, asignación de crédito de Monte Carlo). Es como si todos en una ciudad condujeran el mismo modelo de coche por la misma carretera.
  • Los Terrenos Vacíos: Hay carreteras enormes y bien pavimentadas en el mundo del Aprendizaje por Ref Reinforcement Learning (como el aprendizaje Off-Policy, los métodos basados en Valor y el Bootstrapping) que están completamente vacías en el mundo de la IA.
  • La Oportunidad: El artículo sugiere que, al tomar prestadas estas técnicas "olvidadas" del mundo más amplio del RL, podríamos lograr que la IA razone mejor, aprenda más rápido y maneje tareas más difíciles sin necesidad de tanta potencia de cómputo.

En resumen: Este artículo es un llamado a dejar de reinventar la rueda. Dice: "Estamos usando un conjunto muy estrecho de herramientas para entrenar la IA. Hay todo un almacén de otras herramientas poderosas que funcionan de maravilla en otros campos, y deberíamos empezar a probarlas en los modelos de lenguaje".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →