← Últimos artículos
💻 computer science

Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning

El artículo presenta CrossHA, un modelo agéntico unificado entrenado mediante un novedoso flujo de trabajo que combina el ajuste fino supervisado y la Optimización de Política Relativa de Grupo de Multiturno para seleccionar y alternar autónomamente entre espacios de acción heterogéneos, logrando así un rendimiento y una adaptabilidad de vanguardia en tareas dinámicas de largo alcance dentro del entorno de Minecraft.

Autores originales: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

Publicado 2026-06-05
📖 4 min de lectura☕ Lectura para el café

Autores originales: Kaichen He, Zihao Wang, Muyao Li, Anji Liu, Yitao Liang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a jugar al videojuego Minecraft. En el pasado, los investigadores tenían que construir "cerebros" separados para diferentes partes del juego. Un cerebro era bueno para caminar (usando comandos simples, paso a paso), otro era bueno haciendo clic en menús (usando movimientos de ratón precisos) y un tercero era bueno utilizando atajos de alto nivel (como "ir al árbol más cercano").

El problema era que estos robots eran rígidos. Si una tarea requería caminar y luego hacer clic en un menú, el robot se confundía o se quedaba trabado porque había sido entrenado para usar solo un tipo de "lenguaje" a la vez.

La Gran Idea: El Agente "Navaja Suiza"
Este artículo presenta CrossHA, un nuevo tipo de agente de IA que actúa como un maestro chef con una cocina completa. En lugar de verse obligado a usar solo una cuchara o solo un cuchillo, CrossHA aprende a mirar el ingrediente (la tarea) y decide instantáneamente: "¿Necesito un picado tosco (un movimiento simple) o un corte fino (un clic preciso) en este momento?".

Es el primer modelo que puede cambiar fluidamente entre diferentes "lenguajes de acción" sobre la marcha, sin que un humano tenga que decirle qué usar en cada paso.

Cómo lo Enseñaron (La Receta de Entrenamiento)

Los investigadores no solo vertieron datos sobre el modelo; utilizaron un flujo de entrenamiento de tres pasos, similar a cómo un humano aprende una habilidad compleja:

  1. La Fase de "Degustación" (Ajuste Fino Supervisado):
    Primero, le mostraron al modelo miles de ejemplos de personas jugando al juego utilizando diferentes métodos (algunos caminaban, otros hacían clic, otros usaban atajos). El objetivo aquí era simplemente enseñar al modelo el "vocabulario" de todos estos diferentes métodos para que pudiera entenderlos todos. Era como enseñarle a un estudiante a leer inglés, español y francés, pero sin pedirle todavía que escribiera una historia.

  2. La Fase de "Sprint" (RL de Turno Único):
    Después, le dieron al modelo desafíos cortos de un solo paso. Si el modelo intentaba resolver un problema usando el "lenguaje" equivocado (por ejemplo, intentar atravesar una puerta cerrada en lugar de hacer clic en el pomo), recibía una puntuación baja. Si elegía la herramienta adecuada para el trabajo, recibía una recompensa. Esto le enseñó al modelo a tomar decisiones rápidas e inteligentes sobre qué herramienta elegir para un momento específico.

  3. La Fase de "Maratón" (RL de Multi-Turno):
    Finalmente, dejaron que el modelo jugara partidas completas y largas. El objetivo no era solo acertar un paso, sino completar toda la misión de manera eficiente. El modelo aprendió que, a veces, usar un método "rápido pero tosco" es mejor para caminar a través de un campo, pero cambiar a un método "lento pero preciso" es necesario para fabricar un objeto delicado. Aprendió a equilibrar la velocidad y la precisión a lo largo de un viaje largo.

Los Resultados: Por Qué Importa

Los investigadores probaron este modelo en más de 800 tareas diferentes en Minecraft, que iban desde talar árboles hasta fabricar objetos complejos y luchar contra monstruos.

  • La Forma Antigua: Los robots entrenados para usar solo un método (como solo caminar) eran excelentes caminando, pero pésimos fabricando objetos. Eran como una persona que solo sabe correr pero no sabe abrir una puerta.
  • La Forma de CrossHA: El nuevo modelo fue el mejor en todo. No solo obtuvo puntuaciones promedio altas; destacó porque sabía exactamente cuándo cambiar de marcha.

La Analogía del "Conductor Inteligente":
Imagina conducir un coche.

  • Un robot de acción fija es como un conductor que solo sabe conducir por una autopista. Si llega a un camino de tierra, choca. Si entra en un estacionamiento, se pierde.
  • CrossHA es como un conductor experto que sabe cuándo poner una marcha alta para la autopista (eficiencia) y cuándo poner una marcha baja y maniobrar con cuidado para un estacionamiento estrecho (precisión). No necesita un copiloto que le diga cuándo cambiar de marcha; simplemente siente la carretera y se adapta.

La Conclusión

El artículo afirma que, al entrenar a un solo modelo para dominar todos estos diferentes "espacios de acción" y dejar que aprendiera mediante el aprendizaje por refuerzo (ensayo y error con recompensas), crearon un agente que es significativamente más inteligente, flexible y eficiente que los modelos anteriores que estaban limitados al uso de un solo tipo de acción.

Lo demostraron mostrando que el modelo podía manejar más de 800 desafíos en un juego de mundo abierto y complejo, superando a todos los demás métodos existentes. El código y los modelos ahora están disponibles para que otros los utilicen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →