← Últimos artículos
🤖 machine learning

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

Este artículo presenta un agente de IA sobrehumano para el juego de estrategia en tiempo real Generals.io que alcanza el puesto número 1 en la tabla de clasificación pública mediante el aprovechamiento de un simulador nativo de JAX con una aceleración de 10,000x para permitir el entrenamiento eficiente de punta a punta de una política de transformador de visión a través de aprendizaje por refuerzo mediante auto-juego.

Autores originales: Matej Straka, Viliam Lisý, Martin Schmid

Publicado 2026-06-23
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Matej Straka, Viliam Lisý, Martin Schmid

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un campo de batalla digital llamado Generals.io. Es un juego de estrategia en tiempo real donde dos comandantes (o equipos) dirigen ejércitos en una cuadrícula. No pueden ver todo el mapa a la vez; solo ven la tierra que poseen y el área inmediata alrededor de sus tropas. El resto está oculto por una "niebla de guerra". El objetivo es simple: capturar el cuartel general enemigo (el General) mientras proteges el tuyo.

Este artículo describe cómo un equipo de investigadores construyó una IA que es tan buena en este juego que venció a los mejores jugadores humanos del mundo. Esta es la historia de cómo lo hicieron, desglosada en conceptos simples.

1. El simulador de "Súper Velocidad"

Antes de poder entrenar a la IA, necesitaban una forma de practicar. En el pasado, entrenar a una IA en este juego era como intentar aprender a conducir viendo un coche moverse una pulgada por hora. Era demasiado lento.

Los investigadores construyeron un nuevo "simulador" (una versión digital del juego) utilizando una herramienta especial llamada JAX. Piensa en esto como pasar de una bicicleta a un jet supersónico.

  • La forma antigua: La versión anterior podía ejecutar unos 3,500 pasos de juego por segundo en una computadora estándar.
  • La nueva forma: Su nueva versión ejecuta 50 millones de pasos por segundo en una sola tarjeta gráfica.
  • El resultado: Esto es una aceleración de 10,000x. Significa que la IA puede jugar millones de partidas en el tiempo que un humano juega una sola. Esta velocidad eliminó el mayor cuello de botella: la IA finalmente podía aprender lo suficientemente rápido como para volverse realmente buena.

2. El campamento de entrenamiento de "Auto-juego" (Self-Play)

En lugar de enseñar a la IA mostrándole videos de expertos humanos (que es como enseñar a un jugador de ajedrez mostrándole solo partidas de grandes maestros), dejaron que la IA jugara contra sí misma.

  • El método: La IA juega millones de partidas contra copias de sí misma.
  • La recompensa: El juego es muy simple: o ganas (+1 punto) o pierdes (-1 punto). No hay "trofeos de participación" ni puntos por matar a unos pocos soldados enemigos. Solo obtienes una recompensa si capturas al General enemigo.
  • El desafío: Debido a que la recompensa es tan rara (solo la obtienes al final de una larga partida), es difícil para la IA entender qué hizo bien. Es como intentar aprender a hornear un pastel probando solo el producto final, sin retroalimentación sobre si añadiste demasiada azúcar o no tanta harina.

3. La receta secreta: Qué fue lo que realmente funcionó

Los investigadores probaron muchas diferentes "recetas" para ver qué hacía que la IA fuera sobrehumana. Descubrieron que algunas cosas que la gente pensaba que eran necesarias eran en realidad inútiles, mientras que algunos trucos simples marcaron la diferencia.

  • No se necesitan "hojas de trucos": No necesitaron darle a la IA reglas complejas o recompensas ajustadas manualmente por hacer cosas "buenas" (como capturar un castillo). Solo la señal simple de "Ganar o Perder" fue suficiente, gracias al simulador súper rápido.
  • El estudiante "promedio" (EMA): En muchos sistemas de IA, utilizas la versión más reciente de la IA que terminó el entrenamiento. Los investigadores descubrieron que tomar un Promedio Móvil Exponencial (EMA) del cerebro de la IA a lo largo del tiempo funcionaba mejor.
    • Analogía: Imagina a un estudiante tomando un examen todos los días. El "último iterado" es solo su puntuación en el último día. El "EMA" es como tomar el promedio de su desempeño durante todo el mes. Los investigadores descubrieron que el "estudiante promedio" era en realidad más consistente e inteligente que el estudiante en su mejor (o peor) día individual.
  • Filtrado de las "buenas" partidas (Filtrado de Ventaja Superior/Top-Advantage Filtering): La IA jugó millones de partidas, pero la mayoría eran aburridas o aleatorias. Los investigadores se dieron cuenta de que no necesitaban aprender de cada partida. Solo conservaron el 25% superior de las partidas donde la IA tenía una ventaja clara y aprendieron de esas.
    • Analogía: Si estás intentando aprender a nadar, no necesitas observar cada vez que te agitas en el agua. Solo necesitas estudiar las veces que nadaste de manera fluida y eficiente. Esto hizo que el entrenamiento fuera mucho más rápido y eficiente.
  • Empezar pequeño: No comenzaron la IA en un mapa enorme. Empezaron con los Generales muy cerca uno del otro para que la IA pudiera aprender a ganar rápidamente. Luego, movieron gradualmente a los Generales más lejos, permitiendo que la IA aprendiera la estrategia a largo plazo paso a paso.

4. Los resultados: Venciendo a los humanos

Después de entrenar durante cuatro días en computadoras potentes, la IA (apodada "Average Joe") fue al ranking público.

  • Clasificación: Alcanzó el #1 de entre más de 5,000 jugadores humanos.
  • La brecha: Venció al segundo lugar humano por un margen enorme. De hecho, la brecha entre la IA y el segundo lugar humano era del mismo tamaño que la brecha entre el segundo lugar humano y el jugador número 25.
  • Cara a cara: Cuando jugaron directamente contra los dos mejores jugadores humanos, la IA ganó 199 juegos y perdió solo 70.
  • Contra los bots antiguos: También aplastó al mejor bot anterior y al mejor bot "basado en reglas" (que utiliza fórmulas matemáticas en lugar de aprendizaje) con una tasa de victoria perfecta del 100%.

5. Lo que la IA "veía"

Los investigadores miraron dentro del cerebro de la IA para ver si estaba pensando como un humano.

  • El detector de la "Niebla": Encontraron una parte específica del cerebro de la IA que parecía rastrear dónde se escondía el General enemigo.
  • La analogía: Imagina que estás jugando al escondite en la oscuridad. Al principio, piensas que la persona podría estar en cualquier lugar. A medida que escuchas un ruido o ves una sombra, reduces las posibilidades a unos pocos lugares. Finalmente, localizas a la persona. El cerebro de la IA hizo exactamente esto: comenzó con una suposición, la redujo a medida que reunía pistas y finalmente "fijó el objetivo" en la ubicación del General enemigo, a pesar de que no podía verlo directamente.

Resumen

El artículo demuestra que no necesitas reglas complejas y diseñadas a mano o cantidades masivas de datos humanos para crear una IA sobrehumana para juegos de estrategia. Si tienes un simulador lo suficientemente rápido y una recompensa simple de "Ganar o Perder", un algoritmo de aprendizaje estándar puede descifrar el resto por sí solo. Los ingredientes clave fueron la velocidad, la paciencia (promediando los resultados) y enfocarse solo en las partidas más informativas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →