← Últimos artículos
🤖 machine learning

Monte Carlo Permutation Search

Este artículo introduce la Búsqueda de Permutación Monte Carlo (MCPS), un algoritmo MCTS de propósito general que supera al algoritmo GRAVE en juegos como Hex y Go al incorporar estadísticas de simulación a nivel de trayectoria en el término de exploración y derivar una nueva fórmula de ponderación que elimina la necesidad del hiperparámetro de sesgo de GRAVE.

Autores originales: Tristan Cazenave

Publicado 2026-05-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tristan Cazenave

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un rompecabezas complejo, como un juego de Go o Hex, pero no tienes una supercomputadora ni una inteligencia artificial entrenada que te diga el mejor movimiento. En su lugar, debes confiar en "adivinar y verificar" simulando miles de escenarios futuros aleatorios en tu mente. Así es como funciona un programa informático llamado Búsqueda en Árbol Monte Carlo (MCTS).

Durante mucho tiempo, la mejor manera de realizar esta adivinanza fue un algoritmo llamado GRAVE. Era bueno mirar el pasado para predecir el futuro, pero el autor de este artículo, Tristan Cazenave, pensó: "Podemos hacerlo mejor".

Él creó un nuevo algoritmo llamado MCPS (Búsqueda de Permutación Monte Carlo). Así es como funciona, explicado de manera sencilla:

Las Tres Formas de Mirar el Pasado

Para decidir qué movimiento hacer a continuación, MCPS examina su historial de juegos aleatorios (llamados "simulaciones" o "playouts") de tres maneras diferentes. Piensa en ellas como tres lentes diferentes en una cámara:

  1. El Lente "Ruta Exacta" (Vista Estándar):
    Esto examina los juegos donde el jugador realizó la misma secuencia exacta de movimientos para llegar al punto actual, y luego realizó el movimiento específico que estamos probando.

    • Analogía: "Caminé por la Calle Principal, giré a la izquierda y luego compré un café. ¿Cómo salió eso?"
  2. El Lente "El Orden No Importa" (La Mejora de GRAVE):
    Esto examina los juegos donde el jugador realizó los mismos movimientos para llegar al punto, pero el orden fue ligeramente diferente, y el movimiento específico que estamos probando apareció más tarde en el juego.

    • Analogía: "Compré un café, luego caminé por la Calle Principal, y luego giré a la izquierda. Son los mismos ingredientes, solo un orden diferente en la receta. ¿Sigue sabiendo bien?"
    • Por qué ayuda: En muchos juegos, el orden en que colocas tus piezas no cambia el estado final del tablero. Por lo tanto, este lente permite que la computadora aprenda de más juegos, no solo de aquellos que coincidían con el orden exacto.
  3. El Lente "Permutación" (El Nuevo Secreto de MCPS):
    Esta es la nueva adición. Examina cualquier juego donde el jugador utilizó el mismo conjunto exacto de movimientos (la ruta hasta el punto actual + el nuevo movimiento), independientemente del orden en que ocurrieron.

    • Analogía: "Usé un martillo, un destornillador y un clavo para construir una estantería. No importa si martilleé primero o atornillé primero; si usé esas tres herramientas, la estantería se construyó. ¿Cómo funcionó esa combinación?"
    • El Problema: En algunos juegos (como AtariGo), el orden importa porque el juego puede terminar antes (como capturar una piedra). MCPS maneja esto siendo inteligente sobre cómo agrupa estos movimientos.

La "Fórmula Mágica"

El artículo explica que MCPS no elige simplemente una de estas vistas; las mezcla. El autor realizó cálculos matemáticos para determinar la forma perfecta de combinar estas tres fuentes de información.

Piensa en ello como hacer un batido. Tienes tres frutas (las tres estadísticas). GRAVE usaba una receta fija que a veces sabía mal. MCPS usa una receta matemáticamente perfecta que ajusta automáticamente las cantidades en función de cuántos datos tiene para cada fruta. ¿La mejor parte? No necesita una "prueba de sabor" (un humano estableciendo un parámetro de sesgo) para hacerlo bien; las matemáticas lo hacen automáticamente.

Cómo Rindió en el Mundo Real

El autor probó MCPS contra el antiguo campeón (GRAVE) en cinco tipos diferentes de juegos:

  • Hex (El Emparejamiento Perfecto): En este juego, el orden de los movimientos nunca cambia el tablero final. MCPS fue un gran ganador aquí, especialmente en tableros más grandes. Fue como tener un mapa que mostraba cada camino posible, no solo el que tomaste.
  • Go (El Pensador Profundo): En tableros pequeños, fueron casi iguales. Pero en tableros grandes, a medida que se le daba más tiempo a la computadora para pensar, MCPS se adelantó. Fue mejor utilizando ese tiempo extra para profundizar en las líneas de juego más prometedoras, mientras que el método antiguo se quedaba atascado explorando opciones superficiales.
  • AtariGo (El Finalizador Rápido): Este es un juego donde la primera captura gana. Aquí, el orden importa. Sorprendentemente, MCPS aún ganó, pero su ventaja fue mayor en tableros pequeños donde el juego termina rápidamente. En tableros grandes, el juego se vuelve demasiado largo para que el truco de "el orden no importa" ayude tanto.
  • NoGo (El Ganador Consistente): Este es un juego donde pierdes si capturas. MCPS ganó casi en todas partes, superando consistentemente al antiguo método por un margen sólido.
  • Wargame (El Demonio de la Velocidad): En este juego de estrategia personalizado, MCPS no solo jugó mejor; jugó más rápido. Simuló juegos que terminaron antes y encontró la estrategia ganadora más rápidamente, permitiéndole ejecutar más simulaciones en la misma cantidad de tiempo.

La Conclusión

El artículo afirma que MCPS es una forma más inteligente y eficiente para que las computadoras jueguen juegos sin necesidad de aprendizaje profundo ni entrenamiento masivo.

Funciona al darse cuenta de que en muchos juegos, el conjunto de movimientos que haces es más importante que el orden en que los realizas. Al contar todas las veces que apareció un conjunto específico de movimientos en juegos aleatorios, MCPS construye una mejor "intuición" sobre qué movimientos son buenos. Es como un detective que se da cuenta de que incluso si los sospechosos llegaron en un orden diferente, el hecho de que todos estuvieran en la escena es la verdadera pista.

El resultado es una herramienta de propósito general que supera al mejor método anterior en casi todos los escenarios probados, convirtiéndola en un nuevo estándar poderoso para la inteligencia artificial de juegos cuando no tienes una supercomputadora a tu disposición.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →