← Últimos artículos
🤖 AI

Impartial Games: A Challenge for Reinforcement Learning

Este artículo demuestra que los algoritmos de aprendizaje por refuerzo al estilo de AlphaZero no logran alcanzar la maestría de nivel experto en juegos imparciales como el Nim debido a un cuello de botella representacional fundamental al aprender principios matemáticos abstractos, revelando que el simple ajuste de hiperparámetros no puede superar su incapacidad para generalizar más allá de los estados memorizados.

Autores originales: Bei Zhou, Søren Riis

Publicado 2026-09-09
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Bei Zhou, Søren Riis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, un tipo específico de programa informático se ha vuelto famoso recientemente por su capacidad para dominar juegos de estrategia complejos. Al jugar millones de partidas contra sí mismo, estos programas aprenden a realizar movimientos que a menudo sorprenden incluso a los más grandes expertos humanos. Se han convertido en campeones en juegos como el ajedrez y el Go, donde el éxito depende de reconocer patrones, evaluar posiciones y planificar muchos pasos por delante. La idea subyacente es que, si una máquina puede aprender a ganar comprendiendo el flujo de un juego, eventualmente podría aprender a resolver cualquier problema complejo. Sin embargo, este éxito ha creado una falsa sensación de seguridad. Resulta que la forma en que estas máquinas aprenden no es universal. Existe una clase específica de juegos donde las reglas son simples, las piezas son compartidas por ambos jugadores y la estrategia ganadora depende de una lógica matemática oculta en lugar del reconocimiento de patrones. En estos juegos, los sistemas de inteligencia artificial más avanzados chocan contra un muro, fallando al aprender los principios mismos que hacen que el juego sea resoluble para los humanos.

Investigadores del Imperial College London y la Queen Mary University of London decidieron investigar este punto ciego utilizando un juego llamado Nim. El Nim es un juego que se juega con varias pilas de objetos, donde dos jugadores se turnan para retirar cualquier número de objetos de una sola pila. El objetivo es ser quien tome el último objeto. Aunque el juego parece simple, el secreto para ganar es un cálculo matemático específico que involucra los números binarios de los tamaños de las pilas. Para un humano, aprender esta regla es una cuestión de comprender un único concepto abstracto. Para la inteligencia artificial, el desafío es diferente. Los investigadores querían ver si los mismos algoritmos de aprendizaje que conquistaron el ajedza podrían aprender a ganar en el Nim, y si no era así, por qué. Construyeron una versión personalizada del famoso sistema de aprendizaje AlphaZero y la entrenaron para jugar al Nim en tableros de tamaño creciente, observando de cerca cómo evolucionaba la comprensión de la computadora.

Los resultados fueron crudos y reveladores. Cuando los investigadores probaron el sistema en un tablero de Nim pequeño con cinco pilas, la computadora aprendió a jugar bien. Podía ganar consistentemente, actuando como un campeón que sabe cómo iniciar un juego y dirigirlo hacia la victoria. Sin embargo, tan pronto como el tamaño del tablero aumentó a seis o siete pilas, el rendimiento del sistema colapsó. La computadora dejó de aprender a ganar. En lugar de encontrar los movimientos correctos, comenzó a adivinar, desempeñándose no mejor que si hubiera elegido movimientos al azar. Los investigadores descubrieron que el problema no era que el juego fuera demasiado complejo o que la computadora necesitara más tiempo para entrenar. El problema era fundamental en la forma en que el cerebro de la computadora, un tipo de red neuronal, procesa la información. Estas redes son excelentes para detectar conexiones entre cosas, como reconocer que una cierta disposición de piezas de ajedrez suele conducir a una victoria. Pero luchan intensamente con un tipo específico de lógica llamada paridad, que es esencialmente una forma de contar si un número es par o impar a través de un grupo de elementos. En el Nim, el movimiento ganador depende enteramente de este tipo de lógica de conteo.

Para entender por qué esto importa, los investigadores introdujeron una nueva forma de medir la habilidad de una inteligencia artificial. Distinguieron entre un "campeón" y un "experto". Un campeón es un jugador que puede ganar desde la posición inicial guiando el juego hacia un territorio familiar donde sabe qué hacer. Un experto, sin embargo, puede realizar el movimiento perfecto desde cualquier posición en el tablero, incluso en aquellas que nunca ha visto. El estudio mostró que la inteligencia artificial podía convertirse en un campeón en tableros pequeños, memorizando los movimientos iniciales correctos. Pero falló al convertirse en un experto. Cuando el juego pasaba a las etapas intermedias o finales, o cuando el tablero era más grande, la computadora no podía determinar el movimiento correcto. Su guía interna, que se supone debe decirle qué movimientos son buenos, se confundía. Asignaba una alta probabilidad a un movimiento perdedor e ignoraba el ganador. Incluso cuando la computadora ejecutaba millones de simulaciones para verificar sus elecciones, no podía corregir su error inicial porque su suposición inicial estaba demasiado errada.

Los investigadores probaron si este fallo se debía al método de aprendizaje en sí mismo o a la dificultad de la lógica del juego. Crearon una versión del juego donde los dos jugadores controlaban pilas diferentes y no necesitaban usar la lógica de paridad para ganar. En este juego modificado, la misma inteligencia artificial aprendió rápida y fácilmente, demostrando que el sistema de aprendizaje era capaz. Esto confirmó que el problema no era el proceso de entrenamiento, sino el tipo específico de matemática requerida para el juego original. La computadora simplemente no podía aprender la regla abstracta de la paridad a partir de los datos que generaba al jugar contra sí misma. El ruido en los datos, causado por los errores que cometía la computadora durante su fase inicial de aprendizaje, hacía imposible que la red descifrara el patrón subyacente.

Este hallazgo desafía la idea de que la inteligencia artificial actual puede resolver cualquier problema si se le otorga suficiente información y potencia de cómputo. Sugiere que existen ciertos tipos de razonamiento lógico que estos sistemas no pueden aprender por sí solos. Los investigadores proponen que, para dominar verdaderamente juegos como el Nim, y quizás otros problemas complejos que dependen de la matemática abstracta, la inteligencia artificial del futuro deberá construirse de manera diferente. Sugieren combinar el poder de reconocimiento de patrones de los sistemas actuales con un módulo de razonamiento simbólico separado que pueda manejar estas reglas lógicas específicas. Hasta que se realice tal cambio, estos poderosos sistemas de aprendizaje seguirán siendo campeones en algunas áreas, pero permanecerán ciegos ante la lógica fundamental de otras, incapaces de alcanzar el nivel de verdadera pericia que un humano puede lograr con una sola intuición.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →