← Últimos artículos
🤖 AI

Discovering Multiagent Learning Algorithms with Large Language Models

Este artículo demuestra que los Modelos de Lenguaje de Gran Escala pueden automatizar el descubrimiento de algoritmos competitivos de Aprendizaje por Refuerzo Multiagente para juegos de información imperfecta, y muestra que destilar estos hallazgos complejos y específicos del entorno en núcleos algorítmicos mínimos produce una generalización superior y una complejidad estructural reducida.

Autores originales: Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

Publicado 2026-05-11
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un grupo de robots a jugar al póker, al Go o incluso a un juego de "Dadín Mentiroso". Durante décadas, los humanos han sido los entrenadores, ajustando manualmente los cerebros de los robots, probando diferentes fórmulas matemáticas y esperando que mejoren. Es un proceso lento y tedioso de prueba y error.

Este artículo describe una nueva forma de entrenar: en lugar de que un humano ajuste el código, los investigadores permitieron que un Modelo de Lenguaje Grande (LLM) —una inteligencia artificial superinteligente que entiende el código— actuara como un biólogo evolutivo. Llaman a este sistema AlphaEvolve.

Aquí está la historia de lo que descubrieron, desglosada en conceptos simples.

1. El Laboratorio Evolutivo

Los investigadores configuraron un "laboratorio" digital con dos tipos diferentes de algoritmos para jugar:

  • CFR (Minimización de Arrepentimiento Contrafactual): Piensa en esto como un estudiante que aprende revisando cada error que cometió y preguntándose: "¿Si hubiera hecho algo diferente, habría ganado?".
  • PSRO (Oráculos de Respuesta en el Espacio de Políticas): Esto es como un entrenador que forma un equipo de diferentes jugadores, los enfrenta entre sí y constantemente añade nuevos jugadores más inteligentes a la lista para vencer al mejor actual.

Se le dio al LLM el código fuente de estos algoritmos y se le dijo: "Mejora esto. Reduce los errores (explotabilidad) que cometen los robots".

El LLM no solo ajustó unos pocos números; reescribió la lógica del código mismo, mutando los algoritmos como si fueran ADN. Después de muchas generaciones de "supervivencia del más apto", el LLM produjo dos algoritmos nuevos y altamente complejos:

  • VAD-CFR: Una versión del estudiante de "Arrepentimiento" que se adapta salvajemente a lo caótico que se siente el juego.
  • SHOR-PSRO: Una versión del "Entrenador de Equipo" que mezcla diferentes estrategias de una manera muy específica y compleja.

2. La Trampa del "Sobrediseño"

Cuando probaron estos nuevos algoritmos descubiertos por la IA, eran increíbles. Derrotaron a todos los campeones diseñados por humanos en los juegos específicos en los que fueron entrenados.

Sin embargo, los investigadores notaron algo sospechoso. El LLM había construido estos algoritmos como un chef maestro creando un plato específicamente para un comensal muy exigente. El código estaba lleno de mecanismos complejos y enredados que funcionaban perfectamente para los juegos de entrenamiento, pero que probablemente eran solo "sobreajuste": memorizando los datos de entrenamiento en lugar de aprender las reglas generales del juego.

Era como si el LLM hubiera construido un coche con un turbocompresor, un sistema de nitro y una suspensión especial ajustada solo para una pista de carreras específica. Ganaría en esa pista, pero si lo llevabas a un camino de tierra lleno de baches, podría desmoronarse.

3. La Cirugía de "Ablación" (El Trabajo de Detective)

Para descubrir qué era lo que realmente hacía inteligentes a estos algoritmos, los investigadores realizaron "cirugía". Eliminaron sistemáticamente partes del código para ver qué ocurría. Esto se llama ablación.

Descubrieron que las partes elegantes y complejas (como rastrear la volatilidad o mezclar estrategias de maneras específicas) eran en su mayoría relleno. Ayudaban al algoritmo a ganar en la pista de entrenamiento, pero no le ayudaban a generalizar a nuevos juegos.

Cuando quitaron el "traje de gala", encontraron los huesos desnudos que realmente hacían funcionar al motor.

4. Los Ganadores Destilados

Manteniendo solo los principios más esenciales y fundamentales, y tirando el código sobrecomplicado, crearon dos algoritmos nuevos y más simples:

  • WOP-CFR (CFR Predictivo Optimista con Inicio Cálido):

    • La Analogía: Imagina a un estudiante que se niega a tomar apuntes durante los primeros 500 días de clase (un "inicio cálido") para evitar anotar malos hábitos. Luego, empieza a tomar apuntes, pero son "optimistas": asumen que el siguiente movimiento será ligeramente mejor de lo que es, lo cual les ayuda a aprender más rápido.
    • El Resultado: Esta versión simple fue en realidad mejor generalizando a nuevos juegos que el original complejo. Era menos propensa a confundirse con situaciones nuevas.
  • PM-PSRO (PSRO de Ajuste por Proyección):

    • La Analogía: Imagina a un entrenador que ignora el "ruido" de la multitud. En lugar de mirar cada puntaje individual, mira cómo se desempeña un jugador en relación con el promedio de todo el equipo. Si un jugador está por debajo del promedio, se olvida instantáneamente. Si está por encima del promedio, recibe el foco de atención.
    • El Resultado: Esta versión simplificada también fue superior al original complejo, demostrando que la lógica de mezcla compleja del LLM no era necesaria.

5. La Gran Conclusión

El artículo concluye que los LLM son excelentes proponiendo ideas, pero se necesitan humanos para destilarlas.

El LLM actuó como un inventor creativo que construye una máquina con 500 piezas móviles. Los investigadores actuaron como ingenieros que se dieron cuenta: "Oye, solo necesitamos 3 de estas piezas para que funcione, y eliminar las otras 497 la hace más rápida y confiable".

Resumen de la Afirmación:
Los investigadores utilizaron con éxito una IA para descubrir nuevos algoritmos de juego que derrotaron a expertos humanos. Sin embargo, los descubrimientos crudos de la IA eran demasiado complejos y especializados. Al eliminar quirúrgicamente la complejidad innecesaria, crearon algoritmos más simples y limpios que fueron incluso mejores manejando juegos nuevos e inéditos. Esto demuestra que la IA puede ser una herramienta poderosa para el descubrimiento científico, siempre que los humanos estén allí para simplificar e interpretar los resultados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →