← Últimos artículos
💻 computer science

A New Evolutionary Strategy: Learn From the Best

Este artículo presenta Learn From the Best Evolution Strategy (LFB-ES), un nuevo optimizador de caja negra que mejora el entrenamiento de redes neuronales de alta dimensión al guiar iterativamente a la población para aprender de los individuos de élite, logrando así una convergencia y precisión superiores en comparación con métodos clásicos como OpenAI-ES y CMA-ES.

Autores originales: Zhijian Mo, Qihua Xiao, Zhihui Shan, Xueli Ban

Publicado 2026-08-31
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Zhijian Mo, Qihua Xiao, Zhihui Shan, Xueli Ban

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el vasto paisaje de la inteligencia artificial, existe un tipo específico de rompecabezas que desconcierta incluso a los sistemas de aprendizaje más avanzados. Imagine intentar enseñarle a un robot a caminar, o a un programa informático a predecir un patrón meteorológico complejo, pero con la prohibición de darle cualquier pista durante el proceso. No puede decirle: "tu pie izquierdo está demasiado alto" o "tu predicción para el martes fue ligeramente errónea". Solo puede esperar hasta el final de la tarea y entregarle un único número: una puntuación. Esto se conoce como un problema de optimización de caja negra con recompensas dispersas. El sistema debe descubrir cómo mejorar sus ajustes internos basándose únicamente en esa calificación final, sin recibir ninguna retroalimentación paso a paso. Este escenario es común en la ingeniería del mundo real, desde el ajuste de los parámetros de un nuevo motor hasta el ajuste de curvas matemáticas a datos ruidosos, pero sigue siendo uno de los desafíos más difíciles porque el camino hacia la mejora es invisible.

Durante años, los científicos han dependido de las estrategias evolutivas para resolver estos rompecabezas. Estos métodos imitan la selección natural: crean una población de agentes digitales, cada uno con ajustes internos ligeramente diferentes, dejan que intenten realizar la tarea y conservan a los que obtienen las mejores puntuaciones. Los dos métodos más famosos de este tipo, OpenAI-ES y CMA-ES, han sido las herramientas estándar para este trabajo. Sin embargo, tienen dificultades cuando las tareas se vuelven altamente complejas y el número de ajustes a calibrar aumenta considerablemente. A menudo se quedan atrapados en bucles locales, moviéndose lentamente y fallando al capturar los detalles finos del problema, de forma muy similar a un excursionista que vaga por un bosque denso y sigue dando vueltas en el mismo pequeño claro en lugar de encontrar la cima de la montaña.

Un equipo de investigadores de Lenovo ha propuesto un nuevo camino a seguir llamado "Learn From the Best Evolution Strategy", o LFB-ES (Aprender de la mejor estrategia de evolución). En lugar de depender de la suerte aleatoria para tropezar con mejores soluciones, este nuevo método introduce una forma estructurada de aprendizaje dentro de la población. En cada generación del experimento, el agente con el mejor desempeño es elegido como maestro. El resto del grupo, actuando como estudiantes, estudia entonces el comportamiento del maestro. No se limitan a copiar la puntuación final del maestro; intentan imitar la secuencia específica de acciones y resultados que el maestro produjo durante la tarea. Al utilizar un proceso matemático para minimizar la diferencia entre sus propios resultados y los del maestro, los estudiantes ajustan rápidamente sus ajustes internos para parecerse más al ganador. Esto crea un ciclo en el que la población escala colectivamente hacia una mejor solución, guiada por el actual campeón en lugar de vagar ciegamente.

Los investigadores probaron este enfoque en un difícil desafío de ajuste de curvas. Pidieron a los algoritmos que predijeran un patrón de ondas altamente complejo y de oscilación rápida, una tarea que requiere capturar miles de diminutos picos y valles. La única información que los algoritmos recibieron fue el error total de su predicción completa al final de la ejecución. Los resultados fueron sorprendentes. El nuevo método LFB-ES convergió en la respuesta correcta mucho más rápido que los métodos tradicionales y alcanzó un nivel de precisión que los otros no pudieron alcanzar. Mientras que los algoritegmos más antiguos producían líneas planas e inexactas que perdían los detalles intrincados de la onda, el nuevo método reprodujo el patrón complejo con una precisión notable, coincidiendo casi perfectamente con los datos reales.

Una parte crucial de este éxito fue la elección de los "interruptores" internos que la computadora utiliza para procesar la información, conocidos como funciones de activación. Los investigadores descubrieron que un tipo específico de interruptor que se repite en un ciclo, similar a la forma en que una onda senoidal sube y baja, funcionaba mucho mejor que los interruptores estándar utilizados en la mayoría de la IA moderna. Cuando reemplazaron los interruptores estándar por este tipo de interruptor periódico y repetitivo dentro de su nuevo marco de aprendizaje, la capacidad del sistema para explorar y encontrar la mejor solución mejoró drásticamente. Sin embargo, también descubrieron que esta ventaja no era universal. Cuando aplicaron el mismo método a un tipo diferente de problema que involucraba decisiones discretas, como jugar un videojuego donde el agente debe elegir entre moverse a la izquierda o a la derecha, el nuevo método no mostró la misma superioridad abrumadora. Funcionó ligeramente mejor que los viejos métodos aleatorios, pero no dominó de la misma manera que lo hizo en la tarea de ajuste de curvas continuas.

El estudio también examinó el costo de este nuevo enfoque. Debido a que el método requiere que los agentes estudiantes aprendan del maestro a través de una serie de cálculos, toma más tiempo ejecutarse que los métodos aleatorios más simples. Sin embargo, los investigadores demostraron que este tiempo adicional es manejable y escala de manera razonable incluso a medida que aumenta el número de ajustes a calibrar. En contraste, uno de los métodos más antiguos y complejos se volvió imposible de ejecutar en problemas grandes porque se quedó sin memoria informática. La nueva estrategia ofrece un punto medio: es más exigente computacionalmente que la búsqueda aleatoria más simple, pero mucho más eficiente y capaz que las alternativas pesadas y ávidas de memoria, lo que la convierte en una herramienta práctica para resolver problemas de alta dimensionalidad donde solo está disponible una puntuación final.

En última instancia, este trabajo demuestra que incluso en un entorno completamente cerrado donde no se proporciona guía intermedia, una población de agentes puede aprender a mejorar rápidamente si se les permite aprender de sus mejores desempeños. Al combinar esta dinámica de aprendizaje social con las herramientas matemáticas adecuadas, los investigadores han creado un sistema que navega la niebla de la optimización de caja negra con mucha más claridad y velocidad que antes. Si bien el método no es una solución mágica para todo tipo de problemas, proporciona una nueva y poderosa herramienta para ingenieros y científicos que necesitan ajustar sistemas complejos sin conocer las reglas internas del juego.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →