← Últimos artículos
🤖 AI

Algorithm Discovery With LLMs: Evolutionary Search Meets Reinforcement Learning

Este trabajo propone un marco novedoso que mejora la búsqueda evolutiva basada en LLM para el descubrimiento de algoritmos mediante el refinamiento continuo del operador de búsqueda del LLM mediante ajuste fino con aprendizaje por refuerzo, acelerando así la identificación de soluciones superiores en tareas de optimización combinatoria.

Autores originales: Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

Publicado 2026-05-26
📖 4 min de lectura☕ Lectura para el café

Autores originales: Anja Surina, Amin Mansouri, Lars Quaedvlieg, Amal Seddas, Maryna Viazovska, Emmanuel Abbe, Caglar Gulcehre

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando inventar una nueva receta, súper eficiente, para hornear el pastel perfecto. Tienes un chef muy talentoso (el Modelo de Lenguaje Grande, o LLM) que puede escribir recetas.

La Vieja Forma: El "Chef Estático"
En los métodos anteriores (como el llamado "FunSearch"), le pedías al chef que escribiera una receta. La horneabas, la probabas y veías si era buena. Si estaba bien, la guardabas. Si era excelente, le pedías al chef que mirara esa gran receta e intentara escribir una ligeramente mejor basada en ella. Repetías esto miles de veces.

¿El problema? El chef nunca realmente aprende del proceso. Es como un genio que olvida todo después de cada intento. Sigue adivinando basándose en su entrenamiento original, esperando tropezar con una mejor receta por pura suerte. No actualiza su conocimiento interno sobre lo que hace que un pastel sea bueno.

La Nueva Forma: "EvoTune" (El Chef que Aprende)
Los autores de este artículo proponen un nuevo método llamado EvoTune. Es como contratar al mismo chef talentoso, pero esta vez le das un bucle de entrenamiento especial:

  1. La Prueba de Sabor (Búsqueda Evolutiva): Igual que antes, el chef escribe muchas recetas. Las horneas, las pruebas y las calificas. Guardas las mejores y tiras las malas.
  2. La Lección (Aprendizaje por Refuerzo): Este es el paso mágico. En lugar de simplemente tirar las recetas malas, le muestras al chef a los "ganadores" y a los "perdedores" y dices: "¡Mira la diferencia! El ganador hizo esto, el perdedor hizo aquello".
  3. La Actualización: Luego le das al chef un rápido "curso de actualización" (ajuste fino) basado en estas lecciones. El cerebro del chef cambia realmente para entender por qué funcionó la receta ganadora.
  4. Repetir: Ahora, cuando le pides al chef que escriba el siguiente lote de recetas, ya no está solo adivinando. Está usando su conocimiento recién actualizado para apuntar a los buenos lugares mucho más rápido.

¿Por qué es esto mejor?
Piénsalo como buscar un tesoro oculto en un bosque gigante.

  • La Vieja Forma: Envías a un explorador que tiene un mapa pero no tiene memoria. Vaga por ahí, encuentra un lugar, busca tesoro y luego lo olvida todo. Tiene que vagar al azar de nuevo para encontrar el siguiente lugar.
  • EvoTune: El explorador encuentra un lugar, se da cuenta de "Oh, los árboles aquí son más densos, así que es probable que el tesoro esté cerca", y actualiza su mapa interno. La próxima vez que sale, no vaga al azar; camina directamente hacia las zonas prometedoras.

¿Qué probaron?
Los investigadores probaron esto en tres difíciles "juegos de rompecabezas" donde las computadoras deben encontrar la mejor manera de organizar cosas:

  1. Empaquetado en Contenedores (Bin Packing): Intentar meter cajas de diferentes tamaños en el menor número posible de camiones.
  2. Vendedor Viajero: Encontrar la ruta más corta para visitar una lista de ciudades sin repetir pasos.
  3. Flatpack: Encajar bloques de formas extrañas en una cuadrícula sin que se superpongan (como un Tetris complejo).

Los Resultados
Descubrieron que el "chef que aprende" (EvoTune) encontró mejores soluciones mucho más rápido que el "chef estático" (el método antiguo).

  • Mejores Puntuaciones: Las recetas (algoritmos) encontradas por EvoTune fueron más eficientes.
  • Más Variedad: El chef que aprende no solo encontró una buena receta y se detuvo; encontró una variedad más amplia de soluciones únicas y de alta calidad.
  • Victorias en el Mundo Real: En un desafío específico (la competencia Hash Code de Google sobre colocar servidores en un centro de datos), EvoTune encontró una solución que fue realmente mejor que la mejor solución encontrada por equipos humanos en la competencia.

El Secreto
El artículo también menciona un truco específico que usaron para mantener al chef creativo. A veces, cuando enseñas demasiado a un modelo, se "atasca" y solo escribe lo mismo una y otra vez. Para evitar esto, usaron una regla matemática especial (llamada "Forward KL") que obliga al chef a seguir explorando nuevas ideas mientras sigue aprendiendo de los ganadores.

En Resumen
EvoTune es un sistema que combina búsqueda (probar muchas cosas) con aprendizaje (actualizar el cerebro de la IA basándose en lo que funcionó). Convierte una herramienta estática en un socio de auto-mejora que se vuelve más inteligente cuanto más intenta resolver un problema.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →