Resumen Técnico: ELMER – Modelo de Lenguaje Evolutivo que Explora y Refina
1. Planteamiento del Problema
La evolución de programas enfrenta tradicionalmente una desconexión crítica: si bien puede medir si una mutación mejora el fitness, carece de control sobre la magnitud del movimiento de la mutación en el espacio de comportamiento. Los métodos actuales dependen de proxies sintácticos (p. ej., ediciones de tokens, árboles o subárboles) como escalas de mutación. Estos proxies son poco fiables porque un pequeño cambio sintáctico puede alterar drásticamente la traza de ejecución de una política, mientras que una reescritura grande podría preservar el mismo comportamiento. El artículo identifica la necesidad de una escala de mutación donde la magnitud solicitada prediga directamente el desplazamiento conductual realizado.
2. Metodología
Los autores proponen ELMER, un sistema que desacopla la representación utilizada para la variación de la representación utilizada para la evaluación. La innovación central es un Modelo de Lenguaje Evolutivo que busca sobre descripciones de políticas en lenguaje natural (NL) y las compila en programas ejecutables tipados.
Arquitectura del Sistema
- Representación: Las políticas se mutan como descripciones estandarizadas en lenguaje natural.
- Ejecución: Un compilador aprendido mapea las descripciones de NL en código de Lenguaje de Programación Genética de Trading (GPTL) para una ejecución y backtesting deterministas.
- Desplazamiento Conductual: Definido como el desacuerdo de la señal bruta entre las secuencias de acciones del padre y el hijo sobre una trayectoria histórica compartida.
- El Modelo: Un modelo Qwen3-8B totalmente ajustado (fine-tuned) que aprende tres operaciones condicionadas por la tarea:
- Mutación Semántica Condicional: Genera una descripción de NL hija dada una descripción de NL padre, retroalimentación de backtesting y una fuerza solicitada (s∈{low,medium,high}).
- Compilación de NL a GPTL: Traduce NL a código ejecutable.
- Traducción de GPTL a NL: Convierte el código de vuelta al formato estandarizado de NL.
Pipeline de Entrenamiento
El proceso de entrenamiento involucra dos etapas distintas para aprender el control basado en el comportamiento:
- Ajuste Fino Supervisado (SFT) Basado en el Comportamiento:
- La supervisión se construye a partir de "cadenas de degradación" que parten de programas GPTL de alto fitness.
- Se aplican ediciones de AST gramaticalmente válidas para reducir el fitness, creando transiciones padre-hijo con distancias conductuales conocidas.
- Estas transiciones se revierten y se renderizan en pares de NL, enseñando al modelo a asociar ediciones semánticas con desplazamientos conductuales específicos.
- Optimización de Preferencia de Desplazamiento de Padre Común (oDPO):
- Para agudizar el control, el modelo se optimiza utilizando un marco de preferencia.
- Para un padre y una fuerza solicitada dados, el modelo prefiere un hijo cuyo desplazamiento realizado sea el más cercano al régimen objetivo (μs) sobre un hijo que se desvíe.
- A diferencia de la DPO estándar, que optimiza para calidad binaria, la oDPO incorpora márgenes dependientes de pares basados en el desfase de desplazamiento, lo que permite al modelo aprender una geometría ordinal direccionable del espacio de mutación.
Configuración Experimental
- Dominio: Trading financiero (E-mini S&P 500, Plata, Bonos del Tesoro de EE. UU.) utilizando datos horarios de 2008–2025.
- Protocolo: Búsquedas de presupuesto fijo con exclusiones temporales estrictas. El diseño experimental consiste en 216 búsquedas en la matriz de operadores aprendidos (seis operadores, tres algoritmos, tres activos y cuatro semillas) y una matriz AST de 36 búsquedas separada para el baseline nativo, totalizando 252 búsquedas.
- Baselines:
- Modelo base no entrenado.
- SFT sin etiquetas de fuerza.
- Condicionamiento basado solo en prompts (palabras de fuerza sin fundamentación conductual).
- SFT basado en comportamiento (sin oDPO).
- Mutación AST nativa (operador diseñado a mano).
- oDPO de salida de código coincidente (mismos datos de entrenamiento/objetivo, pero produciendo código GPTL en lugar de NL).
3. Contribuciones Clave
- Definición de Mutación Basada en la Ejecución: Una definición de desplazamiento de mutación basada en el desacuerdo de la secuencia de acciones realizada, junto con un operador de variación condicional sobre regímenes conductuales ordenados.
- Modelo Multitarea Basado en el Comportamiento: Un único LLM entrenado para la mutación semántica, compilación y traducción utilizando transiciones ejecutables, permitiendo al modelo aprender "qué tan lejos" mutar.
- Ablaciones Controladas: Un aislamiento sistemático del ajuste fino de dominio, el condicionamiento basado en el comportamiento, oDPO y la representación de lenguaje natural.
- Análisis Mecanicista: Un análisis de la calibración, la composición de ediciones semánticas y la localidad de la sintaxis-conducta de las mutaciones.
4. Resultados
El estudio reporta resultados a través de 252 búsquedas de presupuesto fijo (216 ejecuciones de operador aprendido y 36 ejecuciones de baseline AST nativo).
- Calibración (Control de Fuerza):
- oDPO logra una correlación media de Spearman de 0.824 entre la fuerza solicitada y el desplazamiento realizado.
- El SFT basado en el comportamiento por sí solo logra 0.310, y el condicionamiento basado solo en prompts logra 0.018.
- La oDPO transforma con éxito el orden parcial en un control de régimen consistente.
- Eficiencia de Búsqueda:
- NL oDPO supera significativamente al SFT basado en el comportamiento, a la mutación AST nativa y al modelo de control oDPO de salida de código coincidente en términos de Área Bajo la Curva (AUC) del mejor fitness de validación hasta el momento.
- El control de código coincidente (que aísla la variable de representación) muestra que la NL proporciona una ventaja de eficiencia de búsqueda de presupuesto finito sobre la mutación directa de código.
- Rendimiento en Datos No Vistos (Held-Out):
- NL oDPO descubre la política de mayor desempeño observado (Ratio de Sharpe de 2.3445).
- Mientras que el SFT basado en el comportamiento muestra el promedio y el cuartil superior de fitness de prueba más altos en agregados descriptivos, la NL oDPO demuestra un rendimiento superior en la cola superior.
- Perspectivas Mecanicistas:
- Composición Semántica: La fuerza solicitada cambia sistemáticamente el tipo de ediciones. La fuerza baja está dominada por cambios de parámetros (86.4%), mientras que la fuerza alta se desplaza hacia reescrituras estructurales, sustituciones de indicadores y giros lógicos.
- Localidad Sintaxis-Comportamiento: Las mutaciones de NL exhiben una correlación más fuerte entre la distancia sintáctica y el desplazamiento conductual (ρ=0.88) en comparación con las mutaciones AST nativas (ρ=0.44).
- Preservación de Fitness: En desplazamientos conductuales pequeños a moderados, las mutaciones de NL preservan más el fitness del padre y tienen una tasa de fallo catastrófico menor (9% frente a 14%) que las mutaciones AST nativas.
5. Significado y Reivindicaciones
El artículo afirma que el lenguaje puede servir como una representación de búsqueda direccionable y fundamentada en la ejecución sobre un espacio de programas ejecutables. Al separar la variación semántica de la ejecución determinista, ELMER aborda la incapacidad histórica de la evolución de programas para controlar la magnitud del cambio conductual.
Los autores enfatizan que el sistema mueve la evolución de programas más allá de la "perturbación sintáctica ciega" hacia un "movimiento deliberado y fundamentado en la ejecución". El hallazgo clave es que el modelo aprende no solo qué cambiar, sino qué tan lejos moverse en el espacio de comportamiento. Aunque los resultados muestran mejoras significativas en la calibración y la eficiencia de búsqueda, los autores mantienen la modestia respecto a la generalizabilidad del rendimiento de la cola superior, señalando que los patrones del bucle externo (p. ej., MAP-Elites frente a (μ,λ)-ES) son heterogéneos y que el experimento no aísla completamente el papel de la memoria de archivo en la preservación de la exploración estructurada.
El trabajo demuestra que condicionar un modelo de lenguaje mediante oDPO crea un mecanismo de control ordinal fiable, permitiendo una exploración más eficiente del espacio de programas en comparación con los operadores sintácticos tradicionales o los modelos de lenguaje sin condicionamiento.