← Últimos artículos
🤖 machine learning

InsightSR: Refining Symbolic Regression Search Spaces via Parallel Semantic and Structural LLM Guidance

InsightSR es un novedoso marco de regresión simbólica que mejora el motor de programación genética PySR mediante el aprovechamiento de Modelos de Lenguaje de Gran Escala para refinar iterativamente el espacio de búsqueda a través de guía semántica y estructural, logrando una precisión y generalización de vanguardia al transformar la construcción de árboles de expresiones profundos en el ensamblaje de árboles superficiales sobre características semánticamente informadas.

Autores originales: Yating Ling, Wenjing Cun, Zhitang Chen

Publicado 2026-08-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yating Ling, Wenjing Cun, Zhitang Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La ciencia siempre ha dependido de una idea simple y poderosa: que el complejo comportamiento del mundo natural puede describirse mediante leyes matemáticas concisas. Cuando un físico observa una manzana cayendo o una órbita planetaria, no solo ve movimiento; está buscando la ecuación oculta que lo gobierna. Esta búsqueda de la fórmula subyacente se llama regresión simbólica. A diferencia de los modelos informáticos estándar que aprenden patrones ajustando millones de perillas internas para adaptarse a los datos, la regresión simbólica intenta escribir la ecuación real misma, utilizando bloques de construcción matemáticos familiares como la suma, la multiplicación y las funciones trigonométricas. El objetivo es encontrar una regla que no solo sea precisa, sino también lo suficientemente simple como para que un humano pueda leerla y entenderla. Sin embargo, encontrar estas reglas es increíblemente difícil. El número de posibles combinaciones matemáticas crece tan rápido que se convierte en un océano de posibilidades vasto y caótico. La mayoría de las búsquedas computacionales se pierden en este océano, produciendo fórmulas que se ajustan perfectamente a los datos pero que no tienen sentido físico, o simplemente fallan al encontrar la verdadera ley porque el espacio de búsqueda es demasiado grande para explorarlo por completo.

Un equipo de investigadores ha desarrollado un nuevo enfoque para navegar este caos, combinando el poder de búsqueda bruta de los algoritmos evolutivos con la capacidad de razonamiento de los modelos de lenguaje extensos. Su sistema, llamado InsightSR, no pide al ordenador que adivine la respuesta final directamente. En su lugar, utiliza el modelo de lenguaje como un guía para remodelar la búsqueda misma. Imagine a un equipo de exploradores tratando de encontrar un camino específico a través de un bosque denso y desconocido. En el método antiguo, los exploradores vagarían aleatoriamente, esperando tropezar con el sendero correcto. En este nuevo método, el modelo de lenguaje actúa como un guía experimentado que conoce el terreno general. No camina el camino por ellos, pero les indica qué direcciones son físicamente imposibles de tomar y sugiere qué herramientas podrían ser útiles para el viaje.

El sistema funciona dividiendo la guía en dos corrientes complementarias. La primera corriente se centra en el "esqueleto" de la ecuación. El modelo de lenguaje observa las unidades físicas de los datos —como si una variable representa tiempo, distancia o masa— y propone estructuras básicas que deben ser dimensionalmente consistentes. Esto significa que descarta cualquier combinación matemática que violaría las leyes de la física, como sumar una medida de tiempo a una de distancia. Al sembrar la búsqueda con estos puntos de partida físicamente plausibles, el sistema evita perder tiempo en miles de millones de fórmulas imposibles. La segunda corriente se centra en los ingredientes mismos. El modelo de lenguaje sugiere nuevas formas de transformar los datos brutos, como elevar una variable al cuadrado o calcular su seno, basándose en patrones que ha visto en intentos previos. Estos nuevos rasgos se añaden al conjunto de ingredientes disponibles para el motor de búsqueda. Con el tiempo, el conjunto de ingredientes se vuelve más rico, permitiendo al sistema construir relaciones complejas mediante combinaciones simples y poco profundas en lugar de intentar construir árboles profundos y enredados de datos brutos.

Este proceso no es un simple intento de una sola vez, sino un ciclo continuo de refinamiento. Después de que el ordenador genera un conjunto de ecuaciones candidatas, el modelo de lenguaje las evalúa. Comprueba no solo qué tan bien se ajustan a los números, sino también qué tan útiles fueron los nuevos rasgos y si la estructura tiene sentido. Esta retroalimentación se almacena en una base de conocimientos dinámica que informa la siguiente ronda de búsqueda. El sistema aprende de sus propios éxitos y fracasos, estrechando gradualmente la búsqueda hacia las soluciones más prometedoras. Esto crea un ciclo de autocorrección donde la búsqueda se vuelve más enfocada y eficiente con cada iteración.

Los investigadores probaron este método en tres conjuntos distintos de desafíos. Primero, utilizaron un banco de pruebas de 100 famosas ecuaciones de la física, que van desde la mecánica clásica hasta la teoría cuántica. En esta prueba, el sistema recuperó con éxito la fórmula original exacta el 95% de las veces, lo que representa una mejora significativa respecto a los métodos anteriores. También funcionó excepcionalmente bien en un conjunto más amplio de problemas científicos que abarcan la química, la biología y la ciencia de materiales, logrando una precisión de más del 80% en tareas que involucran transformaciones complejas. Finalmente, el equipo probó el sistema con datos del mundo real, como las vibraciones de un oscilador y los patrones de crecimiento de las bacterias. En estos escenarios, el sistema no solo encontró fórmulas precisas, sino que también mantuvo su rendimiento cuando fue probado con datos que nunca había visto, demostrando una fuerte capacidad de generalización.

Los resultados sugieren que, al incrustar un modelo de lenguaje como una capa de guía alrededor de un motor de búsqueda tradicional, es posible superar los desafíos duales del vasto espacio de búsqueda y la necesidad de consistencia física. El sistema no reemplaza la búsqueda evolutiva; la refina, convirtiendo una exploración ciega y aleatoria en un descubrimiento deliberado y guiado. Al desplazar la carga de construir árboles profundos y complejos de variables brutas hacia el ensamblaje de combinaciones simples a partir de un conjunto de rasgos enriquecido, el método hace que el descubrimiento de leyes científicas sea más eficiente y confiable. Este enfoque ofrece un camino práctico hacia el descubrimiento científico automatizado, mostrando que la combinación del razonamiento similar al humano y la búsqueda basada en máquinas puede revelar las leyes matemáticas ocultas que gobiernan nuestro mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →