← Últimos artículos
🤖 machine learning

A Comparative Study of Model Selection Criteria for Symbolic Regression

Este artículo presenta una comparación empírica sistemática de los criterios de selección de modelos para la regresión simbólica en siete conjuntos de datos sintéticos, revelando que la Longitud Mínima de Descripción (MDL) y el Criterio de Información Bayesiano (BIC) son los métodos más efectivos para identificar expresiones de verdad fundamental y minimizar el error de prueba.

Autores originales: Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio

Publicado 2026-05-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ali Soltani, Gabriel Kronberger, Fabricio Olivetti de Franca, Mattia Billa, Alessandro Lucantonio

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un misterio. Tienes un montón de pistas (datos) que están un poco desordenadas y ruidosas; quizás algunas huellas están embarradas, o algunas declaraciones de testigos tienen algunos errores tipográficos. Tu objetivo es reconstruir la secuencia exacta de eventos (la "verdad fundamental") que ocurrió.

En el mundo de la informática, esto se llama Regresión Simbólica. En lugar de huellas, la computadora busca una fórmula matemática que explique los datos. La computadora genera miles de fórmulas posibles, que van desde las simples como "y = x + 1" hasta enredos increíblemente complejos que parecen un plato de espaguetis.

¿El problema? La computadora es muy buena memorizando las pistas desordenadas. Podría crear una fórmula que se ajuste a las huellas embarradas perfectamente, pero si le mostraras un nuevo conjunto de huellas, esa fórmula fallaría miserablemente. Esto se llama sobreajuste. Es como un estudiante que memoriza las respuestas de un examen de práctica pero reprueba el examen real porque no entendió los conceptos.

Entonces, ¿cómo eliges la mejor fórmula de entre las miles que hizo la computadora? Necesitas un "Criterio de Selección de Modelo": un reglamento o un juez para decidir qué fórmula es la ganadora.

Los Competidores

Los autores de este artículo organizaron una competencia para ver qué "juez" funciona mejor. Crearon siete escenarios de misterio diferentes (conjuntos de datos sintéticos) con respuestas conocidas y les añadieron algo de ruido. Luego, pidieron a la computadora que generara un montón de fórmulas candidatas, incluidas algunas que estaban intencionalmente sobrecomplicadas (sobreajustadas).

Probaron cinco jueces diferentes (criterios) para ver cuál podía elegir la fórmula correcta y simple del montón de las desordenadas:

  1. MSE (Error de Entrenamiento): Este juez solo mira qué tan bien se ajusta la fórmula a las pistas desordenadas actuales. Es como un estudiante que solo estudia el examen de práctica. Tiende a elegir las fórmulas más complicadas y sobreajustadas.
  2. AIC (Criterio de Información de Akaike): Un juez clásico que intenta equilibrar la precisión con la simplicidad. Otorga una pequeña "penalización" por cada pieza extra en la fórmula.
  3. AICc: Una versión corregida del AIC, diseñada para ser un poco más estricta cuando no hay muchos datos.
  4. BIC (Criterio de Información Bayesiano): Un juez más estricto que el AIC. Penaliza la complejidad con mayor severidad, especialmente a medida que crece la cantidad de datos. Realmente odia las partes innecesarias.
  5. MDL (Longitud Mínima de Descripción): Este juez utiliza una metáfora ingeniosa: "¿Cuál es la forma más corta de enviar un mensaje que describa tanto la fórmula como los datos?". Si una fórmula es demasiado compleja, el mensaje se vuelve demasiado largo. MDL busca la "compresión" más eficiente de la verdad.
  6. Errin (Estimación de Bootstrap): Este es el juez computacionalmente más costoso. Simula el experimento cientos de veces añadiendo ruido aleatorio a los datos para ver cuánto oscila la fórmula. Es como ejecutar el experimento en un universo paralelo 200 veces para estar seguro.

Los Resultados

El artículo puso a estos jueces a competir entre sí y encontró algunos ganadores y perdedores claros:

  • El Perdedor: El simple "Error de Entrenamiento" (MSE) fue terrible. Consistentemente eligió las fórmulas más complejas y sobreajustadas que fallaron al generalizar.
  • Los Pesados: MDL y BIC fueron los campeones.
    • MDL fue el más consistente. Casi siempre encontró las fórmulas más simples y precisas. Fue el mejor ignorando el "ruido" y encontrando la señal verdadera.
    • BIC fue un segundo lugar muy cercano, también haciendo un gran trabajo al encontrar las fórmulas correctas y simples.
  • El Terreno Medio: AIC y AICc lo hicieron bien, pero fueron un poco más indulgentes con la complejidad que MDL y BIC.
  • El Sobreesforzado (que se cansó): Errin fue interesante. A veces lo hizo genial, pero a menudo eligió fórmulas que eran demasiado grandes y complicadas. Además, fue increíblemente lento; como un juez que tarda una semana en decidir un caso que podría resolverse en un minuto.

La Gran Conclusión

Si estás construyendo un sistema para encontrar fórmulas matemáticas a partir de datos, no elijas simplemente la que mejor se ajusta a tus datos actuales. Eso es una trampa.

En su lugar, usa MDL (Longitud Mínima de Descripción) como tu opción predeterminada. Es como tener un editor sabio que elimina todo el relleno y te deja con la historia más concisa y precisa. Si MDL te parece demasiado estricto para tu problema específico, BIC es una excelente reserva.

El artículo concluye que, aunque ningún juez es perfecto para cada escenario individual, MDL y BIC son las herramientas más confiables para encontrar fórmulas que no solo sean precisas, sino también lo suficientemente simples para ser comprendidas y útiles en el mundo real. Logran el mejor equilibrio entre "ajustarse a los datos" y "no memorizar el ruido".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →