← Últimos artículos
📊 statistics

Model selection with proper scoring rules on data sets of time series

Este artículo investiga cómo la asimetría en la distribución de las puntuaciones provoca resultados de selección de modelos conflictivos entre las estadísticas basadas en la media, la mediana y el rango en datos de series temporales, demostrando que, si bien estos criterios convergen con conjuntos de prueba grandes, la puntuación media es excepcionalmente fiable para identificar el modelo verdadero en conjuntos de prueba cortos, como lo evidencia el análisis de series temporales intermitentes incluyendo la competición M5.

Autores originales: Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

Publicado 2026-06-24
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un entrenador tratando de elegir al mejor jugador para tu equipo. Tienes una lista enorme de jugadores (series temporales) y quieres ver quién tiene el mejor desempeño en promedio. Para juzgarlos, utilizas una "tarjeta de puntuación" (una regla de puntuación adecuada) que te otorga un número de penalización por cada error que cometen. Cuanto menor sea el número, mejor es el jugador.

Este artículo trata sobre cómo leer esa tarjeta de puntuación cuando tienes muchos jugadores y muchos juegos que observar. Los autores descubrieron que la forma en que solemos contabilizar las puntuaciones puede, a veces, engañarnos para que elijamos al jugador equivocado, especialmente cuando los juegos son cortos o los errores son raros pero enormes.

Aquí está el desglose utilizando analogías sencillas:

1. El Problema: Dos Formas de Contar

Cuando tienes un equipo de jugadores, no puedes simplemente mirar un solo juego. Tienes que combinar sus resultados. El artículo dice que hay dos formas principales en las que los entrenadores suelen hacer esto:

  • Método A: El "Promedio de Penalización" (Puntuación Escalada Media). Tomas cada punto de penalización que un jugador recibió, los sumas todos y los divides por el número de juegos. Esto te dice el costo promedio de sus errores.
  • Método B: El "Récord de Victorias y Derrotas" (Rango Medio). No miras los puntos. En su lugar, simplemente preguntas: "¿En cuántos juegos el Jugador A venció al Jugador B?". Cuentas las victorias. Si el Jugador A ganó más juegos, obtiene el primer lugar.

2. La Trampa: El Sesgo del "Gran Error"

La Analogía:
Imagina un juego donde usualmente cometes errores pequeños (como tropezar con tus propios cordones) pero, ocasionalmente, cometes un error masivo y catastrófico (como caerse de un acantilado).

  • El "Promedio de Penalización" (Método A) ve la caída del acantilado. Suma todos los pequeños tropiezos y la gran caída, dándote un promedio de penalización alto. Sabe que eres peligroso.
  • El "Récord de Victorias y Derrotas" (Método B) mira los juegos individualmente. En 99 de 100 juegos, solo tropezaste con tus cordones, lo cual es una penalización diminuta. En el otro juego, te caíste de un acantilado.
    • Si estás jugando contra un rival que nunca se cae de un acantilado pero tropieza ligeramente más a menudo, el Método B podría decir: "¡Oye, ganaste 99 juegos! ¡Eres el campeón!".
    • Pero el Método A dice: "Espera, esa única caída del acantilado te costó toda la temporada. Tu promedio de penalización es en realidad peor".

El artículo argumenta que el Método B (Rango Medio) es peligroso porque ignora el tamaño de los errores. Solo le importa quién ganó la mayoría de las rondas individuales. Si las "caídas del acantilado" (errores enormes) son raras, el Método B a menudo las pasa por alto, especialmente si no has visto suficientes juegos (conjuntos de prueba cortos).

3. La Solución: Ver Más Juegos

Los autores realizaron simulaciones para ver qué sucede cuando observas más juegos (aumentar el tamaño del conjunto de prueba).

  • Conjuntos de Prueba Cortos (Pocos Juegos): El Método B es poco confiable. A menudo elige al jugador "afortunado" que evita los grandes errores simplemente por azar, incluso si su desempeño promedio es peor.
  • Conjuntos de Prueba Largos (Muchos Juegos): A medida que observas más y más juegos, las "caídas del acantilado" eventualmente ocurren lo suficiente como para que el Método B empiece a ver la verdad. Los dos métodos empiezan a coincidir.

El Hallazgo Clave: Si solo tienes un historial corto de datos (un conjunto de prueba corto), el Método A (Promedio de Penalización) es el único que elige consistentemente al mejor modelo. El Método B es demasiado fácil de engañar con la "suerte" de evitar errores enormes y raros.

4. La Prueba del Mundo Real: La Competencia M5

Los autores probaron esto con datos reales de la famosa "Competencia de Pronóstico M5", que consiste en predecir ventas para miles de productos (algunos de los cuales son "intermitentes", lo que significa que se venden muy rara vez).

Compararon dos modelos matemáticos:

  1. El Modelo de Poisson: Un modelo más simple.
  2. El Modelo de Binomial Negativa: Un modelo más complejo conocido por ser mejor manejando los "picos" de demanda.

¿Qué pasó?

  • Cuando usaron el Método B (Rango Medio) en datos cortos, a menudo eligieron el modelo Poisson. Pensaron que el modelo más simple era mejor porque "ganó" más rondas individuales.
  • Cuando usaron el Método A (Promedio de Penalización), eligieron consistentemente el modelo Binomial Negativa, identificando correctamente que es el que maneja mejor los grandes picos.

Los autores concluyeron que el "Promedio de Penalización" era el correcto. El "Récord de Victorias y Derrotas" fue engañado porque los conjuntos de prueba eran demasiado cortos para capturar los errores masivos y raros que el modelo más simple no pudo predecir.

5. ¿Importa Cómo Medimos la Penalización?

El artículo también verificó si cambiar la "regla" (factor de escala) utilizada para medir las penalizaciones cambiaba los resultados.

  • Buenas Noticias: El método del "Promedio de Penalización" es muy robusto. Ya sea que midas la penalización en dólares, en porcentajes o contra una línea base, casi siempre elige al mismo ganador.
  • Malas Noticias: El método del "Récodo de Victorias y Derrotas" es frágil. Puede cambiar de opinión dependiendo de cómo midas las cosas y de cuántos datos tengas.

La Conclusión Final

Si estás tratando de elegir el mejor modelo de pronóstico:

  1. No te limites a contar victorias. (No dependas únicamente del Rango Medio).
  2. Observa el costo promedio de los errores. (Usa la Puntuación Escalada Media).
  3. Ten cuidado con los datos cortos. Si no tienes suficiente historial, el método de "Victorias y Derrotas" probablemente te engañará para que elijas un modelo que se ve bien en el papel, pero que falla cuando ocurre un evento raro y grande.

El artículo esencialmente dice: "No dejes que un jugador que tuvo la suerte de evitar un gran desastre te engañe para que pienses que es el mejor jugador. Mira su desempeño promedio total".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →