← Derniers articles
📊 statistics

Model selection with proper scoring rules on data sets of time series

Cet article étudie comment l'asymétrie de la distribution des scores provoque des résultats de sélection de modèle divergents entre les statistiques basées sur la moyenne, la médiane et le rang sur des données de séries temporelles, démontrant que si ces critères convergent avec de grands ensembles de test, le score de la moyenne est l'unique critère fiable pour identifier le vrai modèle sur de courts ensembles de test, comme en témoigne l'analyse de séries temporelles intermittentes incluant la compétition M5.

Auteurs originaux : Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

Publié 2026-06-24
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Giorgio Corani, Stefano Damato, Dario Azzimonti, Lorenzo Zambon

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un entraîneur essayant de choisir le meilleur joueur pour votre équipe. Vous avez un immense effectif de joueurs (séries temporelles), et vous voulez voir qui est le plus performant en moyenne. Pour les juger, vous utilisez une « fiche de score » (une règle de score appropriée) qui attribue un nombre de pénalité pour chaque erreur commise. Plus ce nombre est bas, meilleur est le joueur.

Ce document traite de la manière de lire cette fiche de score lorsque vous avez beaucoup de joueurs et beaucoup de matchs à analyser. Les auteurs ont découvert que la façon dont nous comptabilisons habituellement les scores peut parfois nous tromper en nous faisant choisir le mauvais joueur, surtout quand les matchs sont courts ou que les erreurs sont rares mais massives.

Voici la décomposition utilisant des analogies simples :

1. Le Problème : Deux façons de compter

Lorsque vous avez une équipe de joueurs, vous ne pouvez pas simplement regarder un seul match. Vous devez combiner leurs résultats. Le document indique qu'il existe deux manières principales de faire cela, que les entraîneurs utilisent habituellement :

  • Méthode A : La « Pénalité Moyenne » (Score Échelle Moyenne / Mean Scaled Score). Vous prenez chaque point de pénalité reçu par un joueur, vous les additionnez tous, et vous divisez par le nombre de matchs. Cela vous donne le coût moyen de leurs erreurs.
  • Méthode B : Le « Dossier Victoires-Défaites » (Rang Moyen / Mean Rank). Vous ne regardez pas les points. Au lieu de cela, vous demandez simplement : « Dans combien de matchs le Joueur A a-t-il battu le Joueur B ? » Vous comptez les victoires. Si le Joueur A a gagné plus de matchs, il obtient la première place.

2. Le Piège : Le biais de la « Grosse Erreur »

Les auteurs ont découvert que pour certains types de prédictions (comme la prédiction d'événements rares ou de valeurs élevées), la « fiche de score » est biaisée.

L'analogie :
Imaginez un jeu où vous faites habituellement de petites erreurs (comme trébucher sur vos lacets), mais occasionnellement, vous faites une erreur massive et catastrophique (comme tomber d'une falaise).

  • La « Pénalité Moyenne » (Méthode A) voit la chute de la falaise. Elle additionne tous les petits trébuchements et la grande chute, donnant une pénalité moyenne élevée. Elle sait que vous êtes dangereux.
  • Le « Dossier Victoires-Défaites » (Méthode B) regarde les matchs individuellement. Sur 100 matchs, dans 99 d'entre eux, vous avez seulement trébuché sur vos lacets, ce qui est une pénalité infime. Dans l'autre match, vous êtes tombé d'une falaise.
    • Si vous jouez contre un rival qui ne tombe jamais de la falaise mais qui trébuche légèrement plus souvent, la Méthode B pourrait dire : « Hé, vous avez gagné 99 matchs ! Vous êtes le champion ! »
    • Mais la Méthode A dit : « Attendez, cette seule chute de falaise vous a coûté toute la saison. Votre pénalité moyenne est en fait bien pire. »

Le document soutient que la Méthode B (Rang Moyen) est dangereuse car elle ignore la taille des erreurs. Elle ne s'intéresse qu'à savoir qui a gagné le plus de manches individuelles. Si les « chutes de falaise » (erreurs énormes) sont rares, la Méthode B passe souvent à côté, surtout si vous n'avez pas regardé assez de matchs (jeux de test courts).

3. La Solution : Regarder plus de matchs

Les auteurs ont réalisé des simulations pour voir ce qui se passe lorsque vous regardez plus de matchs (augmentation de la taille de l'ensemble de test).

  • Jeux de test courts (Peu de matchs) : La Méthode B est peu fiable. Elle choisit souvent le joueur « chanceux » qui évite les grosses erreurs par pur hasard, même si sa performance moyenne est moins bonne.
  • Jeux de test longs (Beaucoup de matchs) : À mesure que vous regardez de plus en plus de matchs, les « chutes de falaise » finissent par se produire suffisamment de fois pour que la Méthode B commence à voir la vérité. Les deux méthodes finissent par se rejoindre.

La conclusion clé : Si vous n'avez qu'un historique de données court (un ensemble de test court), la Méthode A (Pénalité Moyenne) est la seule qui choisit systématiquement le meilleur modèle. La Méthode B est trop facilement trompée par la « chance » d'éviter des erreurs énormes et rares.

4. Le Test en conditions réelles : La compétition M5

Les auteurs ont testé cela sur des données réelles de la célèbre « Compétition de Prévision M5 », qui consiste à prédire les ventes pour des milliers de produits (dont certains sont « intermittents », c'est-à-dire qu'ils se vendent très rarement).

Ils ont comparé deux modèles mathématiques :

  1. Le Modèle de Poisson : Un modèle plus simple.
  2. Le Modèle Binomial Négatif : Un modèle plus complexe, connu pour être meilleur pour gérer les « pics » de demande.

Qu'est-ce qui s'est passé ?

  • En utilisant la Méthode B (Rang Moyen) sur des données courtes, elle a souvent choisi le modèle Poisson. Elle a pensé que le modèle plus simple était meilleur parce qu'il « gagnait » plus de manches individuelles.
  • En utilisant la Méthode A (Pénalité Moyenne), elle a systématiquement choisi le modèle Binomial Négatif, identifiant correctement celui qui gère mieux les gros pics.

Les auteurs ont conclu que la « Pénalité Moyenne » était la bonne. La méthode du « Dossier Victoires-Défaites » a été trompée car les ensembles de test étaient trop courts pour capturer les erreurs massives et rares que le modèle plus simple ne parvenait pas à prédire.

5. Est-ce que la façon de mesurer la pénalité importe ?

Le document a également vérifié si le changement de « règle » (facteur d'échelle) utilisé pour mesurer les pénalités changeait les résultats.

  • Bonne nouvelle : La méthode de la « Pénalité Moyenne » est très robuste. Que vous mesuriez la pénalité en dollars, en pourcentage ou par rapport à une référence, elle choisit presque toujours le même vainqueur.
  • Mauvaise nouvelle : La méthode du « Dossier Victoires-Défaites » est fragile. Elle peut changer de résultat selon la façon dont vous mesurez les choses et la quantité de données dont vous disposez.

L'essentiel à retenir

Si vous essayez de choisir le meilleur modèle de prévision :

  1. Ne vous contentez pas de compter les victoires. (Ne vous reposez pas uniquement sur le Rang Moyen).
  2. Regardez le coût moyen des erreurs. (Utilisez le Score Échelle Moyenne).
  3. Soyez prudent avec les données courtes. Si vous n'avez pas assez d'historique, la méthode « Victoires-Défaites » vous trompera probablement en vous faisant choisir un modèle qui semble bon sur le papier, mais qui échouera lorsqu'un événement rare et majeur surviendra.

Le document dit essentiellement : « Ne laissez pas un joueur qui a eu de la chance en évitant un seul grand désastre vous faire croire qu'il est le meilleur joueur. Regardez sa performance moyenne totale. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →