A time-series classification framework for individual-level absenteeism prediction under severe class imbalance
Cet article propose un cadre de classification de séries temporelles utilisant une architecture LSTM-FCN et des fonctions de perte optimisées afin de permettre une prédiction de l'absentéisme véritablement proactive et au niveau individuel dans des ensembles de données fortement déséquilibrés, surmontant ainsi les limites des méthodes existantes qui ne font que reproduire les résultats réalisés.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez le gestionnaire d'un hôpital très sollicité ou d'une entreprise de livraison. Votre plus gros casse-tête ? L'absentéisme. Lorsque le personnel ne se présente pas, tout s'arrête. Vous avez besoin de savoir, avant qu'ils ne soient absents, qui est susceptible de se déclarer malade, afin de pouvoir vous préparer.
Ce document traite de la création d'une « boule de cristal » pour l'assiduité des employés, mais avec une nuance très spécifique : il tente de prédire l'avenir en se basant sur le passé, plutôt que de simplement regarder ce qui se passe en ce moment.
Voici l'histoire de leur recherche, décomposée en concepts simples.
1. Le Problème : Regarder dans le rétroviseur
La plupart des programmes informatiques actuels pour prédire les absences sont comme conduire une voiture en ne regardant que dans le rétroviseur. Ils utilisent des données d'« aujourd'hui » (comme l'âge d'un employé ou sa distance de domicile) et tentent de deviner s'il est absent aujourd'hui.
Les auteurs affirment que cela est inutile pour la planification. Au moment où vous connaissez les données d'« aujourd'hui », l'employé a déjà pris la décision de rester chez lui ou de venir travailler. Vous ne pouvez pas réparer une pénurie de personnel qui s'est déjà produite.
La Solution : Ils proposent un cadre de Classification de Séries Temporelles (Time Series Classification). Voyez cela comme regarder à travers le pare-brise. Au lieu de demander : « Est-ce que Jean est absent en ce moment ? », ils demandent : « Sur la base du schéma d'assiduité de Jean au cours des 40 derniers jours, est-il susceptible d'être absent dans les 5 prochains jours ? » Cela permet aux gestionnaires d'être proactifs, et non réactifs.
2. L L'Obstacle des Données : Construire un « Jumeau Numérique »
Les dossiers réels d'assiduité des employés sont privés et sensibles (comme les dossiers médicaux). Vous ne pouvez pas simplement les télécharger sur Internet.
Pour contourner cela, les chercheurs ont construit un jeu de données simulé. Imaginez qu'ils aient pris un petit jeu de données réelles provenant d'une entreprise de coursiers au Brésil et l'aient utilisé comme « graine ». Ils ont ensuite utilisé les mathématiques pour faire croître une immense forêt de 1 000 « employés numériques » qui se comportent statistiquement exactement comme les vrais. Cela leur a permis de tester leur système sans violer la vie privée de quiconque.
3. Le Piège du « Déséquilibre des Classes »
Voici la partie délicate. Dans presque n'importe quelle entreprise, 97 % du temps, les gens viennent travailler. Seulement environ 3 % du temps, ils sont absents.
En apprentissage automatique (machine learning), c'est ce qu'on appelle un déséquilibre sévère des classes. C'est comme essayer d'apprendre à un chien à aboyer uniquement lorsqu'il voit un lion, mais que 99 % du temps, vous lui montrez un chat. Le chien apprendra simplement à rester silencieux (prédire « pas de lion ») parce qu'il a raison 99 % du temps.
Dans leur cas, un modèle informatique pourrait atteindre une précision de 97 % en prédisant simplement « Tout le monde est présent » chaque jour. Mais c'est un désastre pour un gestionnaire qui a besoin de savoir qui est réellement absent. L'objectif n'est pas seulement la « précision » ; c'est la Spécificité — la capacité à identifier correctement les rares jours d'absence sans donner de fausses alertes.
4. Le Duel des Fonctions de Perte : Le « Focalisateur » contre l'« Auto-correcteur »
Pour corriger ce déséquilibre, les chercheurs ont testé deux « enseignants » différents (des formules mathématiques appelées fonctions de perte) pour entraîner leur IA.
L'Enseignant A : La Perte Focalisée Binaire (Binary Focal Loss - BFL).
- La Métaphore : Imaginez un enseignant qui essaie de se concentrer uniquement sur les élèves qui échouent. Cependant, cet enseignant a besoin d'un manuel d'instructions spécifique (un paramètre appelé ) pour savoir sur quoi se concentrer.
- La Découverte : Le manuel d'instructions standard (utilisé par la plupart des gens) a en fait aggravé les choses ! Il disait à l'enseignant de se concentrer sur le mauvais groupe. Les chercheurs ont dû réécrire le manuel en utilisant une formule spécifique basée sur la rareté des absences. Lorsqu'ils l'ont fait, l'enseignant est devenu bien meilleur pour repérer les employés absents. Mais cela exigeait que le gestionnaire connaisse l'exactitude mathématique au préalable.
L'Enseignant B : La Perte de Moyenne Géométrique (G-Mean Loss).
- La Métaphore : Cet enseignant possède un instinct d'auto-correction. Si la classe commence à ignorer les élèves en difficulté, cet enseignant détourne automatiquement l'attention vers eux sans avoir besoin de manuel.
- La Découverte : Cet enseignant a obtenu des performances tout aussi bonnes que l'enseignant de la « Perte Focalisée » parfaitement réglé, mais il n'a pas nécessité d'ajustements mathématiques complexes. Il a simplement fonctionné automatiquement.
Le Gagnant : Les deux ont bien fonctionné, mais la G-Mean était le champion du « prêt à l'emploi » car elle ne nécessitait pas de calculer des nombres d'équilibrage complexes au préalable.
5. La Meilleure Architecture : Le Moteur Hybride
Ils ont testé trois différents « moteurs » (modèles d'IA) pour traiter les données :
- LSTM : Bon pour se souvenir de longues histoires (comme un journal intime).
- CNN : Bon pour repérer des motifs dans les images (ou, dans ce cas, des motifs dans le temps).
- LSTM-FCN : Un hybride qui combine les deux.
Le Résultat : L'Hybride (LSTM-FCN) a été le grand vainqueur. C'était comme avoir un détective capable à la fois de lire tout le journal intime et de repérer les motifs spécifiques d'écriture. Il a atteint environ 80 % de précision équilibrée, ce qui signifie qu'il était très bon pour prédire les absences sans générer trop de fausses alertes.
6. Le Réglage Fin : De combien d'historique avons-nous besoin ?
Ils ont également testé jusqu'où l'IA devait regarder en arrière :
- Trop court (5 jours) : L'IA perd le contexte.
- Trop long (160 jours) : L'IA se laisse embrouiller par un historique ancien et non pertinent.
- Le Point d'Équilibre : Regarder en arrière sur une période de 40 à 80 jours était la fenêtre parfaite. Cela donnait à l'IA suffisamment d'historique pour voir des modèles (comme « Jean tombe malade chaque fois qu'il travaille en double poste ») sans être encombrée par l'histoire ancienne.
Résumé des conclusions
- Ne regardez pas dans le rétroviseur : Prédire les absences futures en se basant sur des séquences passées est la seule façon d'être véritablement proactif.
- Les réglages « standards » échouent : Si vous utilisez les paramètres par défaut pour gérer les événements rares en IA, vous échouerez à repérer les absences. Vous devez ajuster les mathématiques ou utiliser une méthode d'auto-correction.
- Le modèle hybride l'emporte : Combiner différentes techniques d'IA (LSTM-FCN) fonctionne le mieux pour ce problème spécifique.
- La Fenêtre Magique : Regarder 40 à 80 jours en arrière offre les meilleurs résultats.
- Pas de baguette magique : Ils ont dû utiliser des données fictives car les données réelles sont privées, mais ils ont prouvé que leur méthode fonctionne sur la simulation, laquelle est calibrée selon des statistiques du monde réel.
En bref, ce document fournit un plan pour construire un système capable d'analyser l'historique récent d'assiduité d'un employé et de dire : « Hé, d'après le schéma, cette personne est susceptible d'être absente la semaine prochaine », permettant ainsi aux gestionnaires de résoudre le problème avant qu'il ne survienne.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.