← Nieuwste papers
🤖 AI

A time-series classification framework for individual-level absenteeism prediction under severe class imbalance

Dit artikel stelt een tijdreeksclassificatie-framework voor met een LSTM-FCN-architectuur en geoptimaliseerde verliesfuncties om werkelijk proactieve, individuele voorspelling van verzuim in sterk ongebalanceerde datasets mogelijk te maken, waarbij de beperkingen van bestaande methoden die slechts gerealiseerde uitkomsten reproduceren, worden overwonnen.

Oorspronkelijke auteurs: Kwong Ho Li, Matthew Roughan, Wathsala Karunarathne

Gepubliceerd 2026-07-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kwong Ho Li, Matthew Roughan, Wathsala Karunarathne

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de manager bent van een druk ziekenhuis of een bezorgbedrijf. Je grootste hoofdpijn? Absenteïsme. Wanneer personeel niet komt opdagen, komt alles tot stilstand. Je wilt weten voordat ze er niet zijn wie er waarschijnlijk ziek gaat melden, zodat je kunt voorbereiden.

Dit artikel gaat over het bouwen van een "glazen bol" voor de aanwezigheid van werknemers, maar met een zeer specifieke draai: het probeert de toekomst te voorspellen op basis van het verleden, in plaats van alleen te kijken naar wat er nú gebeurt.

Hier is het verhaal van hun onderzoek, uitgelegd aan de hand van eenvoudige concepten.

1. Het Probleem: Kijken in de achteruitkijkspiegel

De meeste huidige computerprogramma's voor het voorspellen van afwezigheid zijn als het rijden in een auto terwijl je alleen in de achteruitkijkspiegel kijkt. Ze nemen gegevens van "vandaag" (zoals de leeftijd van een werknemer of hoe ver ze wonen) en proberen te raden of ze vandaag afwezig zijn.

De auteurs zeggen dat dit nutteloos is voor de planning. Tegen de tijd dat je de gegevens van "vandaag" weet, heeft de werknemer al de beslissing genomen om thuis te blijven of te komen werken. Je kunt een personeelstekort dat al heeft plaatsgevonden niet meer oplossen.

De Oplossing: Ze stellen een Time Series Classification-framework voor. Denk hierbij aan het kijken door de voorruit. In plaats van te vragen: "Is Jan vandaag afwezig?", vragen ze: "Op basis van Jans aanwezigheidspatroon over de afgelopen 40 dagen, is hij waarschijnlijk de komende 5 dagen afwezig?" Dit stelt managers in staat om proactief te zijn, in plaats van reactief.

2. De Data-hindernis: Het bouwen van een "Digitale Tweeling"

Echte gegevens over de aanwezigheid van werknemers zijn privé en gevoelig (zoals medische dossiers). Je kunt ze niet zomaar van het internet downloaden.

Om dit te omzeilen, hebben de onderzoekers een gesimuleerde dataset gebouwd. Stel je voor dat ze een kleine, echte dataset van een koeriersbedrijf in Brazilië als "kiem" hebben gebruikt. Vervolgens hebben ze met wiskunde een enorme bos van 1.0- "digitale werknemers" laten groeien die statistisch gezien exact hetzelfde gedrag vertonen als de echte werknemers. Dit stelde hen in staat om hun systeem te testen zonder de privacy van iemand te schenden.

3. De "Class Imbalance" Valstrik

Hier is het lastige deel. In bijna elk bedrijf is er 97% van de tijd personeel aanwezig. Slechts ongeveer 3% van de tijd zijn ze afwezig.

In machine learning wordt dit severe class imbalance genoemd. Het is alsof je een hond probeert te leren alleen te blaffen als hij een leeuw ziet, maar je laat hem 99% van de tijd een kat zien. De hond zal dan gewoon stil blijven (voorspellen "geen leeuw") omdat hij in 99% van de gevallen gelijk heeft.

In hun geval zou een computermodel een nauwkeurigheid van 97% kunnen bereiken door simpelweg elke dag te voorspellen: "Iedereen is aanwezig". Maar dat is een ramp voor een manager die juist moet weten wie er daadwerkelijk ontbreekt. Het doel is niet alleen "nauwkeurigheid"; het is Specificiteit — het vermogen om de zeldzame dagen van "afwezigheid" correct te identificeren zonder vals alarm te slaan.

4. De Loss Function Showdown: De "Focuserende" versus de "Zelfcorrigerende"

Om de onbalans op te lossen, testten de onderzoekers twee verschillende "leraren" (wiskundige formules genaamd loss functions) om de AI te trainen.

  • Leraar A: Binary Focal Loss (BFL).

    • De Metafoor: Stel je een leraar voor die probeert zich alleen te concentreren op de leerlingen die onvoldoendes halen. Echter, deze leraar heeft een specifieke instructiehandleiding nodig (een parameter genaamd α\alpha) om te weten waar hij zich op moet richten.
    • De Ontdekking: De standaard instructiehandleiding (die de meeste mensen gebruiken) maakte het eigenlijk erger! Het vertelde de leraar om zich op de verkeerde groep te concentreren. De onderzoekers moesten de handleiding herschrijven met een specifieke formule gebaseerd op hoe zeldzaam de afwezigheden waren. Wanneer zij dat deden, werd de leraar veel beter in het herkennen van afwezige werknemers. Maar het vereiste dat de manager de exacte wiskunde vooraf kende.
  • Leraar B: Geometric Mean (G-Mean) Loss.

    • De Metafoor: Deze leraar heeft een zelfcorrigerend instinct. Als de klas begint de leerlingen die onvoldoendes halen te negeren, verschuift deze leraar automatisch de aandacht naar hen toe zonder dat er een handleiding nodig is.
    • De Ontdekking: Deze leraar presteerde net zo goed als de perfect afgestemde "Focal Loss"-leraar, maar had geen complexe wiskundige aanpassingen nodig. Het werkte gewoon automatisch.

De Winnaar: Beiden werkten goed, maar G-Mean was de "plug-and-play" kampioen omdat het niet vereiste dat de gebruiker eerst complexe balancerende getallen berekende.

5. De Beste Architectuur: De Hybride Motor

Ze testten drie verschillende "motoren" (AI-modellen) om de gegevens te verwerken:

  1. LSTM: Goed in het onthouden van lange verhalen (zoals een dagboek).
  2. CNN: Goed in het herkennen van patronen in afbeeldingen (of in dit geval patronen in de tijd).
  3. LSTM-FCN: Een hybride die beide combineert.

Het Resultaat: De Hybride (LSTM-FCN) was de duidelijke winnaar. Het was alsoals het hebben van een detective die zowel een heel dagboek kan lezen áls specifieke handschriftpatronen kan herkennen. Het behaalde een gebalanceerde nauwkeurigheid van ongeveer 80%, wat betekent dat het erg goed was in het voorspellen van afwezigheid zonder te veel valse meldingen te geven.

6. De Verfijning: Hoeveel geschiedenis hebben we nodig?

Ze testten ook hoe ver terug de AI zou moeten kijken:

  • Te kort (5 dagen): De AI vergeet de context.
  • Te lang (160 dagen): De AI raakt in de war door oude, irrelevante geschiedenis.
  • De Sweet Spot: Terugkijken naar 40 tot 80 dagen was het perfecte venster. Het gaf de AI genoeg geschiedenis om patronen te zien (zoals "Jan wordt ziek elke keer als hij een dubbele dienst werkt") zonder te verzuipen in de verre geschiedenis.

Samenvatting van de Bevindingen

  • Kijk niet in de achteruitkijkspiegel: Voorspellen van toekomstige afwezigheid op basis van eerdere sequenties is de enige manier om echt proactief te zijn.
  • De "Standaard" instellingen falen: Als je de standaardinstellingen gebruikt voor het afhandelen van zeldzame gebeurtenissen in AI, zul je afwezigheid niet goed herkennen. Je moet de wiskunde aanpassen of een zelfcorrigerende methode gebruiken.
  • Het Hybride Model wint: Het combineren van verschillende AI-technieken (LSTM-FCN) werkt het beste voor dit specifieke probleem.
  • Het Magische Venster: Terugkijken naar 40–80 dagen geeft de beste resultaten.
  • Geen toverstaf: Ze moesten met nepdata werken omdat echte data privé is, maar ze hebben bewezen dat hun methode werkt op de simulatie, die gekalibreerd is volgens de statistieken uit de echte wereld.

Kortom, dit artikel biedt een blauwdruk voor het bouwen van een systeem dat de recente aanwezigheidsgeschiedenis van een werknemer kan analyseren en kan zeggen: "Hé, op basis van het patroon is deze persoon waarschijnlijk volgende week afwezig," waardoor managers het probleem kunnen oplossen voordat het gebeurt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →