← Nieuwste papers
📊 statistics

Doubly robust estimation with functional outcomes missing at random

Dit artikel presenteert en analyseert semi-parametrische, dubbel robuuste schatters voor het gemiddelde van functionele uitkomsten met ontbrekende waarden, waarbij de auteurs de asymptotische verdeling en gelijktijdige betrouwbaarheidsbanden vaststellen en de methode valideren via simulaties en een toepassing op contrafactuele uitkomsten.

Oorspronkelijke auteurs: Xijia Liu, Kreske Felix Ecker, Lina Schelin, Xavier de Luna

Gepubliceerd 2026-02-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xijia Liu, Kreske Felix Ecker, Lina Schelin, Xavier de Luna

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De Ontbrekende Puzzelstukken

Stel je voor dat je een enorme puzzel hebt van de levensverdienende trajecten van mensen. Je wilt weten hoe het gemiddelde inkomen eruitziet voor een hele groep mensen, van hun 21e tot hun 63e. Dit is geen enkel getal, maar een lijn die door de tijd loopt (een "functioneel resultaat").

Het probleem is: niet iedereen heeft een complete puzzel. Sommige mensen zijn uit de studie gestapt, anderen hebben hun gegevens niet ingevuld. Je hebt dus een gat in je plaatje. Als je simpelweg alleen de mensen telt die wel een volledig plaatje hebben, krijg je een verkeerd beeld. Misschien zijn de mensen die wegbleven juist degenen met een heel ander inkomen. Dat is als proberen het gemiddelde gewicht van een team te bepalen door alleen de zwaarste spelers te wegen, en de lichtste te negeren.

De Oplossing: Twee Slimme Methoden

De auteurs van dit papier (Xijia Liu en collega's) hebben twee slimme manieren bedacht om die ontbrekende stukken te schatten, zelfs als je niet precies weet waarom ze ontbreken. Ze gaan ervan uit dat de reden dat iemand wegvalt, alleen te maken heeft met wat je wel weet over die persoon (bijvoorbeeld: hun geslacht, opleiding of waar ze wonen). Dit noemen ze "willekeurig ontbrekend" (Missing At Random).

Ze gebruiken twee methoden:

1. De "Voorspeller" (Outcome Regression)

Stel je voor dat je een leraar bent die de cijfers van een klas moet voorspellen. Je kijkt naar de leerlingen die hun cijfers wel hebben ingevuld. Je ziet een patroon: "Leerlingen met een hoge opleiding en veel ervaring verdienen vaak meer."
Deze methode bouwt een model op basis van die bekende patronen en gebruikt het om de ontbrekende cijfers in te vullen.

  • Het risico: Als je verkeerde aannames maakt over hoe de cijfers samenhangen met de opleiding, is je hele voorspelling fout.

2. De "Dubbel Robuuste" Methode (Doubly Robust)

Dit is de ster van het verhaal. Het is als een auto met twee remmen.
Stel je voor dat je een auto moet stoppen. Je hebt twee systemen:

  1. Een rem die werkt op basis van de snelheid (het model voor de cijfers).
  2. Een rem die werkt op basis van de afstand tot de muur (het model voor de kans dat iemand wegvalt).

De "Dubbel Robuuste" methode combineert deze twee. Het slimme is: Je hebt maar één van de twee systemen nodig dat goed werkt om de auto veilig te stoppen.

  • Als je model voor de cijfers fout is, maar je model voor de kans op wegval is goed -> Je bent veilig.
  • Als je model voor de kans op wegval fout is, maar je cijfermodel is goed -> Je bent ook veilig.
  • Pas als beide systemen fout zijn, mislukt het.

In de statistiek betekent dit dat je schatting van het gemiddelde inkomen betrouwbaar blijft, zelfs als je één van je twee aannames over de data niet helemaal goed hebt.

Waarom is dit zo speciaal? (De "Gauwse" Wolk)

Meestal kijken statistici naar één enkel getal (bijvoorbeeld: "Het gemiddelde inkomen is €30.000"). Maar hier kijken ze naar een hele lijn (het inkomen per jaar).

De auteurs bewijzen wiskundig dat hun methode werkt als een wolk van waarschijnlijkheid die over die lijn zweeft. Ze kunnen niet alleen zeggen "hier is de lijn", maar ze kunnen ook een veiligheidsband (een schaduw) om die lijn te tekenen.

  • Zie je die schaduw? Die betekent: "We zijn 95% zeker dat de echte lijn ergens binnen die schaduw zit."
  • En het mooiste: deze zekerheid geldt voor de hele lijn tegelijk, niet alleen op één punt.

De Proef in de Praktijk

Ze hebben dit getest in een computer-simulatie (een Monte Carlo studie). Ze hebben duizenden "valse" datasets gegenereerd, waarbij ze soms expres fouten maakten in hun modellen.

  • Resultaat: Zelfs als ze fouten maakten, hield de "Dubbel Robuuste" methode het hoofd boven water. De veiligheidsbanden bleven waarheidsgetrouw.
  • Vergelijking: De oude methode (alleen kijken naar de mensen die wel antwoord gaven) gaf vaak een scheef beeld, net als iemand die alleen kijkt naar de rijkste mensen in een stad om het gemiddelde inkomen te bepalen.

Het Reële Voorbeeld: Zweedse Loonlijnen

Om te laten zien dat het werkt, hebben ze echte data gebruikt van mensen geboren in Zweden in 1954.

  • De vraag: "Wat zou het gemiddelde levensinkomen zijn geweest als iedereen in 1974 in een grote stad had gewerkt?"
  • Het probleem: We weten het inkomen alleen van degenen die daar daadwerkelijk woonden. Voor degenen die in kleine dorpen woonden, is dat een "tegenwereld" (counterfactual) dat we niet zien.
  • De uitkomst: Met hun nieuwe methode konden ze deze tegenwereld reconstructeren. Ze zagen dat de "naieve" methode (alleen kijken naar de stadsbewoners) de inkomens in de jonge jaren te hoog inschatte en later te laag. De nieuwe methode gaf een eerlijker beeld.

Conclusie in één zin

Dit papier biedt een nieuwe, dubbel-zekere manier om het gemiddelde verloop van iets (zoals inkomen) te berekenen, zelfs als veel data ontbreekt, en geeft je tegelijkertijd een betrouwbaar "veiligheidsnet" om te zien hoe nauwkeurig die schatting is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →