A formal approach to variable selection in difference-in-differences
Dieser Artikel schlägt ein formales, graphbasiertes Rahmenwerk zur Auswahl von Kovariaten vor, um bedingte parallele Trends in der Differenz-von-Differenzen-Analyse zu erfüllen, und argumentiert, dass Identifikationsprobleme häufiger auf eine Diskrepanz zwischen den für die Validität erforderlichen Adjustierungsmengen und den von gängigen Schätzern verwendeten Mengen zurückzuführen sind als auf die Schätzer selbst.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen herauszufinden, ob ein neues, teures Vitamin Menschen tatsächlich beim Wachsen hilft. Sie haben zwei Gruppen: Eine Gruppe nimmt das Vitamin ein (die „Behandelten"), die andere nicht (die „Kontrollgruppe").
Der klassische Weg, dies zu testen, ist die Differenz-von-Differenzen-Methode (DiD). Es ist wie beim Betrachten eines Rennens. Sie prüfen, wie groß alle zu Rennbeginn waren (vor dem Vitamin). Dann prüfen Sie, wie groß sie am Ziel sind (nach dem Vitamin). Die Logik lautet: Wenn die Nicht-Vitamin-Gruppe weiter mit derselben Geschwindigkeit gewachsen wäre, wie zuvor, können wir annehmen, dass die Vitamin-Gruppe dasselbe getan hätte, wenn sie das Vitamin nicht eingenommen hätte. Der Unterschied zwischen dem, was tatsächlich passiert ist, und dem, was „passiert wäre", ist die Wirkung des Vitamins.
Dies funktioniert jedoch nur, wenn beide Gruppen von Anfang an auf dem gleichen Streckenabschnitt liefen. Wenn die Vitamin-Gruppe bereits von Natur aus größer war oder bessere Schuhe hatte, ist das Rennen nicht fair. Dies ist die Annahme der „Parallelen Trends".
Dieser Artikel ist wie ein Regelbuch für Schiedsrichter, das erklärt, wie man sicherstellt, dass das Rennen tatsächlich fair ist. Hier ist die Aufschlüsselung ihrer neuen Regeln, einfach erklärt:
1. Das „Küchenspülbecken"-Problem
In der Vergangenheit warfen Forscher oft einfach jedes einzelne Datenstück, das sie hatten (Größe, Gewicht, Schuhgröße, Lieblingsfarbe), ohne nachzudenken, warum, in den Mix. Sie nannten dies den „Küchenspülbecken"-Ansatz.
- Die Lösung des Artikels: Man kann nicht einfach alles hineinwerfen. Man benötigt eine Karte (ein „kausales Diagramm"), um zu sehen, welche Variablen tatsächlich relevant sind. Manche Variablen mögen wichtig aussehen, aber das Rennen tatsächlich durcheinanderbringen.
2. Der Mythos der „Perfekten Balance"
Die alte Denkweise ging davon aus, dass sich die Wachstumstrends der Gruppen, wenn man sie nur als Ganzes betrachtet, von selbst perfekt ausgleichen würden.
- Die Lösung des Artikels: Das ist wie die Hoffnung, dass zwei verschiedene Autos genau die gleiche Geschwindigkeit fahren werden, nur weil sie beide Autos sind. Es ist eine sehr starke, unrealistische Annahme. Der Artikel zeigt, dass die Gruppen oft nicht ausgeglichen sind, es sei denn, man berücksichtigt spezifische Unterschiede (wie Motorengröße oder Reifendruck).
- Die Falle: Manchmal, wenn man versucht, sie auszugleichen, indem man zu viele Variablen hinzufügt, kann man versehentlich die perfekte Balance zerstören, die bereits vorhanden war, und das Ergebnis schlechter statt besser machen.
3. Die „langweilige" Variable
Normalerweise ignorieren Forscher Variablen, die sich über die Zeit nicht ändern (wie das Geschlecht einer Person oder ihre Geburtsstadt), weil sie denken: „Nun, das ändert sich nicht, also kann es nicht der Grund sein, warum das Vitamin gewirkt hat."
- Die Lösung des Artikels: Manchmal sind diese „langweiligen" Variablen tatsächlich die geheime Zutat! Selbst wenn sich eine Variable nicht ändert, könnte sie der Grund dafür sein, dass die beiden Gruppen von Anfang an unterschiedlich waren. Eine Anpassung daran kann die Studie retten. Es ist wie die Erkenntnis, dass, obwohl die Autos ihre Farbe nicht geändert haben, die Farbe tatsächlich bestimmt hat, auf welcher Strecke sie gefahren sind.
4. Die „nachträgliche" Variable
Die Standardempfehlung lautet: „Schauen Sie niemals auf Daten, die nach Beginn der Behandlung gesammelt wurden." Betrachten Sie zum Beispiel nicht, wie viel die Vitamin-Gruppe nach der Einnahme des Vitamins gegessen hat, denn vielleicht hat das Vitamin sie hungrig gemacht.
- Die Lösung des Artikels: Es kommt darauf an, warum sich die Essgewohnheiten geändert haben.
- Wenn das Vitamin sie hungrig gemacht hat, zählen Sie das Essen nicht (es ist Teil der Wirkung).
- Aber wenn etwas anderes sie dazu gebracht hat, mehr zu essen (wie die Eröffnung eines neuen Restaurants in der Nähe), müssen Sie dies berücksichtigen, sonst erhalten Sie die falsche Antwort.
- Die Metapher: Es ist wie ein Detektiv. Wenn sich die Alibi eines Verdächtigen wegen des Verbrechens ändert, ignorieren Sie es. Aber wenn sich das Alibi wegen eines Staus ändert (unabhängig vom Verbrechen), müssen Sie den Stau berücksichtigen, um den Fall zu lösen.
5. Der „gestaffelte" Start
Manchmal erhalten verschiedene Gruppen die Behandlung zu unterschiedlichen Zeitpunkten (wie Bundesstaaten, die ein neues Gesetz 2020, 2021 und 2022 einführen).
- Die Lösung des Artikels: Der Artikel unterscheidet zwischen dem wann die Behandlung beginnt und dem was die Behandlung ist. Wenn die Behandlung selbst im Laufe der Zeit sich ändert, je nachdem wie die Dinge laufen (dynamisch), entsteht eine Rückkopplungsschleife, die schwer zu entwirren ist. Wenn die Behandlung nur eine einmalige Sache ist, die zu unterschiedlichen Zeiten für verschiedene Personen passiert (statisch), ist sie viel einfacher zu handhaben.
6. Das „falsche Werkzeug" vs. die „falschen Einstellungen"
In der wissenschaftlichen Gemeinschaft wurde viel darüber diskutiert, welcher „Rechner" (statistischer Schätzer) für diese Aufgabe am besten ist.
- Die große Entdeckung des Artikels: Es ist egal, welchen Rechner Sie verwenden! Das Problem ist nicht der Rechner; es sind die Einstellungen, die Sie darin vornehmen.
- Die Metapher: Stellen Sie sich vor, Sie backen einen Kuchen. Sie können einen schicken elektrischen Mixer oder einen einfachen Holzlöffel verwenden. Wenn Sie die falschen Zutaten (die falschen Variablen) verwenden, schmeckt der Kuchen schlecht, egal welches Werkzeug Sie verwenden.
- Die Lösung: Die Autoren zeigen Ihnen genau, wie Sie die „Zutaten" (die Anpassungsmenge) für jeden Rechner einstellen, den Sie verwenden möchten. Wenn Sie die richtigen Variablen in die Maschine eingeben, liefert selbst die einfachste Maschine das richtige Ergebnis.
Das Fazit
Dieser Artikel sagt den Forschern: Hören Sie auf zu raten, welche Variablen Sie verwenden sollen.
- Zeichnen Sie eine Karte von Ursache und Wirkung.
- Verwenden Sie diese Karte, um die exakt richtigen Variablen auszuwählen, um Ihre Gruppen auszugleichen.
- Machen Sie sich keine Sorgen darum, das komplexeste statistische Werkzeug auszuwählen; stellen Sie einfach sicher, dass Sie die richtigen Variablen in das Werkzeug eingeben, das Sie haben.
Wenn Sie dies tun, erhalten Sie ein faires Rennen und eine wahre Antwort. Wenn Sie es nicht tun, messen Sie möglicherweise völlig das Falsche.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.