Sample Size Determination Under Selection Bias: Robust Tolerance Limits for Prevalent Cohort Data
Dieser Beitrag leitet modifizierte, verteilungsfreie Toleranzgrenzformeln her und validiert diese, die verschiedene verzerrte Stichprobenverfahren wie Gewichtsverzerrung und Zensierung berücksichtigen, um die Einschränkungen traditioneller Methoden zu adressieren, wenn unverzerrte repräsentative Stichproben nicht verfügbar sind, und demonstriert ihre Anwendung anhand von Demenzdaten aus der kanadischen Studie zur Gesundheit und zum Altern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie sind ein Bäcker, der herausfinden muss, wie viele Kekse er backen muss, um sicherzustellen, dass, wenn Sie zwei bestimmte Kekse aus dem Blech nehmen (sagen wir den 3. kleinsten und den 10. größten), der Raum zwischen ihnen mindestens 80 % aller Keksgrößen enthält, die Sie hätten backen können.
In der Welt der Statistik nennt man dies das Finden einer Toleranzgrenze. Seit Jahrzehnten haben Statistiker ein berühmtes, einfaches Rezept (die Scheffé-Tukey-Formel), um diese Frage zu beantworten. Das Rezept funktioniert perfekt, wenn Ihr Keksblech eine faire, zufällige Stichprobe der gesamten Charge darstellt. Wenn Sie Kekse blind auswählen, stimmt die Mathematik.
Das Problem: Das „verzerrte" Blech
In der realen Welt – insbesondere in medizinischen Studien wie der Verfolgung von Demenzpatienten – können Sie jedoch oft kein faires, zufälliges Blech erhalten. Sie erhalten möglicherweise nur Kekse, die „länger" oder „schwerer" sind, aufgrund der Art und Weise, wie Sie sie gesammelt haben.
- Die Analogie: Stellen Sie sich vor, Sie untersuchen, wie lange Menschen mit einer Krankheit leben. Wenn Sie erst anfangen, Menschen zu beobachten, nachdem sie bereits eine Weile krank waren (eine „prävalente Kohorte"), finden Sie mit größerer Wahrscheinlichkeit die Menschen, die länger überleben. Die kurzlebigen Patienten sind bereits verstorben und für Sie unsichtbar.
- Das Ergebnis: Ihre Stichprobe ist verzerrt. Es ist wie ein Blech, auf dem nur die größten Kekse bleiben durften. Wenn Sie das alte, einfache Rezept auf dieses verzerrte Blech anwenden, berechnen Sie, dass Sie sehr wenige Kekse benötigen, um Ihre 80 %-Abdeckung zu erreichen. In Wirklichkeit liegen Sie jedoch weit daneben. Sie denken, Sie hätten genügend Daten, aber das tun Sie nicht.
Die Lösung: Neue Rezepte für eine verzerrte Welt
Die Autoren dieses Papiers, James McVittie, Martin Lysy und Masoud Asgharian, erkannten, dass das alte Rezept versagt, wenn die Daten verzerrt sind. Sie entwickelten zwei neue „Rezepte" (Methoden), um die Mathematik so zu korrigieren, dass sie auch funktioniert, wenn Ihre Stichprobe verzerrt ist.
Die „Ungleichheits"-Methode (Der Über-Vorbereiter):
Diese Methode versucht, auf der sicheren Seite zu sein, indem sie eine Reihe logischer „Wenn-Dann"-Regeln verwendet. Es ist wie ein Bäcker, der sich wegen des verzerrten Blechs Sorgen macht und beschließt, viel mehr Kekse zu backen als nötig, nur um absolut sicher zu gehen.- Der Haken: Es funktioniert, ist aber verschwenderisch. Es sagt Ihnen, dass Sie eine massive Datenmenge (eine riesige Stichprobengröße) sammeln müssen, um auf der sicheren Seite zu sein, und überschätzt oft, was Sie tatsächlich benötigen.
Die „FFT"-Methode (Der Präzisions-Koch):
Dies ist der Star des Papiers. „FFT" steht für Fast Fourier Transform (Schnelle Fourier-Transformation), ein ausgeklügeltes mathematisches Werkzeug, das wie ein Hochgeschwindigkeitsmixer für Wahrscheinlichkeitskurven wirkt.- Funktionsweise: Anstatt zu raten oder lockere Regeln zu verwenden, nimmt diese Methode die Form Ihrer verzerrten Daten und „mixt" sie mathematisch zurück, um zu sehen, wie die ursprüngliche, faire Verteilung aussah. Anschließend berechnet sie die genaue Anzahl der Kekse (Stichprobengröße), die benötigt wird.
- Das Ergebnis: Sie ist unglaublich genau. Sie sagt Ihnen die genaue Anzahl der Personen, die Sie untersuchen müssen, um Ihre 80 %-Abdeckung zu erreichen, nicht mehr und nicht weniger.
Der Beweis: Die Simulation und der reale Test
Die Autoren testeten diese neuen Rezepte auf zwei Arten:
- Die Simulation: Sie erstellten gefälschte Computerdaten, bei denen sie die „wahre" Antwort kannten. Als sie das alte Rezept auf verzerrte Daten anwendeten, versagte es kläglich (es sagte voraus, dass sie zu wenige Personen benötigten). Die „Ungleichheits"-Methode war zu vorsichtig (sie sagte zu viele voraus). Die FFT-Methode traf jedes Mal den Bullseye.
- Der reale Test: Sie wandten dies auf echte Daten aus der Canadian Study of Health and Aging (CSHA) an, die Menschen mit Demenz verfolgt. Da diese Studie nur Menschen erfasst, die bereits diagnostiziert wurden (eine verzerrte Stichprobe), hätte die alte Mathematik die falsche Antwort geliefert. Mit ihrer neuen FFT-Methode berechneten sie genau, wie viele weitere Teilnehmer benötigt würden, um statistisch sicher zu sein.
Das Fazit
Wenn Sie eine Studie durchführen, bei der Ihre Daten natürlich „verzerrt" sind (wie beim Betrachten von Menschen, die eine Krankheit bereits eine Weile überlebt haben), verwenden Sie nicht die alte, einfache mathematische Formel. Sie wird Sie anlügen.
Verwenden Sie stattdessen die neue FFT-Methode, die in diesem Papier vorgeschlagen wird. Es ist wie der Upgrade von einer groben Schätzung zu einem lasergeführten Rechner. Es stellt sicher, dass Sie weder Geld und Zeit verschwenden, indem Sie zu viele Daten sammeln, noch Ihr Studium riskieren, indem Sie zu wenig sammeln. Es ist der effizienteste Weg, um mit unordentlichen, realen Daten umzugehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.