Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction
Diese Arbeit liefert fundierte Empfehlungen für die Vorverarbeitung von passiven Sensordaten von Smartphones und Wearables, um die Vorhersage des Risikos für Substanzgebrauch bei Jugendlichen zu verbessern, wobei die ABCD-Studie zur Veranschaulichung nutzt, wie eine rigorose Datenqualitätskontrolle und transparentes Feature-Engineering Herausforderungen wie den Umgang mit Ausreißern, Plattformunterschieden und Protokollabweichungen bewältigen können.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, die täglichen Gewohnheiten von Teenagern zu verstehen, indem Sie sie durch ein Fenster beobachten. Sie könnten sehen, wie sie schlafen, spazieren gehen oder auf ihre Telefone starren, aber Sie sehen nicht das ganze Bild, es sei denn, Sie sind mit ihnen im selben Raum. Seit Jahrzehnten verlassen sich Wissenschaftler darauf, dass Teenager Umfragen über ihr Leben ausfüllen, in denen sie sich daran erinnern müssen, wie viele Stunden sie geschlafen oder wie viel sie sich bewegt haben. Aber das Gedächtnis ist unzuverlässig, und Menschen vergessen oft oder berichten ungenau über ihre Gewohnheiten. Ein neuerer Ansatz besteht darin, jungen Menschen Smartphones und tragbare Fitness-Tracker zu geben, die ihre Bewegungen, Schlafmuster und Handynutzung in der realen Welt still und leise aufzeichnen. Diese Methode, bekannt als passives Sensing, bietet ein Fenster in das Verhalten, das kontinuierlich und objektiv ist. Nur weil ein Gerät Daten aufzeichnet, bedeutet das jedoch nicht, dass diese Daten immer genau oder einfach zu verwenden sind. Die Geräte können Fehlfunktionen aufweisen, die Software kann Fehler verursachen, und die Art und Weise, wie Teenager mit Technologie interagieren, variiert stark. Bevor Wissenschaftler diesen Informationsfluss nutzen können, um Gesundheitsrisiken vorherzusagen – wie etwa die Wahrscheinlichkeit, dass ein Teenager mit dem Drogen- oder Alkoholkonsum beginnt –, müssen sie zuerst lernen, wie sie die Daten bereinigen und entscheiden, welche Zahlen echt und welche Fehler sind.
Ein Forscherteam machte sich daran, diese chaotischen Probleme mithilfe von Daten aus einer massiven, langfristigen Studie über amerikanische Jugendliche namens „Adolescent Brain Cognitive Development Study“ zu lösen. Sie konzentrierten sich auf eine Gruppe von fast 5.000 Teenagern, die etwa 13 oder 14 Jahre alt waren und zugestimmt hatten, einen Fitness-Tracker zu tragen und eine spezielle App auf ihren Telefonen zu nutzen, und zwar für drei Wochen. Das Ziel war es zu sehen, ob die Muster in diesen digitalen Daten helfen können, zu identifizieren, welche jungen Menschen ein höheres Risiko für Substanzkonsum haben. Doch als sie begannen, die Zahlen zu betrachten, stellten die Forscher fest, dass die Daten weit davon entfernt waren, perfekt zu sein. Einige Teenager hatten nur wenige Tage an Aktivität aufgezeichnet, während andere Wochen an Daten hatten. Einige hatten seltsame Messwerte, wie zum Beispiel 24 Stunden am Stück zu schlafen oder sich überhaupt nicht zu bewegen. Das Team musste herausfinden, wie es mit diesen Anomalien umgeht, ohne genau die Verhaltensweisen wegzuwerfen, die auf ein Problem hindeuten könnten.
Die Forscher entdeckten, dass die extremsten und unwahrscheinlichsten Zahlen meist von den Teenagern stammten, die ihre Geräte am wenigsten getragen hatten. Wenn eine Person ihren Tracker nur einen Tag lang trug und an diesem Tag sehr inaktiv war, könnte der Computer berechnen, dass sie die ganze Zeit inaktiv war. Dies deutzeugte darauf hin, dass die seltsamen Zahlen nicht unbedingt Anzeichen eines gefährlichen Lebensstils waren, sondern eher Zeichen dafür, dass die Daten unvollständig waren. Anstatt jeden einzelnen Datenpunkt zu löschen, der merkwürdig aussah, entschied sich das Team, zuerst die Person zu betrachten. Sie legten eine Regel fest, nach der ein Teenager mindestens fünf Wochentage und zwei Wochenendtage an Daten haben musste, um in die Studie aufgenommen zu werden. Dieser Ansatz ermöglichte es ihnen, Teenager mit unregelmäßigen Schlaf- oder Aktivitätsmustern einzubeziehen, solange sie genügend Daten hatten, um zu zeigen, dass diese Muster real waren und nicht nur ein Zufall eines einzigen schlechten Tages. Durch dies bewahrten sie die chaotische, unregelmäßige Realität des jugendlichen Lebens, in der oft die wichtigsten Hinweise auf Gesundheitsrisiken verborgen liegen.
Das Team fand auch heraus, dass die Art des Telefons, das ein Teenager benutzte, die Daten auf überraschende Weise veränderte. Die Studie nutzte ein System, um aufzuzeichnen, wie viel Zeit Jugendliche mit dem Tippen auf ihren Telefonen verbrachten. Das System funktionierte jedoch bei iPhones anders als bei Android-Telefonen. Bei iPhones konnte das System das Tippen nicht aufzeichnen, es sei denn, der Nutzer wechselte zu einer speziellen Tastatur, die von der Studie bereitgestellt wurde. Die Forscher vermuteten, dass viele iPhone-Nutzer diesen Wechsel als störend empfanden und zu ihrer normalen Tastatur zurückkehrten, was bedeutete, dass die Studie viel von ihrer Tippaktivität verpasste. Als sie die aufgezeichneten Daten mit dem verglichenen, was die Jugendlichen angaben, stellten sie fest, dass iPhone-Nutzer viel weniger zu tippen schienen, als sie tatsächlich taten, insbesondere wenn ihre Nutzung gering war. Dies bedeutete, dass die Daten nicht nur unterschiedlich waren, sondern systematisch gegen eine Gruppe benachteiligt waren. Die Forscher kamen zu dem Schluss, dass sie die Daten beider Telefonarten nicht einfach zusammenmischen konnten, ohne diesen Unterschied zu berücksichtigen, und dass sie das Betriebssystem des Telefons als einen wesentlichen Faktor in ihrer Analyse behandeln mussten.
Eine weitere Herausforderung bestand darin, zu entscheiden, welche Tage zu zählen waren. Die Studie hatte ein spezifisches dreiwöchiges Zeitfenster, in dem die Forscher die Teilnehmer aktiv überwachten. Die Geräte zeichneten jedoch auch vor Beginn der Studie und nach deren Ende Daten auf. Die Forscher verglichen das Verhalten während der offiziellen Studienwochen mit dem Verhalten während der zusätzlichen Tage. Sie fanden heraus, dass sich Teenager anders verhielten, wenn sie wussten, dass sie beobachtet wurden, als wenn sie es nicht wussten. Während der offiziellen Wochen waren ihr Schlaf- und Aktivitätsmuster konsistent untereinander. Aber an den Tagen außerhalb des Studienzeitraums wurden die Muster erratisch und unvorhersehbar. Dies führte das Team zu der Entscheidung, dass nur die während des offiziellen dreiwöchigen Zeitraums gesammelten Daten zuverlässig genug waren, um verwendet zu werden. Sie verworfen die zusätzlichen Tage in der Erkenntnis, dass mehr Daten nicht immer besser sind, wenn diese Daten aus einem anderen Kontext stammen.
Schließlich mussten die Forscher die Werkzeuge bauen, um diese Rohdaten in etwas zu verwandeln, das ein Computer verstehen kann. Sie mussten Merkmale (Features) erstellen, die nicht nur beschreiben, wie viel ein Jugendlicher schlief, sondern auch, wie konsistent sein Schlaf war. Sie mussten herausfinden, wie man den Unterschied zwischen einer Schlafenszeit von 23:00 Uhr und 01:00 Uhr misst, ohne durch die Art und Weise verwirrt zu werden, wie Uhren um Mitternacht herumspringen. Sie mussten auch Fehler in den Daten bereinigen, die die Studienorganisatoren übersehen hatten, wie etwa fehlende Werte, die versehentlich als Null markiert wurden, was einen Jugendlichen so aussehen ließe, als hätte er sich nie bewegt, obwohl er es eigentlich getan hatte. Nach all dieser sorgfältigen Bereinigung und Organisation blieb dem Team eine kleinere Gruppe von 428 Teenagern übrig, aber sie waren zuversichtlich, dass die Daten aus dieser Gruppe vertrauenswürdig waren.
Das Paper behauptet nicht, einen perfekten Weg zur Vorhersage des Substanzkonsums gefunden zu haben, noch besagt es, dass die Probleme mit digitalen Daten gelöst sind. Stattdessen bietet es eine Reihe praktischer Regeln für andere Wissenschaftler an, die diese Art von Daten verwenden möchten. Die wichtigste Lektion ist, dass Forscher vorsichtig damit sein müssen, wie sie mit Ausreißern und fehlenden Informationen umgehen. Sie sollten nicht einfach seltsame Zahlen löschen, denn diese Zahlen könnten die wichtigsten sein. Sie sollten auch prüfen, ob sich die Daten je nach verwendetem Gerät oder der Zeit der Erhebung ändern. Indem sie diese Schritte befolgen, können Wissenschaftler sicherstellen, dass ihre Ergebnisse das wahre Leben der Teenager widerspiegeln, die sie untersuchen, und nicht die Fehler der Maschinen, die sie verwenden. Diese Arbeit bietet einen Fahrplan, um einen chaotischen Strom digitaler Signale in ein klares Bild des jugendlichen Verhaltens zu verwandeln und ebnet den Weg für bessere Werkzeuge, um jungen Menschen zu helfen, gesund zu bleiben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.