← Nieuwste papers
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

Dit artikel biedt principiële aanbevelingen voor het voorbewerken van passieve sensordata van smartphones en wearables om de voorspelling van het risico op middelengebruik bij adolescenten te verbeteren, waarbij de ABCD Study wordt gebruikt om te illustreren hoe strikte kwaliteitscontrole van gegevens en transparante feature engineering uitdagingen zoals het afhandelen van uitschieters, verschillen tussen platforms en protocolafwijkingen kunnen aanpakken.

Oorspronkelijke auteurs: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Gepubliceerd 2026-10-08
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je voor dat je probeert de dagelijkse gewoonten van tieners te begrijpen door hen door een raam te observeren. Je ziet hen misschien slapen, wandelen of naar hun telefoons staren, maar je ziet niet het hele plaatje tenzij je met hen in de kamer bent. Decennialang hebben wetenschappers vertrouwd op tieners om enquêtes over hun leven in te vullen, waarbij hen werd gevraagd hoeveel uur ze sliepen of hoeveel ze bewogen. Maar het geheugen is feilbaar, en mensen vergeten vaak of rapporteren hun gewoonten onjuist. Een nieuwere aanpak houdt in dat jongeren smartphones en draagbare fitness trackers krijgen die hun bewegingen, slaappatronen en telefoongebruik in de echte wereld stilletjes registreren. Deze methode, bekend als passieve sensing, biedt een venster op gedrag dat continu en objectief is. Echter, alleen omdat een apparaat gegevens registreert, betekent dit niet dat die gegevens altijd nauwkeurig of gemakkelijk te gebruiken zijn. De apparaten kunnen defect raken, de software kan een fout bevatten, en de manier waarop tieners met technologie omgaan varieert enorm. Voordat wetenschappers deze vloedgolf aan informatie kunnen gebruiken om gezondheidsrisico's te voorspellen, zoals de waarschijnlijkheid dat een tiener begint met het gebruik van drugs of alcohol, moeten ze eerst leren hoe ze de gegevens moeten opschonen, waarbij ze moeten beslissen welke getallen echt zijn en welke fouten zijn.

Een team van onderzoekers zette zich in om deze rommelige problemen op te lossen met behaling van gegevens uit een enorme, langdurige studie naar Amerikaanse jongeren genaamd de Adolescent Brain Cognitive Development Study. Ze richtten zich op een groep van bijna 5.000 tieners die ongeveer 13 of 14 jaar oud waren en ermee hadden ingestemd om een weektracker te dragen en een speciale app op hun telefoons te gebruiken gedurende drie weken. Het doel was om te zien of de patronen in deze digitale gegevens konden helpen identificeren welke jongeren een hoger risico liepen op middelengebruik. Maar toen ze begonnen naar de cijfers te kijken, ontdekten de onderzoekers dat de gegevens verre van perfect waren. Sommige tieners hadden slechts enkele dagen aan activiteit geregistreerd, terwijl anderen weken aan gegevens hadden. Sommigen hadden vreemde metingen, zoals 24 uur achter elkaar slapen of helemaal niet bewegen. Het team moest een manier vinden om met deze vreemdheden om te gaan zonder de gedragingen weg te gooien die juist een probleem zouden kunnen signaleren.

De onderzoekers ontdekten dat de meest extreme en onwaarschijnlijke getallen meestal voortkwamen bij de tieners die hun apparaten het minst hadden gedragen. Als iemand zijn tracker slechts één dag droeg en die dag erg inactief was, kan de computer berekenen dat die persoon altijd inactief was. Dit suggereerde dat de vreemde getallen niet noodzakelijkerwijs tekenen waren van een gevaarlijke levensstijl, maar eerder tekenen dat de gegevens incompleet waren. In plaats van elke enkele datapunt die er vreemd uitzag te verwijderen, besloot het team eerst naar de persoon te kijken. Ze stelden een regel op dat een tiener ten minste vijf weekdagen en twee weekenddagen aan gegevens moest hebben om in de studie te worden opgenomen. Deze aanpak stelde hen in staat om tieners met een onregelmatig slaap- of activiteitspatroon te behouden, zolang ze voldoende gegevens hadden om aan te tonen dat die patronen echt waren en niet slechts een toevalstreffer van een enkele slechte dag. Door dit te doen, behielden ze de rommelige, onregelmatige realiteit van het tienerleven, waarin de belangrijkste aanwijzingen over gezondheidsrisico's vaak verborgen liggen.

Het team ontdekte ook dat het type telefoon dat een tiener gebruikte de gegevens op verrassende manieren veranderde. De studie gebruikte een systeem om te registreren hoeveel tijd tieners besteedden aan typen op hun telefoons. Echter, het systeem werkte anders op iPhones vergeleken met Android-telefoons. Op iPhones kon het systeem het typen niet registreren, tenzij de gebruiker overschakelde naar een speciaal door de studie geleverd toetsenbord. De onderzoekers vermoedden dat veel iPhone-gebruikers dit overschakelen irritant vonden en teruggingen naar hun normale toetsenbord, wat betekende dat de studie veel van hun typactiviteit miste. Wanneer ze de geregistreerde gegevens vergeleken met wat de tieners zelf zeiden te doen, merkten ze op dat iPhone-gebruikers veel minder leken te typen dan ze in werkelijkheid deden, vooral wanneer hun gebruik laag was. Dit betekende dat de gegevens niet alleen verschillend waren; ze waren systematisch bevooroordeeld tegen één groep mensen. De onderzoekers concludeerden dat ze de gegevens van beide telefoontypen niet simpelweg samen konden voegen zonder rekening te houden met dit verschil, en dat ze het besturingssysteem van de telefoon als een belangrijke factor in hun analyse moesten behandelen.

Een andere uitdaging was het beslissen welke dagen geteld moesten worden. De studie had een specifieke periode van drie weken waarin de onderzoekers de deelnemers actief monitorden. Echter, de apparaten bleven ook gegevens registreren vóórdat de studie begon en nadat deze eindigde. De onderzoekers vergeleken het gedrag tijdens de officiële studieweken met het gedrag tijdens de extra dagen. Ze ontdekten dat tieners anders handelden wanneer ze wisten dat ze in de gaten werden gehouden versus wanneer dat niet het geval was. Tijdens de officiële weken waren hun slaap- en activiteitspatronen consistent met elkaar. Maar op de dagen buiten de studieweken werden de patronen grillig en onvoorspelbaar. Dit leidde ertoe dat het team besloot dat alleen de gegevens verzameld tijdens de officiële drie weken betrouwbaar genoeg waren om te gebruiken. Ze gooiden de extra dagen weg, in het besef dat meer gegevens niet altijd beter zijn als die gegevens uit een andere context komen.

Ten slotte moesten de onderzoekers de instrumenten bouwen om deze ruwe getallen om te zetten in iets wat een computer kan begrijpen. Ze moesten kenmerken creëren die niet alleen beschreven hoeveel een tiener sliep, maar ook hoe consistent hun slaap was. Ze moesten uitzoeken hoe ze het verschil tussen een bedtijd van 23:00 uur en 01:00 uur konden meten zonder in de war te raken door de manier waarop klokken rond middernacht verspringen. Ze moesten ook fouten in de gegevens opschonen die de organisatoren van de studie hadden gemist, zoals ontbrekende waarden die per ongeluk als nul waren gemarkeerd, waardoor een tiener eruit zou zien alsof hij nooit bewoog terwijl dat eigenlijk wel zo was. Na al deze zorgvuldige opschoning en organisatie hield het team een kleinere groep van 428 tieners over, maar ze waren ervan overtuigd dat de gegevens van deze groep betrouwbaar waren.

Het artikel beweert niet een perfecte manier te hebben gevonden om middelengebruik te voorspellen, noch zegt het dat de problemen met digitale gegevens zijn opgelost. In plaats daarvan biedt het een reeks praktische regels voor andere wetenschappers die dit soort gegevens willen gebruiken. De belangrijkste les is dat onderzoekers voorzichtig moeten zijn met hoe ze omgaan met uitschieters en ontbrekende informatie. Ze moeten niet zomaar vreemde getallen verwijderen, want die getallen kunnen juist de belangrijkste zijn. Ze moeten ook controleren of de gegevens veranderen afhankelijk van het gebruikte apparaat of de tijd waarop ze werden verzameld. Door deze stappen te volgen, kunnen wetenschappers ervoor zorgen dat hun bevindingen de werkelijke levens weerspiegelen van de tieners die ze bestuderen, in plaats van de fouten van de machines die ze gebruiken. Dit werk biedt een routekaart om een chaotische stroom van digitale signalen om te zetten in een helder beeld van het adolescent gedrag, wat de weg vrijmaakt voor betere hulpmiddelen om jongeren gezond te helpen blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →