← Derniers articles
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

Cet article propose des recommandations fondées sur des principes pour le prétraitement des données de détection passive provenant de smartphones et de dispositifs portables afin d'améliorer la prédiction du risque de consommation de substances chez les adolescents, en utilisant l'étude ABCD pour illustrer comment un contrôle rigoureux de la qualité des données et une ingénierie des caractéristiques transparente peuvent répondre à des défis tels que la gestion des valeurs aberrantes, les différences de plateformes et les écarts de protocole.

Auteurs originaux : Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Publié 2026-10-08
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Imaginez essayer de comprendre les habitudes quotidiennes des adolescents en les observant par une fenêtre. Vous pourriez les voir dormir, marcher ou fixer leur téléphone, mais vous ne pouvez pas voir l'image complète à moins d'être à l'intérieur de la pièce avec eux. Pendant des décennies, les scientifiques se sont appuyés sur les adolescents pour remplir des sondages sur leur vie, leur demandant de se souvenir du nombre d'heures qu'ils ont dormi ou de leurs mouvements. Mais la mémoire est faillible, et les gens oublient ou rapportent souvent mal leurs habitudes. Une approche plus récente consiste à donner aux jeunes des smartphones et des bracelets connectés qui enregistrent discrètement leurs mouvements, leurs cycles de sommeil et leur utilisation du téléphone dans le monde réel. Cette méthode, appelée capteur passif, offre une fenêtre sur le comportement qui est continue et objective. Cependant, ce n'est pas parce qu'un appareil enregistre des données que ces données sont toujours précises ou faciles à utiliser. Les appareils peuvent dysfonctionner, le logiciel peut bugger, et la façon dont les adolescents interagissent avec la technologie varie énormément. Avant que les scientifiques puissent utiliser ce flux d'informations pour prédire les risques pour la santé, comme la probabilité qu'un adolescent commence à consommer de la drogue ou de l'alcool, ils doivent d'abord apprendre à nettoyer les données, en décidant quels chiffres sont réels et quels sont des erreurs.

Une équipe de chercheurs s'est donné pour mission de résoudre ces problèmes complexes en utilisant les données d'une étude américaine massive et à long terme sur la jeunesse appelée l'Adolescent Brain Cognitive Development Study. Ils se sont concentrés sur un groupe de près de 5 000 adolescents qui avaient environ 13 ou 14 ans et qui avaient accepté de porter un bracelet connecté et d'utiliser une application spéciale sur leurs téléphones pendant trois semaines. L'objectif était de voir si les schémas dans ces données numériques pouvaient aider à identifier quels jeunes étaient plus exposés au risque de consommation de substances. Mais alors qu'ils commençaient à examiner les chiffres, les chercheurs ont constaté que les données étaient loin d'être parfaites. Certains adolescents n'avaient enregistré que quelques jours d'activité, tandis que d'autres avaient des semaines de données. Certains présentaient des lectures étranges, comme dormir 24 heures d'affilée ou ne pas bouger du tout. L'équipe devait trouver comment gérer ces anomalies sans jeter les comportements mêmes qui pourraient signaler un problème.

Les chercheurs ont découvert que les chiffres les plus extrêmes et les plus improbables provenaient généralement des adolescents qui avaient porté leurs appareils le moins souvent. Si une personne n'a porté son bracelet que pendant un jour et s'est avérée très inactive ce jour-là, l'ordinateur pourrait calculer qu'elle est inactive tout le temps. Cela suggérait que les chiffres étranges n'étaient pas nécessairement les signes d'un mode de vie dangereux, mais plutôt les signes que les données étaient incomplètes. Au lieu de supprimer chaque point de donnée qui semblait bizarre, l'équipe a décidé d'examiner d'abord la personne. Ils ont établi une règle : un adolescent devait avoir au moins cinq jours de semaine et deux jours de week-end de données pour être inclus dans l'étude. Cette approche a permis de conserver les adolescents ayant des cycles de sommeil ou d'activité irréguliers, tant qu'ils disposaient d'assez de données pour prouver que ces schémas étaient réels et non pas simplement le résultat d'un jour isolé défaillant. En faisant cela, ils ont préservé la réalité désordonnée et irrégulière de la vie adolescente, qui est souvent là où se cachent les indices les plus importants concernant les risques pour la santé.

L'équipe a également découvert que le type de téléphone utilisé par un adolescent modifiait les données de manière surprenante. L'étude utilisait un système pour enregistrer le temps que les adolescents passaient à taper sur leur téléphone. Cependant, le système fonctionnait différemment sur les iPhone par rapport aux téléphones Android. Sur les iPhone, le système ne pouvait pas enregistrer la frappe à moins que l'utilisateur ne passe à un clavier spécial fourni par l'étude. Les chercheurs soupçonnaient que de nombreux utilisateurs d'iPhone trouvaient ce changement agaçant et revenaient à leur clavier normal, ce qui signifiait que l'étude manquait une grande partie de leur activité de frappe. Lorsqu'ils ont comparé les données enregistrées avec ce que les adolescents disaient faire, ils ont constaté que les utilisateurs d'iPhone semblaient taper beaucoup moins qu'en réalité, surtout lorsque leur utilisation était faible. Cela signifiait que les données n'étaient pas seulement différentes ; elles étaient systématiquement biaisées contre un groupe de personnes. Les chercheurs ont conclu qu'ils ne pouvaient pas simplement mélanger les données des deux types de téléphones sans tenir compte de cette différence, et qu'ils devaient traiter le système d'exploitation du téléphone comme un facteur majeur de leur analyse.

Un autre défi consistait à décider quels jours compter. L'étude avait une fenêtre spécifique de trois semaines où les chercheurs surveillaient activement les participants. Cependant, les appareils continuaient d'enregistrer des données avant le début de l'étude et après sa fin. Les chercheurs ont comparé le comportement durant les semaines officielles de l'étude avec le comportement durant les jours supplémentaires. Ils ont constaté que les adolescents agissaient différemment lorsqu'ils savaient qu'ils étaient observés et lorsqu'ils ne l'étaient pas. Pendant les semaines officielles, leur sommeil et leur activité étaient cohérents entre eux. Mais lors des jours en dehors de la fenêtre de l'étude, les schémas devenaient erratiques et imprévisibles. Cela a conduit l'équipe à décider que seules les données collectées pendant la période officielle de trois semaines étaient assez fiables pour être utilisées. Ils ont écarté les jours supplémentaires, réalisant que plus de données n'était pas toujours préférable si ces données provenaient d'un contexte différent.

Enfin, les chercheurs ont dû construire les outils permettant de transformer ces chiffres bruts en quelque chose qu'un ordinateur puisse comprendre. Ils ont dû créer des caractéristiques qui décrivent non seulement la quantité de sommeil d'un adolescent, mais aussi la régularité de son sommeil. Ils ont dû trouver comment mesurer la différence entre un coucher à 23h00 et à 1h00 du matin sans être confus par la façon dont les horloges basculent à minuit. Ils ont également dû nettoyer les erreurs dans les données que les organisateurs de l'étude avaient manquées, telles que des valeurs manquantes qui avaient été accidentellement marquées comme zéro, ce qui ferait paraître un adolescent comme n'ayant jamais bougé alors qu'il l'avait fait. Après tout ce nettoyage et cette organisation méticuleux, l'équipe se retrouvait avec un groupe plus restreint de 428 adolescents, mais elle était convaincue que les données de ce groupe étaient dignes de confiance.

L'article ne prétend pas avoir trouvé une méthode parfaite pour prédire la consommation de substances, ni affirme que les problèmes liés aux données numériques sont résolus. Au contraire, il propose un ensemble de règles pratiques pour d'autres scientifiques qui souhaitent utiliser ce type de données. La principale leçon est que les chercheurs doivent être prudents dans la manière dont ils gèrent les valeurs aberrantes et les informations manquantes. Ils ne doivent pas simplement supprimer les chiffres étranges, car ces chiffres pourraient être les plus importants. Ils doivent également vérifier si les données changent en fonction de l'appareil utilisé ou du moment où elles ont été collectées. En suivant ces étapes, les scientifiques peuvent s'assurer que leurs conclusions reflètent la vie réelle des adolescents qu'ils étudient, plutôt que les erreurs des machines qu'ils utilisent. Ce travail fournit une feuille de route pour transformer un flux chaotique de signaux numériques en une image claire du comportement adolescent, ouvrant la voie à de meilleurs outils pour aider les jeunes à rester en bonne santé.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →