← 최신 논문
📄 health informatics

Sense and Sensibility: Sensible Quality Control and Data Decision-Making in Passive Sensing Data for Adolescent Substance Use Risk Prediction

이 논문은 ABCD 연구를 활용하여 이상치 처리, 플랫폼 간 차이, 프로토콜 편차와 같은 과제들을 엄격한 데이터 품질 관리와 투명한 특징 공학을 통해 어떻게 해결할 수 있는지 보여줌으로써, 청소년의 약물 사용 위험 예측을 개선하기 위한 스마트폰 및 웨어러블의 수동적 센싱 데이터 전처리에 관한 원칙적인 권고안을 제공한다.

원저자: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

게시일 2026-10-08
📖 5 분 읽기🧠 심층 분석

원저자: Hong, A., Diaz, J. L., Kennedy, T. M., Wang, F. L.

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

창문을 통해 십 대들의 일상적인 습관을 관찰하며 그들을 이해하려고 노력한다고 상상해 보십시오. 여러분은 그들이 잠을 자거나, 걷거나, 스마트폰을 응시하는 모습은 볼 수 있겠지만, 그들과 함께 방 안에 있지 않는 한 전체 그림을 볼 수는 없을 것입니다. 수십 년 동안 과학자들은 십 대들에게 자신의 삶에 대한 설문조사를 작성하도록 요청하며, 얼마나 오래 잤는지 또는 얼마나 움직였는지를 기억해 내도록 의존해 왔습니다. 하지만 기억은 불완전하며, 사람들은 종종 자신의 습관을 잊거나 잘못 보고하곤 합니다. 새로운 접근 방식은 젊은이들에게 스마트폰과 웨어러블 피트니스 추적기를 제공하여, 현실 세계에서의 움직임, 수면 패턴, 그리고 휴대폰 사용량을 조용히 기록하게 하는 것입니다. '수동적 감지(passive sensing)'라고 알려진 이 방법은 연속적이고 객관적인 행동의 창을 제공합니다. 그러나 장치가 데이터를 기록한다고 해서 그 데이터가 항상 정확하거나 사용하기 쉬운 것은 아닙니다. 장치는 오작동할 수 있고, 소프트웨어는 오류를 일으킬 수 있으며, 십 대들이 기술과 상호작용하는 방식은 매우 다양합니다. 과학자들이 이 정보의 홍수를 사용하여 약물이나 알코올 사용을 시작할 가능성과 같은 건강 위험을 예측하기 전에, 먼저 어떤 숫자가 실제이고 어떤 것이 실수인지 결정하며 데이터를 정제하는 방법을 배워야 합니다.

연구팀은 미국의 청소년들을 대상으로 한 대규모 장기 연구인 '아동기 뇌 인지 발달 연구(Adolescent Brain Cognitive Development Study)'의 데이터를 사용하여 이러한 복잡한 문제들을 해결하고자 했습니다. 그들은 피트니스 추적기를 착용하고 특별한 앱을 휴대폰에서 사용하는 것에 동의한 약 13세 또는 14세의 십 대 약 5,000명 그룹에 집중했습니다. 목표는 이 디지털 데이터의 패턴이 어떤 젊은이들이 물질 사용의 위험이 높은지 식별하는 데 도움이 될 수 있는지 확인하는 것이었습니다. 하지만 숫자를 살펴보기 시작했을 때, 연구진은 데이터가 결코 완벽하지 않다는 것을 발견했습니다. 어떤 십 대들은 며칠간의 활동량만을 기록한 반면, 다른 이들은 몇 주간의 데이터를 가지고 있었습니다. 어떤 이들은 24시간 내내 잠을 자거나 전혀 움직이지 않는 것과 같은 이상한 수치를 보이기도 했습니다. 팀은 이러한 이상한 행동들이 문제를 나타내는 신호일 수도 있는 상황에서, 이를 무조건 버리지 않고 어떻게 처리해야 할지 고민해야 했습니다.

연구진은 가장 극단적이고 일어날 법하지 않은 숫자들은 대개 장치를 가장 적게 착용한 십 대들에게서 나온다는 것을 발견했습니다. 만약 어떤 사람이 추적기를 단 하루만 착용했고 그날 매우 비활동적이었다면, 컴퓨터는 그 사람이 항상 비활동적이라고 계산할 수 있습니다. 이는 이상한 숫자들이 반드시 위험한 생활 양식의 징후가 아니라, 데이터가 불완전하다는 징후임을 시사했습니다. 모든 이상해 보이는 데이터 포인트를 삭제하는 대신, 팀은 먼저 그 사람을 먼저 살펴보기로 했습니다. 그들은 연구에 포함되기 위해서는 최소 평일 5일과 주말 2일의 데이터가 있어야 한다는 규칙을 세웠습니다. 이 접근 방식은 불규칙한 수면이나 활동 패턴을 가진 십 대들이도, 그 패턴이 단지 단 하루의 실수인 것이 아니라 실제적인 패턴임을 보여줄 수 있을 만큼 충분한 데이터를 가지고 있다면 그대로 유지할 수 있게 해주었습니다. 이를 통해 그들은 십 대 삶의 무질서하고 불규칙한 현실을 보존할 수 있었는데, 그곳이 바로 건강 위험에 대한 가장 중요한 단서들이 숨겨져 있는 곳이기 때문입니다.

또한 연구팀은 십 대가 사용하는 휴대폰의 종류가 데이터를 놀라운 방식으로 변화시킨다는 것을 발견했습니다. 연구는 십 대들이 휴대폰으로 타이핑하는 시간을 기록하는 시스템을 사용했습니다. 그러나 이 시스템은 아이폰과 안드로이드 폰에서 다르게 작동했습니다. 아이폰의 경우, 사용자가 연구에서 제공하는 특별한 키보드로 전환하지 않으면 시스템이 타이핑을 기록할 수 없었습니다. 연구진은 많은 아이폰 사용자들이 이 전환을 번거롭게 느껴 원래 사용하던 키보드로 돌아갔을 것이라고 추측했으며, 이는 연구가 그들의 많은 타이핑 활동을 놓쳤음을 의미했습니다. 연구진이 기록된 데이터와 십 대들이 실제로 했다고 말한 내용을 비교했을 때, 아이폰 사용자들이 실제보다 훨씬 적게 타이прав하는 것으로 나타났으며, 특히 사용량이 적을 때 더욱 그러했습니다. 이는 데이터가 단순히 다른 것이 아니라, 한 집단에 대해 체계적으로 편향되어 있다는 것을 의미했습니다. 연구진은 두 종류의 휴대폰 데이터를 차이를 고려하지 않고 단순히 섞어서 사용할 수 없으며, 운영 체제를 주요 분석 요인으로 취급해야 한다고 결론지었습니다.

또 다른 과제는 어떤 날을 계산할 것인지 결정하는 것이었습니다. 연구는 참여자들을 적극적으로 모니터링하는 특정 3주간의 기간을 두었습니다. 그러나 장치는 연구가 시작되기 전과 종료된 후에도 계속해서 데이터를 기록했습니다. 연구진은 공식 연구 기간 중의 행동과 그 외의 기간 중의 행동을 비교했습니다. 그들은 십 대들이 관찰되고 있다는 것을 알고 있을 때와 그렇지 않을 때 다르게 행동한다는 것을 발견했습니다. 공식적인 주간 동안에는 수면과 활동 패턴이 서로 일치했습니다. 하지만 연구 기간 외의 날들에는 패턴이 불규칙하고 예측 불가능해졌습니다. 이로 인해 팀은 오직 공식적인 3주간의 기간 동안 수집된 데이터만이 신뢰할 수 있는 것으로 판단하여, 그 외의 날짜의 데이터는 버리기로 결정했습니다. 데이터가 다른 맥락에서 온 것이라면 더 많은 데이터가 항상 더 좋은 것은 아니라는 점을 깨달은 것입니다.

마지막으로, 연구진은 이러한 가공되지 않은 숫자들을 컴퓨터가 이해할 수 있는 형태로 바꾸는 도구들을 구축해야 했습니다. 그들은 단순히 십 대가 얼마나 잤는지가 아니라, 수면이 얼마나 일관적인지를 설명하는 특징(features)들을 만들어야 했습니다. 또한 시계가 자정을 기점으로 순환하는 방식 때문에 혼란을 겪지 않으면서, 밤 11시와 새벽 1시 사이의 차이를 어떻게 측정할지 결정해야 했습니다. 또한 연구 조직자들이 놓친 오류들, 예를 들어 누락된 값이 실수로 0으로 표시되어 실제로는 움직였음에도 불구하고 전혀 움직이지 않은 것처럼 보이게 만드는 등의 문제를 정리해야 했습니다. 이 모든 세심한 정제와 정리 과정을 거친 후, 팀에는 428명의 십 대라는 더 작은 그룹이 남았지만, 그들은 이 그룹의 데이터가 신뢰할 수 있다고 확신했습니다.

이 논문은 물질 사용을 예측하는 완벽한 방법을 찾았다고 주장하거나, 디지털 데이터의 문제가 해결되었다고 말하는 것이 아닙니다. 대신, 이와 같은 종류의 데이터를 사용하고자 하는 다른 과학자들을 위한 실질적인 규칙들을 제공합니다. 핵심적인 교훈은 연구자들이 이상치(outliers)와 누락된 정보를 처리할 때 주의를 기울여야 한다는 것입니다. 그들은 이상한 숫자들을 단순히 삭제해서는 안 되는데, 왜냐하면 그 숫자들이 가장 중요한 것일 수도 있기 때문입니다. 또한 데이터가 사용 중인 기기에 따라 변하는지, 혹은 수집된 시간에 따라 변하는지를 확인해야 합니다. 이러한 단계들을 따름으로써, 과학자들은 자신들의 연구 결과가 사용하는 기계의 오류가 아니라, 연구 대상인 십 대들의 진정한 삶을 반영하도록 보장할 수 있습니다. 이 작업은 혼란스러운 디지털 신호의 흐름을 십 대 행동에 대한 명확한 그림으로 바꾸는 로드맵을 제공하며, 젊은이들이 건강을 유지할 수 있도록 돕는 더 나은 도구들을 위한 길을 열어줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →