← 최신 논문
🤖 machine learning

OpenMHC: Accelerating the Science of Wearable Foundation Models

이 논문은 웨어러블 헬스 AI 연구를 민주화하고 가속화하기 위해, 약 12,000명의 참가자로부터 수집된 6,000만 시간 이상의 웨어러블 건강 데이터가 포함된 포괄적인 오픈 액세스 데이터셋인 OpenMHC와 함께, 파운데이션 모델의 오픈 소스 구현 및 통합 벤치마크를 소개한다.

원저자: Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan
게시일 2026-07-22
📖 5 분 읽기🧠 심층 분석

원저자: Narayan Schuetz, Yuze Bai, Lianggang Pan, Edgar Eggert, Favour Nerrise, Juan Delgado-SanMartin, Max Rosenblattl, Milana Gurbanova, Mohammad Asadi, Anders Johnson, Paul Schmiedmayer, Dennis Wang, Allan Lawrie, Daniel Seung Kim, Xin Liu, Akshay Paruchuri, Ehsan Adeli, Euan Ashley, Kelly W. Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신의 스마트워치가 잠들지 않는 작고 지치지 않는 탐정이라고 상상해 보세요. 매 분마다 그것은 당신의 휴대폰에 비밀을 속삭입니다. 얼마나 많은 걸음을 걸었는지, 심장 박동이 얼마나 빨라졌는지, 얼마나 깊게 잠들었는지, 심지어 얼마나 많은 계단을 정복했는지까지 말이죠. 수년 동안 과학자들은 컴퓨터가 이 속삭임을 듣고 우리의 건강을 더 잘 이해하도록 가르치기를 원해 왔습니다. 그들은 이 초지능형 컴퓨터들을 "파운데이션 모델(foundation models)"이라고 부릅니다. 이것들을 세상의 모든 요리를 맛본 마스터 셰프라고 생각해보세요. 일단 맛을 익히고 나면, 그들은 새로운 레시피를 발명하거나 나쁜 재료를 즉각적으로 찾아낼 수 있습니다. 하지만 여기 문제가 있습니다. 마스터 셰프가 되려면 엄청난 양의 재료가 가득한 거대한 주방이 필요합니다. 건강 데이터의 세계에서 가장 큰 주방들은 빅테크 기업들의 문 뒤에 굳게 잠겨 있었고, 연구자들에게는 오직 아주 작은 빈 찬장만이 남겨져 있었습니다. 데이터가 충분하지 않으면, 이 AI 셰프들은 우리 몸이 어떻게 움직이고 느끼는지에 대한 전체 이야기를 배울 수 없습니다.

여기서 스탠퍼드, 임페리얼 칼리지 런던 등의 연구진이 거대한 열쇠를 들고 등장합니다. 그들은 10년 넘게 진행되어 온 디지털 헬스 실험인 "My Heart Counts" 연구의 문을 열었습니다. 그들은 OpenMHC라는 보물 창고를 공개합니다. 이것은 단순한 간식이 아닙니다. 약 12,000명의 데이터로부터 얻은 6,700만 시간 이상의 웨어러블 데이터가 담긴 성찬입니다. 여기에는 아이폰과 애플 워치로부터 수집된 걸음 수, 심박수, 수면 패턴, 운동 기록 등 모든 것이 포함됩니다. 이 거대한 데이터셋과 함께, 그들은 이를 테스트하기 위해 만든 "레시피"(코드)와 "훈련된 셰프"(AI 모델)도 공유합니다. 그들의 목표는 전 세계 어디에서나 누구나 새로운 방식으로 건강 문제를 예측하거나, 누락된 데이터를 채우거나, 우리 몸이 내일 어떻게 행동할지 예측하는 방법을 만들어낼 수 있도록 하는 것입니다.

재료에 관한 중요한 참고 사항: 요리를 시작하기 전에, 이 주방에는 몇 가지 특이한 점이 있다는 것을 알아두는 것이 중요합니다. 데이터를 기부한 사람들은 주로 미국 출신이며, 그룹이 30대 후위의 백인 남성 쪽으로 치우쳐 있습니다. 이는 AI가 배우는 "맛"이 세상의 다른 모든 사람에게는 정확히 맞지 않을 수 있음을 의미합니다. 또한, 이것은 디지털 연구였기 때문에 모든 건강 정보(예: 당뇨병 여부나 행복감 등)는 사용자가 직접 보고한 방식(self-reported)입니다. 이는 레이블에 "노이즈"나 불확실성을 도입하여 AI가 완벽한 패턴을 학습하는 것을 더 어렵게 만들 수 있습니다. 마지막으로, 이 AI는 데이터가 수집된 당시의 건강 특성을 감지하도록 설계된 것이지, 내년에 발생할 심장마비와 같은 미래의 의료적 사건을 예측하기 위한 것이 아닙니다.

거대한 공개: 그들이 발견한 것

연구진은 단순히 데이터를 쏟아놓기만 한 것이 아니라, 어떤 AI 모델이 실제로 의미 있는 결과를 낼 수 있는지 확인하기 위해 거대한 놀이터를 만들었습니다. 그들은 세 가지 주요 과제를 설정했습니다:

  1. 예측(Prediction): AI가 당신의 워치 데이터를 보고 당신의 건강 특성(예: 당뇨병 여부나 행복도)을 추측할 수 있을까요?
  2. 결측치 보간(Imputation - 빈칸 채우기): 사람들은 샤워를 하거나 충전을 하기 위해 시계를 벗어두기도 하므로 데이터에 구멍이 생깁니다. AI가 이 누락된 시간 동안 무슨 일이 있었는지 추측할 수 있을까요?
  3. 예측(Forecasting): AI가 향후 24시간 동안 당신의 활동이 어떻게 될지 예측할 수 있을까요?

그들이 발견한 내용은 다음과 같습니다:

1. "전문화된 셰프"가 승리하지만, "단순한 요리사"도 여전히 강력하다
다양한 AI 모델을 테스트했을 때, LSM-2(웨어러블 데이터에 특화되어 훈련된 파운데이션 모델의 일종)라는 모델이 전반적으로 최고의 셰프라는 결과가 나왔습니다. 이 모델은 건강 결과를 예측하고 누락된 데이터를 채우는 데 가장 일관성이 있었습니다. 그러나 연구진은 놀라운 사실을 발견했습니다. 훨씬 더 단순하고 오래된 방식의 모델인 XGBoost(매우 체계적이고 규칙 기반인 계산기와 같은 모델)가 매우 근소한 차이로 2위를 차지했다는 점입니다. 실제로 어떤 작업에서는 이 단순한 모델이 화려하고 복잡한 AI만큼이나 뛰어난 성능을 보였습니다. 이는 거대한 AI가 강력하긴 하지만, "더 복잡한 것"이 항상 "더 나은 것"을 의미하지는 않는다는 것을 시사합니다. 때로는 잘 조율된 단순한 도구가 경이로운 효과를 냅니다.

2. 거대 언어 모델(챗봇 같은 모델)은 고전했다
연구팀은 또한 거대 언어 모델(에세이를 쓰거나 대화를 나누는 종류의 모델)을 사용하여 이 건강 퍼즐을 풀려고 시도했습니다. 그들은 모델에 데이터를 텍스트나 그래프 이미지 형태로 입력했습니다. 결과는 어떠했을까요? 이러한 거대 챗봇들은 일반적으로 전문화된 헬스 모델이나 단순한 계산기보다 성능이 떨어졌습니다. 심장 박동과 걸음 수라는 특정한 "언어"를 읽는 데 있어서는 범용적인 도구보다 전문화된 도구가 훨씬 더 낫다는 것이 드러났습니다.

3. 장기 기억이 도움이 된다
누락된 데이터를 채우는 것(보간)에 있어서, 며칠간의 사용자 이력을 살펴볼 수 있는 모델이 단 하루의 데이터만 보는 모델보다 훨씬 더 나은 성과를 보였습니다. 이것은 마치 누군가가 지금 무엇을 하고 있는지 추측하는 것과 같습니다. 만약 그들을 딱 1분만 본다면 틀릴 수도 있습니다. 하지만 그들이 보통 오후 6시에 달리기를 한다는 것을 알고 있다면, 훨씬 더 똑똑한 추측을 할 수 있습니다. 논문은 사용자의 장기적인 이력을 활용하는 것이 모델을 더 똑렴하게 만드는 핵심이라고 제안합니다.

4. 공정성이 중요하다
연구진은 모델이 모든 사람을 평등하게 대하는지도 확인했습니다. 그들은 화려한 AI 모델들이 정확하긴 했지만, 단순한 모델들에 비해 특정 집단(예: 다른 연령대나 성별)에 대해 더 큰 오류를 범하기도 한다는 것을 발견했습니다. 이는 우리가 이러한 건강 도구를 구축할 때, 다수가 아닌 모든 사람을 위해 공정하게 작동하도록 보장해야 한다는 중요한 교훈을 줍니다.

이것이 게임의 판도를 어떻게 바꾸는가

이 논문이 나오기 전에는 웨어러블 건강 데이터를 이해하는 AI를 만들고 싶어도 막막했습니다. 데이터를 얻을 수도 없었고, 대기업들이 어떻게 모델을 훈련시키는지 볼 수도 없었습니다. 그것은 마치 조종석을 한 번도 본 적 없이 비행기를 조종하는 법을 배우려는 것과 같았습니다.

OpenMHC는 모두에게 조종석과 비행 매뉴얼, 그리고 훈련 시뮬레이터를 제공함으로써 그 상황을 바꿉니다. 13년에 걸친 11,894명의 참가자 데이터를 모델 실행 코드와 함께 공개함으로써, 저자들은 이 분야를 민주화했습니다. 그들은 아직 모든 건강의 미스터리를 해결했다고 주장하는 것이 아닙니다. 실제로 자기 보고식 데이터의 특성 때문에 어떤 질환에 대해서는 AI가 여전히 단순한 기준점(baseline)을 이기기 어렵다는 점을 인정합니다. 하지만 그들은 과학계 전체가 실험하고, 요리하며, 궁극적으로 우리를 건강하게 유지하는 새로운 방법을 발견할 수 있도록 기초를 마련해 주었습니다. 이제 주방의 문이 열렸고, 재료는 누구나 사용할 수 있도록 준비되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →