Development of Longitudinal, Linked Maternal-Infant Cohorts using the Epic Cosmos Electronic Health Record Dataset
본 연구는 엄격한 종단적 추적 관찰 기준을 적용할 때 발생하는 상당한 탈락에도 불구하고, 생성된 데이터가 매우 완전하고 미국 출생 인구를 대표하며 역학 연구에 적합함을 입증함으로써, Epic Cosmos 데이터셋 내에서 종단적 연결이 된 모-아 코호트를 구축하기 위한 엄격하고 재현 가능한 프레임워크를 확립한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
오늘날 병원들은 환자를 치료할 때마다 방대한 양의 디지털 기록을 지속적으로 생성합니다. 이러한 전자 건강 기록은 일상적인 혈압 체크부터 의사가 처방하는 특정 약물에 이르기까지 모든 것을 포착하여, 한 사람의 건강 여정에 대한 상세하고 실시간적인 지도를 만들어냅니다. 임신과 신생아를 연구하는 연구자들에게 이 데이터는 엄청난 가능성을 품고 있습니다. 이는 소규모 지역 연구를 통해 가능한 수준을 훨씬 뛰어넘어, 수백만 건의 사례를 동시에 살펴볼 수 있는 방법을 제공합니다. 그러나 주요한 장애물은 항상 점들을 연결하는 문제였습니다. 많은 시스템에서 어머니의 기록과 아기의 기록은 서로 분리된 영역(silo)에 존재하여, 한 사람의 건강이 다른 사람에게 시간에 따라 어떻게 영향을 미치는지 연구하는 것을 어렵게 만듭니다. 더욱이, 연구자들은 전자 기록의 데이터가 불완전하거나 전체 인구를 대표하기보다는 특정 유형의 병원만을 나타낼 수도 있다는 점을 우려해 왔습니다.
연구팀은 '에픽 코스모스(Epic Cosmos)'라고 불리는 거대하고 중앙 집중화된 데이터베이스를 사용하여 이러한 문제들을 해결하고자 했습니다. 이 시스템은 미국 전역과 몇몇 다른 지역의 수백 개 병원 및 클리닉으로부터 구조화된 건강 정보를 수집하여, 환자 케어에 대한 단일하고 통합된 뷰를 생성합니다. 연구진은 이 디지털 네트워크 내에서 어머니와 아기를 연결함으로써 신뢰할 수 있는 장기적인 연구 집단을 구축할 수 있음을 증명하고자 했습니다. 그들은 데이터가 신뢰할 수 있을 만큼 완전한지, 데이터베이스 속 사람들이 일반 인구와 유사한지, 그리고 이 가족들을 첫 산전 진료부터 아기의 생후 초기 몇 달까지 놓치지 않고 추적할 수 있는지를 보여주어야 했습니다.
이를 위해 연구팀은 2023년에서 2024년 사이에 생존 출산으로 이어진 약 300만 건의 임신 사례로부터 시작했습니다. 그들은 먼저 모든 신생아의 기록을 어머니의 기록과 연결하여 쌍을 이룬 데이터셋을 만들었습니다. 이 초기 단계에는 아기가 시스템을 사용하는 병원에서 태어나야 하며, 어머니의 파일에 필요한 가족력 연결 고리가 포함되어 있어야 한다는 조건이 필요했습니다. 이 과정은 방대한 데이터의 대부분을 성공적으로 연결하여 약 300만 건의 임신 사례로 구성된 코호트를 만들어냈습니다. 그 후 연구진은 각 가족에 대해 연속적인 이야기를 보장하기 위해 더 엄격한 규칙을 적용했을 때 데이터가 얼마나 잘 유지되는지 테스트했습니다. 그들은 어머니가 임신 첫 3개월 동안 한 번의 의사 방문, 두 번째 3개월 동안 또 다른 한 번의 방문, 아기 탄생 후 체크업, 그리고 아기가 퇴원한 후 3개월 이내의 추적 방문을 모두 가져야 한다는 조건을 추가했습니다.
연구진이 완전한 의료 이야기를 보장하기 위해 새로운 요구 사항을 추가할 때마다, 연구 대상이 되는 가족의 수는 줄어들었습니다. 네 가지 유형의 방문을 모두 요구했을 때 연구 그룹은 약 58만 7천 건의 임신 사례로 감소했는데, 이는 예상된 결과였습니다. 이는 서로 다른 병원에서 진료를 받았거나 특정 예약 일정을 놓친 가족들이 제외되었기 때문입니다. 결정적으로, 연구진은 남은 그룹이 원래의 더 큰 그룹과 매우 유사하다는 것을 발견했습니다. 연령, 인종, 지리적 위치의 혼합 비율이 국가 출생 기록과 일치했습니다. 데이터 또한 매우 완전했습니다. 출생 체중, 어머니의 연령, 출산 유형과 같은 주요 세부 정보의 경우 정보가 누락된 비율은 1% 미만이었습니다. 체질량 지수(BMI)나 인종처럼 포착하기 더 어려운 변수의 경우에도 데이터는 사례의 4분의 3 이상에서 확인되었습니다.
이 연결된 데이터가 실제 의학적 질문에 답할 수 있는지 증명하기 위해, 팀은 특정 테스트를 수행했습니다. 그들은 이미 임신 전이나 임신 초기에 고혈압을 가지고 있던 여성들을 대상으로, 임신 첫 삼분기(trimester)의 혈압 수치가 나중에 '임신중독증(preeclampsia)'이라는 심각한 합병증을 예측할 수 있는지 살펴보았습니다. 임신중독증은 임신 중 발생할 수 있는 위험한 고혈압과 장기 손상을 특징으로 하는 질환입니다. 분석 결과, 만성 고혈압이 있는 여성들 중 임신 첫 삼분기에 수축기 혈압(최고 혈압)이 140 이상인 여성들은 임신 후기에 임신중독증이 발생할 가능성이 유의미하게 높았습니다. 이 발견은 디지털 기록이 미묘하지만 중요한 건강 패턴을 감지할 수 있을 만큼 정확하다는 것을 확인시켜 주었습니다.
이 연구는 에픽 코스모스가 국가적 규모에서 임신 및 신생아 건강을 이해하는 강력한 도구라는 결론을 내렸습니다. 연구진은 미국을 대표하면서도 규모가 큰, 어머니와 아기에 대한 장기적이고 연결된 뷰를 구축할 수 있음을 입증했습니다. 연속적인 진료 방문을 요구하는 과정이 전체 가족 수를 줄이기는 하지만, 그것이 그룹의 특성을 왜곡하지는 않으므로 결과는 여전히 신뢰할 수 있습니다. 이 작업은 전자 건강 기록이 풍부한 자원이지만, 연구자들이 가장 취약한 환자들을 놓치지 않기 위해(지속적인 케어를 받지 못하는 환자들) 연구 그룹을 선정할 때 주의를 기울여야 함을 강조합니다. 궁극적으로, 이 접근 방식은 수백만 명의 실제 데이터를 사용하여 복잡한 건강 문제를 탐구하는 미래 연구의 문을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.