Making Accelerating Medicines Partnership Data Findable and Interoperable through a Common Data Model: Extending OMOP for Multi-Source Multimodal Data
이 논문은 연합 데이터 생태계 내에서 가속화된 의약품 개발 파트너십(Accelerating Medicines Partnership)의 다중 모달 오믹스(multi-modal -omics) 데이터에 대한 발견 가능성과 상호 운용성을 가능하게 하기 위해 OMOP 프레임워크를 확장한 SysBio 공통 데이터 모델의 설계, 구현 및 AI 보조 조화 워크플로를 기술한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
현대 의학은 우리 세포 내부의 분자적 지침을 읽는 능력에 의해 점점 더 가속화되고 있습니다. 과학자들은 이제 수천 개의 이러한 지침을 동시에 측정할 수 있으며, 건강한 사람들의 유전자가 어떻게 행동하는지, 그리고 알츠하이머나 당뇨병과 같은 질병이 있는 사람들에게서 어떻게 변하는지를 설명하는 방대한 데이터 라이브러리를 구축할 수 있습니다. 흔히 "오믹스(omics)" 데이터라고 불리는 이러한 측정값은 인체의 내부 작동 원리를 들여다볼 수 있는 강력한 창을 제공합니다. 그러나 중대한 문제가 발생했습니다. 데이터는 존재하지만, 파편화되어 있다는 점입니다. 서로 다른 연구 프로젝트들이 각기 다른 디지털 형식과 고유한 라벨 및 파일 시스템을 사용하여 그들의 발견을 저장하고 있습니다. 이는 마치 도시의 모든 도서관이 책을 목록화하기 위해 서로 다른 언어를 사용하는 것과 같아서, 연구자가 여러 선반을 동시에 읽어야 하는 질문을 던지기가 거의 불으로 불가능하게 만듭니다. 이러한 파편화는 과학자들이 한 질병에서 발견된 생물학적 패턴이 다른 질병에서도 나타나는지와 같은 더 큰 그림을 보는 것을 방해합니다.
이를 해결하기 위해, 정부 기관과 민간 기업 간의 협력체인 가속 의약품 파트너십(Accelerating Medicines Partnership)의 연구진은 이 복잡한 생물학적 데이터를 위한 보편적인 파일 시스템을 구축하기 위해 나섰습니다. 그들은 새로운 언어를 처음부터 발명하지 않았습니다. 그것은 과학계가 채택하기에 느리고 어려울 것이기 때문입니다. 대신, 그들은 임상 건강 기록을 정리하기 위해 이미 널리 사용되는 기존 시스템을 가져와 분자 데이터의 독특한 요구 사항을 처리할 수 있도록 세심하게 확장했습니다. "SysBio 공통 데이터 모델(SysBio Common Data Model)"이라 불리는 이 새로운 프레임워크는, 원래의 데이터 소유자들이 파일 저장 방식을 변경하도록 강요하지 않으면서도 서로 다른 출처의 데이터를 나란히 비교할 수 있게 해주는 번역기 역할을 합니다. 연구팀은 이 접근 방식이 작동함을 네 가지 서로 다른 질병 프로젝트의 데이터를 성공적으로 매핑함으로써 입증했으며, 이를 통해 연구자들이 단일한 통합 쿼리를 사용하여 서로 다른 조건과 조직에 걸쳐 광범위한 질문을 던질 수 있음을 증명했습니다.
이 작업의 핵심은 유연성과 구조 사이의 영리한 타협에 있습니다. 연구진은 진단, 약물, 병원 방문과 같은 환자 기록을 정리하기 위해 전 세계 수천 명의 조사관으로부터 이미 신뢰받고 있는 표준 시스템인 OPRO(Observational Medical Outcomes Partnership) 모델에서 시작했습니다. 이 시스템은 임상 이력을 설명하는 데는 탁월했지만, 분자 실험이 어떻게 수행되었는지 또는 결과 디지털 파일이 어디에 저장되어 있는지 설명하는 데 필요한 구체적인 도구가 부족했습니다. 이를 기존 시스템을 깨뜨리지 않고 해결하기 위해, 팀은 데이터베이스 구조에 단 네 개의 새로운 테이블을 추가했습니다. 이 새로운 섹션들은 사용된 기계의 유형이나 특정 프로토ло(protocol)와 같은 실험 자체에 대한 세부 정보를 기록하거나, 실제 원시 데이터가 담긴 디지털 파일의 위치를 가리키는 특수 폴더 역할을 합니다. 이 새로운 폴더들을 표준 연결을 통해 기존 환자 기록에 연결함으로써, 모델은 분자 분석에 필요한 맥락을 추가하면서도 기존 임상 데이터의 무결성을 보존합니다.
이러한 설계 선택은 의도적이고 실용적이었습니다. 연구진은 알츠하이머, 파킨슨병, 자가면역 질환을 포함한 네 가지 주요 질병 영역에 걸친 11개의 서로 다른 데이터 세트를 대상으로 새 모델을 테스트했습니다. 이 데이터 세트들은 기원 측면에서 매우 다양했으며, 사망 전후의 환자로부터 수집된 뇌 조직, 혈액, 소변 정보를 포함하고 있었습니다. 이러한 차이에도 불구하고, 새 모델은 이들을 모두 하나의 공유된 구조로 성공적으로 가져왔습니다. 그 결과, 과학자는 "루푸스 환자의 신장 샘플에서 유전자 활동 파일을 찾아라"와 같은 복잡한 질문을 던질 수 있으며, 컴퓨터는 환자의 진단에서 특정 조직 샘상, 실험, 그리고 최종 디지털 파일에 이르기까지의 경로를 추적할 수 있습니다. 이 모든 과정은 데이터가 생성된 원래 프로젝트의 고유한 특징을 알 필요 없이 이루어집니다.
이 시스템을 작동하게 만든 결정적인 부분은 데이터를 설명하는 단어들이 어디에서나 동일한 의미를 갖도록 보장하는 것이었습니다. 과거에는 한 프로젝트에서는 특정 질병 단계를 "3단계"라고 부르고 다른 프로젝트에서는 "C등급"이라고 불러 결과를 결합할 때 혼란을 초래하곤 했습니다. 이를 방지하기 위해, 팀은 각 용어가 정확히 무엇을 의미하고 어떻게 기록되어야 하는지를 정의하는 사전 역할을 하는 중앙 레지스트리를 만들었습니다. 그들은 인공지능과 인간 전문가를 결합한 워크플로우를 사용하여, 원래 프로젝트의 무질서하고 다양한 용어들을 깨끗하고 표준화된 정의로 매핑했습니다. AI가 연결을 제안하면 인간 전문가가 이를 검토하여 정확성을 확보함으로써, 오래되고 격리된 데이터와 새롭고 통합된 모델 사이의 신뢰할 수 있는 가교를 만듭니다. 이 과정은 연구자가 두 가지 서로 다른 연구의 데이터를 볼 때, 진정으로 '사과와 사과를 비교(apples to apples)'하고 있는지 확인해 줍니다.
이 프로젝트의 성공은 모든 참여자가 현재의 방식을 포기할 필요 없이 대규모 과학적 협력이 진행될 수 있음을 시사합니다. 이 모델은 데이터 호스트가 파일을 이동하거나 데이터베이스 형식을 변경하도록 요구하지 않습니다. 대신, 기존 데이터 위에 조직화된 계층을 제공하여 다른 사람들이 데이터를 찾고 사용할 수 있게 합니다. 연구진은 이 접근 방식이 조직의 유형부터 데이터를 생성한 기계에 이르기까지 현대 생물학의 복잡성을 다룰 수 있음을 보여주었습니다. 현재 버전은 특정 분자 테스트에 집중하고 있지만, 설계 자체는 성장할 수 있도록 만들어졌습니다. 연구팀은 전체 시스템을 재구축하는 대신, 기존 프레임워크에 더 구체적인 세부 사항을 추가함으로써 공간 이미징이나 다른 화학적 측정값과 같은 새로운 유형의 데이터를 추가할 수 있는 경로를 제시했습니다.
궁극적으로, 이 작업은 서로 다른 질병 간의 연결 고리를 탐구하는 방식의 변화를 가져옵니다. 이 어려운 통합 프로젝트를 단순한 검색 쿼리로 전환함으로써, 새 모델은 발견의 주요 장벽을 제거합니다. 이를 통해 연구자들은 이전에 고립되어 연구되었던 조건들 사이에서 공유된 생물학적 징후를 찾아낼 수 있으며, 이는 여러 가지 다른 질병을 가진 환자들을 도울 수 있는 새로운 치료 표적을 밝혀내는 잠재력을 가집니다. 시스템은 새로운 기술이 등장함에 따라 적응할 수 있을 만큼 충분히 유연하며, 방대하고 늘어나는 생물 의학 데이터를 최대한 활용할 수 있도록 보장합니다. 연구진은 이 청사진과 이를 사용할 수 있는 도구를 공개하여, 더 넓은 과학계가 이 토대 위에 구축하고 복잡한 생물학적 데이터를 모두가 접근 가능하게 만드는 작업을 계속할 수 있도록 초대하고 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.