← 최신 논문
🧬 biology

OmicFormer: a statistical priors–informed transformer for accurate and generalizable omics prediction of diseases and complex traits

OmicFormer는 통계적 사전 지식을 임베딩하여 복잡한 생물학적 의존성을 포착하는 새로운 트랜스포머 기반 아키텍처로, 다양한 질병 예측 작업과 오믹스 데이터셋 전반에서 기존 방법들을 정확도와 일반화 성능 측면에서 크게 능가합니다.

원저자: Weikang Gong, Hanlin Jiang, Chang Yang, Menghan Qin, Jia You, Jianfeng Feng, Jin-Tai Yu, Wei Cheng

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Weikang Gong, Hanlin Jiang, Chang Yang, Menghan Qin, Jia You, Jianfeng Feng, Jin-Tai Yu, Wei Cheng

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

미래를 예측하려고 노력하고 있다고 상상해 보십시오. 하지만 수정구슬을 들여다보는 대신, 생물학적 데이터가 가득 담긴 거대한 스프레드시트를 들여다보고 있는 것입니다. 이것이 바로 '오믹스(omics)'의 세계입니다. 오로미스는 과학자들이 우리 몸에서 추출한 방대한 측정값의 목록을 수집하는 분야입니다. 예를 들어 혈액 속에 떠다니는 수천 개의 단백질, 대사 과정의 수백 가지 화학 물질, 또는 우리 뇌의 배선에 대한 상세한 지도 같은 것들 말이죠. 이 목록들을 우리의 생물학적 일부를 나타내는 책 한 권 한 권이 담긴 혼란스러운 도서관이라고 생각해 보십시오. 정밀 의료의 목표는 이 책들을 읽어내어, 누군가가 미래에 당뇨병이나 심장병 같은 병에 걸릴 가능성이 있는지 예측함으로써 조기에 도움을 받을 수 있도록 하는 것입니다.

하지만 이 도서관을 읽는 것은 매우 어렵습니다. 책들은 엉망이고, 책들 사이의 연결 고리는 복잡하며, 정보는 종종 수백 페이지에 걸쳐 흩어져 있습니다. 오랫동안 과학자들은 이 데이터를 분류하기 위해 표준적인 도구들을 사용해 왔는데, 이는 마치 건초더미에서 바늘을 찾기 위해 단순한 규칙책을 사용하는 것과 같았습니다. 이러한 도구들도 훌륭했지만, 신체의 서로 다른 부분들 사이에 존재하는 미묘하고 장거리적인 연결을 놓치는 경우가 많았습니다. 또한 환자가 다른 병원에서 온 경우처럼 데이터가 약간만 변해도 이 도구들은 어려움을 겪었습니다. 여기서 새로운 아이디어가 등장합니다. 만약 우리가 컴퓨터에게 단순히 책을 읽는 법을 가르치는 것이 아니라, 우리 생물학이 실제로 작동하는 방식의 숨겨진 패턴을 사용하여 그 책들이 함께 들려주는 이야기를 이해하도록 가르칠 수 있다면 어떨까요?

이것이 바로 OmicFormer를 개발한 연구진이 의도한 바입니다. 그들은 이 무질서한 생물학적 스프레드시트를 이해하기 위해 설계된 새로운 종류의 인공지능(AI)을 구축했습니다. 모든 데이터를 고립된 사실으로 취급하는 대신, OmicFormer는 분석을 시작하기도 전에 데이터를 정리하는 영리한 트릭을 사용합니다. 여러분이 새로운 언어를 배우고 있다고 상상해 보십시오. 만약 사전의 단어들을 단순히 알파벳 순서대로 암기한다면, 단어들이 어떻게 연관되는지 보기 어렵습니다. 하지만 "커피"와 "컵"처럼 자주 함께 쓰이는 단어들을 바로 옆에 배치하도록 사전을 재구성한다면, 그 패턴은 명확해집니다. OmicFormer도 이와 유사한 작업을 수행합니다. 이 모델은 두 가지 "통계적 사전 지식(statistical priors)"—수학에 기반한 똑똑한 추측이라는 뜻입니다—을 사용하여 생물학적 데이터를 재배열합니다.

첫째, 각 요소가 특정 질병을 얼마나 잘 예측할 수 있는지에 따라 데이터를 정렬합니다. 둘째, 복잡한 수학적 지도(그로모프-와서스타인 최적 운송, Gromov–Wasserstein optimal transport라고 불림)를 사용하여 동일한 팀에서 일하는 단백질처럼 자연스럽게 함께 움직이는 생물학적 특징들을 그룹화합니다. 이렇게 깔끔하게 정리된 데이터를 챗봇이 인간의 대화를 이해하는 데 도움을 주는 것과 같은 기술인 "트랜스포머(Transformer)"라는 강력한 AI 엔진에 입력함으로써, 모델은 다른 방식들이 놓치는 연결 고리를 포착할 수 있습니다. 이는 마치 AI에게 단순히 도서관을 추측하라고 요구하는 대신, 어떤 책들이 서로 관련되어 있는지 보여주는 도서관 지도를 제공하는 것과 같습니다.

연구진은 이 새로운 AI를 약 50만 명의 정보를 포함하고 있는 UK 바이오뱅크(UK Biobank)의 방대한 데이터셋을 통해 테스트했습니다. 그들은 OmicFormer에게 단백질, 대사, 뇌 스캔 데이터를 사용하여 450가지의 서로 다른 질병의 위험을 예측하고 900가지의 서로 다른 건강 특성을 추정하도록 요청했습니다. 결과는 인상적이었습니다. OmicFormer는 과학자들이 수년간 의존해 온 대중적인 "트리 기반(tree-based)" 방식들을 포함하여 기존의 가장 뛰어난 도구들을 일관되게 능가했습니다. 예를 들어, 단백질 데이터를 사용하여 질병을 예측할 때, OmicFormer는 차세대 최고 방법보다 정확도를 약 3.5% 향상시켰습니다. 이것이 작게 들릴 수도 있지만, 희귀하거나 복잡한 질병을 예측하는 세계에서는 문제를 조기에 발견하느냐 놓치느냐를 결정짓는 엄청난 도약이 될 수 있습니다.

이 발견을 더욱 흥eli하게 만드는 것은 이 모델이 실제 세계의 무질서함을 처리하는 방식입니다. 연구진은 단순히 훈련된 데이터만을 테스트한 것이 아니라, 완전히 다른 데이터셋을 던져주었습니다. 그들은 글로벌 신경퇴행성 단백질 컨소시엄(Global Neurodegeneration Proteomics Consortium)의 별도 집단과 전 세계 다른 병원들의 뇌 스캔 데이터를 사용하여 테스트했습니다. 데이터가 약간 다르게 보이는 이러한 "낯선" 환경에서도 OmicFormer는 비틀거리지 않았습니다. 모델은 기존 방식들보다 계속해서 더 나은 성능을 유지했는데, 이는 OmicFormer가 단순히 보여준 특정 사례들을 암기한 것이 아니라 생물학의 '규칙'을 학습했음을 시사합니다. 이는 의학에서, 한 병원에서만 작동하는 도구는 그리 유용하지 않다는 점에서 매우 중요합니다.

연구진은 또한 AI가 단순히 추측하는 것이 아님을 확인하기 위해 AI가 어떻게 결정을 내리는지 조사했습니다. 그들은 OmicFormer가 심장 질환이나 염증과 관련된 특정 단백질처럼 의사들이 이미 중요하다고 알고 있는 생물학적 표지자들을 강조한다는 것을 발견했습니다. 이는 과학자들에게 AI가 실제 생물학적 신호를 찾아내고 있다는 확신을 줍니다. 또한, 연구진은 AI에게 여러 질병을 동시에 보도록 가르침으로써(멀티태스크 학습이라 불리는 기술), 더 흔한 질병으로부터 지식을 빌려와 희귀 질환을 더욱 잘 예측할 수 있음을 보여주었습니다.

요약하자면, OmicFormer는 생물학적 데이터의 자연스러운 구조를 존중하고 분석 전에 지능적으로 정리함으로써, 더 정확할 뿐만 아니라 다양한 집단에 적용했을 때 더 신뢰할 수 있는 AI 모델을 구축할 수 있음을 시사합니다. 이 모델이 모든 의학적 미스터리를 해결했다고 주장하는 것은 아니지만, 우리 건강의 복잡한 이야기를 읽어내는 강력한 새로운 방법을 제시하며, 이는 광범위한 질병에 대해 더 나은 예측과 조기 개입으로 이어질 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →