Data Independent Acquisition Pipeline for Microbiome Samples (Microbe-DIA)
본 논문은 경험적 스펙트럼 라이브러리에 의존하지 않고도 샘플 처리량과 정량적 성능을 향상시키기 위해 개선된 LC–MS/MS 획득 파라미터와 계산 효율적인 라이브러리 프리(library-free) 데이터 독립 획득(DIA) 워크플로를 결합한, 최적화되고 확장 가능하며 비용 효율적인 마이크로바이옴 메타프로테오믹스 파이프라인을 제시한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
미생물은 우리 토양과 해양, 심지어 우리 몸속에서도 살아가는 세상의 보이지 않는 설계자입니다. 이 작은 공동체가 실제로 무엇을 하고 있는지—어떻게 폐기물을 분해하고, 영양분을 순환시키며, 인간의 건강에 영향을 미치는지—이해하기 위해 과학자들은 그들이 만들어내는 단백질을 관찰합니다. 단백질은 생명의 기능적 일꾼이며, 유기체가 생존하는 데 필요한 과업을 수행하는 기계입니다. 그러나 수천 종의 서로 다른 종이 뒤섞인 군중 속에서 이 단백질들을 연구하는 것은 매우 어렵습니다. 이는 마치 사람들이 한꺼번에 소리를 지르는 경기장 안에서 단 하나의 대화를 들으려고 노력하는 것과 같습니다. 종의 수가 너무나 다양하고 각 종의 존재량이 극명하게 차이 나기 때문에, 공동체의 활동을 명확한 그림으로 포착하기가 어렵습니다.
수년 동안 이러한 단백질을 연구하는 표준적인 방법은 마치 스포트라이트처럼 가장 큰 목소리를 하나씩 골라내는 방식이었습니다. 이 접근법은 단순한 샘플에는 잘 작동하지만, 복잡한 마이크로바이옴에서는 더 작고 덜 풍부한 목소리들을 놓치게 되어 데이터에 큰 공백을 남깁니다. 데이터 독립적 획득(data-independent acquisition)이라고 알려진 새로운 접근법은 전체 소리 스펙트럼을 넓은 구간으로 나누어 모든 사람의 목소리를 한꺼번에 들으려고 시도합니다. 이 방법은 훨씬 더 많은 정보를 포착하지만, 역사적으로 대규모 연구를 수행하기에는 너무 느렸으며, 소음을 해석하기 위해 미리 만들어진 방대한 라이브러리가 필요했습니다. 그러한 라이브러리가 없으면 데이터가 너무 복잡해져서, 특히 자연 환경에서 발견되는 방대한 유전적 다양성을 다룰 때 문제가 되었습니다.
퍼시픽 노스웨스트 국립연구소(Pacific Northwest National Laboratory)의 연구팀은 이러한 문제들을 해결하여, 기존의 라이브러리 없이도 복잡한 미생물 공동체를 빠르고 정확하게 분석할 수 있는 간소화된 파이프라인을 개발했습니다. 그들은 46개의 서로 다른 박테리아 균주에서 유래한 펩타이드를 혼합하여 정교하게 구성된 마이크로바이옴 모델을 사용하여 이 방법을 테스트했습니다. 이 모델은 어떤 종이 어떤 비율로 존재하는지 정확히 알고 있는 통제된 환경으로서, 연구진의 새로운 방법이 이들을 정확히 식별하고 측정할 수 있는지 검증하는 역할을 했습니다.
연구진은 먼저 단백질의 무게를 재고 식별하는 데 사용되는 기기인 질량 분석기의 설정을 최적화했습니다. 그들은 단백질 파편을 포착하는 데 사용되는 "창(window)"의 크기가 결정적이라는 것을 발견했습니다. 더 좁은 창을 사용함으로써 신호를 더 명확하게 분리할 수 있었고, 넓은 창을 사용할 때보다 훨씬 더 많은 단백질을 식별해 냈습니다. 그런 다음 그들은 이 새로운 빠른 방법을 전통적인 느린 방식과 비교했습니다. 전통적인 방식은 샘플을 12개의 부분으로 나누어 각각 2시간씩 분석해야 했으므로, 단 하나의 샘플을 분석하는 데 총 하루의 기기 시간이 소요되었습니다. 반면, 새로운 방식은 단 6시간 만에 전체 샘플을 분석했습니다. 시간을 기준으로 조정했을 때, 새로운 방식은 기존 방식보다 시간당 거의 9배 더 많은 단백질을 식별해 냈으며, 이는 속도가 정확도를 희생시키지 않는다는 것을 입증했습니다.
방대한 잠재적 단백질 데이터베이스를 검색하는 계산적 도전을 해결하기 위해, 연구팀은 '라이브러리 없는 DIA를 이용한 메타프로테오믹스 분석(Metaproteomic Analysis with DIA Library-free, MADL)'이라 불리는 2단계 프로세스를 만들었습니다. 첫 번째 단계는 필터 역할을 하여, 에너지 생산이나 DNA 복제와 같이 거의 모든 박테리아에 공통적인 가장 필수적인 생물학적 경로로 검색 범위를 좁힙니다. 이는 컴퓨터가 검색해야 할 데이터베이스의 크기를 획기적으로 줄여줍니다. 일단 컴퓨터가 핵심 기능을 바탕으로 어떤 생물체가 존재하는지 식별하면, 그 목록을 사용하여 두 번째 단계에서 탐색을 정교화하며, 탐지된 생물체의 구체적인 기능에 집중합니다. 이 접근법을 통해 연구진은 토양 및 장내 환경에서 유래한 수백만 개의 단백질이 포함된 데이터베이스를 대상으로 검색했음에도 불구하고, 테스트 혼합물에 알려진 28개 종 중 25개 종을 성공적으로 식별해 냈습니다.
또한 연구는 서로 다른 종들 사이에서 매우 유사해 보이는 단백질들을 어떻게 처리할 것인가를 다루었습니다. 논리적인 방법을 사용하여 이러한 공유 단백질들을 가장 가능성 높은 출처에 할당함으로써, 연구팀은 이전보다 수천 개의 더 많은 단백질의 양을 정량화할 수 있었습니다. 그들은 자신들의 방법이 테스트 혼합물 내의 균주 비율과 일치하도록 미생물 공동체의 구성을 정확하게 재구성할 수 있음을 확인했습니다. 나아가, 연구팀은 이 워크플로우를 더 빠르고 새로운 질량 분석기인 Astral에서 테스트했으며, 수천 개의 단백질을 높은 정밀도로 식별하면서도 1시간 남짓 만에 분석을 완료할 수 있음을 발견했습니다.
이 연구는 맞춤형 라이브러리를 제작하거나 기기 사용에 며칠을 소비해야 하는 병목 현상 없이, 대규모의 고처리량 미생물 공동체 연구를 수행하는 것이 이제 가능하다는 것을 보여줍니다. 연구진은 최적화된 기기 설정과 스마트한 2단계 계산 전략을 결합함으로써, 미생물 공동체의 포괄적인 기능을 포착할 수 있음을 보여주었습니다. 이는 미생물 공동체가 시간의 흐름에 따라 또는 다양한 환경 조건에 반응하여 어떻게 변화하는지를 이전에는 도달할 수 없었던 세부 수준의 속도로 연구할 수 있는 길을 열어줍니다. 이 방법은 단순히 어떤 미생물이 존재하는지를 나열하는 수준을 넘어, 그들이 거주하는 복잡한 생태계에서 정확히 무엇을 하고 있는지 이해할 수 있는 실용적이고 확장 가능한 방법을 제공합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.