Towards reconstruction of the human interactome from positive and negative experimental evidence
본 논문은 단백질 상호작용(PPI) 스크리닝의 실험적 탐색 공간을 재구성하여 상호작용하지 않을 가능성이 높은 단백질 쌍을 추론함으로써, 더 나은 오차율 추정, 모델 보정, 그리고 더욱 정확하고 완전한 인간 인터랙톰 매핑을 위한 머신러닝 학습을 가능하게 하는 방법론을 제시한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
모든 살아있는 세포 내부에는 수천 개의 단백질이 떠다니며 충돌하고, 끊임없이 서로를 붙잡기 위해 손을 뻗습니다. 두 단백질이 결합하면 구조물을 만들거나, 신호를 보내거나, 노폐물을 분해할 수 있는 하나의 팀을 형성합니다. 이러한 파트너십은 단백질-단백질 상호작 작용(protein-protein interactions)으로 알려져 있으며, 생명의 근본적인 배선입니다. 이것이 없다면 세포는 조직화된 기계가 아니라 그저 부품들의 무질서한 집합체에 불나지 않을 것입니다. 수십 년 동안 과학자들은 이러한 연결 관계를 지도화하여, 인체 내에서 누가 누구와 대화하는지를 보여주는 거대한 네트워크 다이어그램을 만들기 위해 노력해 왔습니다. 이 지도는 우리 몸이 건강할 때 어떻게 작동하는지, 그리고 질병 상태에서 어떻게 무너지는지를 설명하는 데 도움을 줍니다. 하지만 현재 이 지도는 구멍과 오류로 가득 차 있습니다. 우리는 수백만 개의 이러한 연결을 알고 있지만, 보고된 연결 중 상당수가 실수이며, 실제 연결 중 많은 것이 누락되었다는 것도 알고 있습니다. 가장 큰 문제는 과학자들이 성공적인 만남만을 기록했다는 점입니다. 그들은 어떤 단백질들이 악수를 나누었는지는 기록했지만, 어떤 단백질들이 서로 옆에 있었음에도 불구하고 서로를 무시했는지는 거의 기록하지 않았습니다.
이러한 침묵은 사각지대를 만듭니다. 만약 당신이 만남이 일어난 경우만을 안다면, 그 만남이 드물고 특별한 사건이었는지 아니면 그저 운 좋은 우연이었는지 구분할 수 없습니다. 더 심각한 것은, 컴퓨터를 사용하여 새로운 만남을 예측하려고 할 때, 컴퓨터에게 '만남이 일어나지 않은 경우'가 어떤 모습인지 가르쳐야 한다는 점입니다. 보통 과학자들은 두 단백질이 함께 발견되지 않았다고 해서 그들을 낯선 사이라고 가정함으로써 컴퓨터를 가르칩니다. 하지만 이는 위험한 추측입니다. 단지 두 단백질이 함께 테스트되지 않았다고 해서 그들이 상호작용하지 않는다는 뜻은 아닙니다. 단지 아무도 그들을 같은 방에 넣어준 적이 없을 뿐일 수도 있습니다. 이를 해결하기 위해, 한 연구팀은 이 실험들의 누락된 역사를 재구성하기로 했습니다. 그들은 단백질들이 테스트되었으나 연결에 실패했던 모든 보이지 않는 기록을 찾아내고자 했습니다.
연구진은 이미 발표된 5,500개 이상의 서로 다른 실험 결과들을 모아 방대한 기존 데이터를 바탕으로 시작했습니다. 이 실험들은 두 가지 주요 방법을 사용했습니다. 하나는 시험관 안에서 단백로를 섞는 방식이고, 다른 하나는 효모 세포 안에서 단백질을 배양하는 방식입니다. 이러한 실험에서 과학자들은 보통 하나의 '미끼(bait)' 단백질을 여러 개의 '먹이(prey)' 단백질에 대해 테스트하여 어떤 것들이 달라붙는지 확인합니다. 표준적인 관행은 성공적으로 달라붙은 경우만을 보고하는 것이었습니다. 그러나 연구팀은 성공적으로 달라붙은 목록이 사실 실패에 대한 숨겨진 단서를 포함하고 있다는 점을 깨달았습니다. 만약 특정 먹이 단백질이 시험관 내의 특정 미끼 단백질에 달라붙는 것이 발견되었다면, 그것은 해당 먹이 단백질이 그 특정 실험에 존재했으며 정상적으로 작동하고 있었다는 증거가 됩니다. 따라서 만약 동일한 먹이 단백질이 같은 시험관 안에 있었음에도 불구하고 다른 미끼 단백질에는 달라붙지 않았다면, 그것은 진정한 '붙지 않음(non-stick)'이어야 합니다. 연구팀은 성공적인 연결을 활용하여 실험이 진행된 전체 공간을 지도화함으로써, 어떤 단백질들이 테스트되었으나 연결에 실패했는지를 추론할 수 있었습니다.
이러한 논리를 사용하여, 연구진은 약 50만 개의 보고된 상호작용 목록을 거의 1억 8,200만 개의 개별 테스트를 포함하는 훨씬 더 큰 데이터셋으로 전환했습니다. 이를 통해 그들은 테스트되었으나 상호작용을 발견한 쌍과, 테스트되었으나 상호작용하지 않는 것으로 밝혀진 쌍을 구분해 낼 수 있었습니다. 연구진은 가장 신뢰할 수 있는 데이터, 즉 여러 번 테스트된 쌍들에 집중했습니다. 그들은 최소 세 번 이상 테스트되었음에도 불구하고 연결의 징후를 전혀 보이지 않은 1,800만 개 이상의 쌍을 식별해 냈습니다. 이것은 추측이 아닙니다. 실험적으로 확인된 '비연결(non-connections)'입니다. 또한 연구팀은 반복적으로 테스트되었음에도 지속적으로 연결을 보여준 6,000개 이상의 쌍을 발견하여, 이러한 상호작용이 실제라는 높은 확신을 얻었습니다.
연구진은 이 새롭게 발견된 비연결들이 생물학적으로 타당한지 확인했습니다. 그들은 상호작용하는 단백질들이 세포의 동일한 부분에 거주하거나 유사한 기능을 수행하는 것과 같은 공통된 특성을 공유하는지, 반면 상호작용하지 않는 쌍들은 그렇지 않은지를 살펴보았습니다. 결과는 기대와 완벽하게 일치했습니다. 확인된 상호작용 쌍들은 확인된 비상호작용 쌍들보다 이러한 특성을 공유할 가능성이 훨씬 높았습니다. 이 검증은 그들의 방법이 효과적이었음을 입증했습니다. 즉, 연구팀은 이전에 소실되었던 부정적 증거의 층을 성공적으로 복구한 것입니다. 그들은 연결에 실패한 단백질들이 실제로 연결된 단백질들과 기능적으로 다르다는 것을 발견했으며, 이는 재구성된 데이터가 단순한 무작위 소음이 아니라 생물학적 실체를 반영하는 진정한 기록임을 확인시켜 주었습니다.
이 새롭고 검증된 비연결 목록을 가지고, 연구팀은 과학자들이 네트워크를 연구하는 데 사용하는 도구들을 어떻게 개선할 수 있는지 테스트했습니다. 첫째, 그들은 이 데이터를 사용하여 다른 대규모 실험의 정확도를 점검했습니다. 이 새로운 '부정적' 쌍들이 다른 연구들에서 얼마나 자주 나타나는지를 확인함으로써, 그 연구들이 얼마나 많은 가짜 알람을 생성했을지 계산할 수 있었습니다. 그 결과 일부 실험의 오류율이 40%에 달한다는 것을 발견했는데, 이는 보고된 연결 중 상당 부분이 실수일 수 있음을 의미합니다. 이는 향로의 실험을 보정하고 정화할 수 있는 새로운 방법을 제공합니다. 둘째, 연구팀은 상호작용을 예측하도록 설계된 컴퓨터 모델에 이 데이터를 적용했습니다. 무작위 추측 대신 이 실제 세계의 부정적 데이터를 사용하여 모델을 훈련시켰을 때, 모델들은 더 다르고 뚜렷한 예측을 만들어냈습니다. 무작위 추측을 사용하여 훈련된 모델보다 실제 부정적 데이터를 사용하여 훈련된 모델이 동일한 실수를 저지를 가능성이 낮았으며, 이는 무엇이 일어나는지를 컴퓨터에게 가르치기 위해서는 무엇이 일어나지 않는지에 대한 진정한 기록을 갖는 것이 필수적임을 시사합니다.
또한 이 연구는 단백질 자체에 대해 놀라운 사실을 밝혀냈습니다. 어떤 단백질들은 닿는 모든 것에 달라붙는 생물학적 접착제처럼 행동하는 반식이며, 어떤 것들은 효모 실험에서 가짜 알람을 유발하는 '자동 활성제(auto-activators)'입니다. 특정 단백질이 얼마나 많은 다양한 파트너를 대상으로 테스트되었는지, 그리고 얼마나 자주 연결에 실패했는지를 살펴봄으로써, 연구팀은 이러한 문제적 단백질들을 식별할 수 있었습니다. 그들은 알려진 문제아들이 파트너에 상관없이 무차별적으로 연결되는 경향이 있는 단백질들이라는 점을 발견했습니다. 이는 향후 연구에서 이러한 노이즈가 많은 단백질을 식별하고 걸러낼 수 있는 새로운 방법을 제공하며, 더 깨끗하고 정확한 지도를 만드는 데 기여합니다.
마지막으로, 연구진은 이 데이터를 사용하여 인류 상호작용 네트워크의 전반적인 형태를 재고했습니다. 오랫동안 과학자들은 소수의 단백질은 수천 개의 연결을 가지고 대부분의 단백질은 매우 적은 연결을 갖는 특정 수학적 패턴을 따른다고 믿어 왔습니다. 그러나 연구팀이 일부 단백질이 다른 단백질보다 단순히 더 자주 테스트되었다는 점을 보정하자, 이 패턴은 사라졌습니다. 대신 연결 분포는 종 모양의 곡선(bell curve)에 더 가까워졌으며, 이는 이전의 지도에서 보였던 극단적인 '허브(hubs)'들이 생물학적 특징이라기보다는 실험 방식에 의한 인공물(artifact)일 수 있음을 시사합니다. 이 발견은 우리 세포 네트워크가 어떻게 구축되어 있는지에 대한 오랜 가설에 도전합니다.
이 연구가 인류 인터랙톰(interactome)의 지도를 완성했다고 주장하는 것은 아닙니다. 실제 네트워크는 여전히 방대하며 대부분 탐구되지 않은 상태입니다. 그러나 실패한 실험의 역사를 복구함으로써, 연구팀은 퍼즐의 결정적인 조각을 제공했습니다. 그들은 증거의 부재가, 적절히 재구성될 때, 곧 부재의 증거가 될 수 있음을 보여주었습니다. 수백만 개의 확인된 비연결을 포함하는 이 새로운 자원은 이제 다른 과학자들이 사용할 수 있도록 공개되었습니다. 이는 더 나은 컴퓨터를 훈련시키고, 더 나은 실험을 보정하며, 궁극적으로 인체가 가장 근본적인 수준에서 어떻게 기능하는지에 대한 더 정확하고 완전한 그림을 그릴 수 있는 방법을 제시합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.