Benchmarking antibody-antigen co-folding on human monomeric antigens
본 연구는 10가지 항체-항원 공동 폴딩 프로토콜을 평가하기 위해 HuMonoAg-Bench 벤치마크를 도입하며, 최근의 방법들이 CDRH3 모델링을 크게 개선하고 컷오프 이후의 복합체 중 약 절반에 대해 중간 이상의 정확도를 달alan 성했다는 점을 밝히는 동시에, 올바른 결합 모드를 샘플링하고 유연한 루프를 모델링하는 데 있어 여전히 어려움이 존재하여 많은 구조적 이질성을 가진 복합체의 예측을 제한하고 있음을 드러낸다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
인간 면역 체계라는 미시적인 세계에서, 항체는 침입하는 바이러스나 해로운 단백질이 제시하는 자물쇠에 완벽하게 들어맞도록 설계된 매우 전문화된 열쇠 역할을 합니다. 수십 년 동안 과학자들은 이 열쇠와 자물쇠가 화학적 청사진만 보고도 어떻게 맞물리는지 정확히 예측할 수 있기를 꿈꿔왔습니다. 이러한 능력은 연구자들이 실험실에서 모든 버전을 일일이 만들고 테스트할 필요 없이 새로운 약물과 백신을 설계할 수 있게 함으로써 의학을 혁신할 것입니다. 그러나 이 예측은 생물학에서 가장 풀기 어려운 난제 중 하나로 남아 있었습니다. 컴퓨터는 두 단백질이 어떻게 서로 달라붙을지 추측하는 데 매우 뛰어나졌지만, 항체는 특별한 경우입니다. 대부분의 단백질이 파트너와 함께 진화하는 것과 달리, 항체는 독립적으로 진화하기 때문에 컴퓨터가 정확한 추측을 하는 데 도움이 되는 공유된 진화 역사가 부족합니다. 더욱이, 표적을 붙잡는 항체의 부분은 형태가 끊임없이 변하는 유연하고 꿈틀거리는 루프(loop) 형태이기 때문에 표준적인 도구로는 모델링하기가 매우 어렵습니다.
한 연구팀은 최신 세대의 컴퓨터 프로그램들이 이 특정한 문제를 해결하는 데 어디까지 도달했는지 측정하기 위해 연구를 시작했습니다. 그들은 인간 단백질에 결합된 항체의 실제 사례 412개를 수집하여, 컴퓨터 프로그램이 구축되기 전에 본 적 없는 엄격한 테스트 세트를 만들었습니다. 이 새로운 데이터를 대상으로 10가지 예측 방법을 실행한 결과, 가장 최근의 소프트웨어가 비약적인 발전을 이루었으며, 보지 못한 새로운 사례의 약 절반에 대해 올바른 형태를 성공적으로 예측했다는 것을 발견했습니다. 그러나 이 연구는 최신 프로그램들조차 여전히 가장 유연한 부분들을 다루는 데 어려움을 겪고 있으며, 단순히 더 많이 추측한다고 해서 반드시 더 나은 답으로 이어지는 것은 아니라는 점을 밝혀냈습니다. 연구진은 만약 컴퓨터에게 항체가 표적의 어느 지점을 만져야 하는지 정확히 알려줄 수 있다면, 기존의 프로그램들도 최신 프로그램들을 따라잡을 수 있다는 것을 발견했는데, 이는 주요 장애물이 단순히 소프트웨어의 지능 문제가 아니라, 방대한 가능성의 바다 속에서 올바른 시작점을 찾는 능력임을 시사합니다.
연구진은 먼저 HuMonoAg-Bench라고 불리는 벤치마크를 구성했는데, 이는 인간 단백질을 포함하는 412개의 항체 복합체로 이루어진 큐레이션된 라이브러리입니다. 그들은 이 컬렉션을 구조가 발견된 시점에 따라 두 그룹으로 신중하게 나누었습니다. 한 그룹은 278개의 복합체로 구성되었으며, 이는 많은 현대적 예측 도구들의 학습 데이터 컷오프 날짜인 2021년 9월 이전에 공개된 것들입니다. 다른 그룹은 그 날짜 이후에 공개된 134개의 복합체를 포함하여, 컴퓨터 프로그램들이 이 특정 형태들을 결코 본 적이 없음을 보장했습니다. 테스트를 더욱 정밀하게 만들기 위해, 그들은 이 새로운 그룹을 기존 것들과 매우 유사한 항원을 포함하는 경우와 완전히 새로운 항원을 포함하는 경우로 다시 나누었습니다. 이러한 설정은 컴퓨터가 단순히 오래된 사례를 암기하고 있는 것인지, 아니면 진정으로 새로운 상호작용을 예측하는 법을 배우고 있는 것인지를 테스트할 수 있게 해주었습니다. 그 후 그들은 이 데이터셋을 대상으로 두 단백질이 함께 접히는 과정을 시뮬레이션하는 10가지 코폴딩(co-folding) 프로토콜을 실행하여, 예측 결과를 실제 실험 구조와 비교해 얼마나 근접한지 확인했습니다.
결과는 최신 방법들이 기존의 것들에 비해 명확하고 유의미한 개선을 보였음을 나타냈습니다. 보지 못한 새로운 복합체의 구조를 예측할 때, 기존의 소프트웨어는 약 1622%의 사례에서만 올바르거나 근접한 형태를 찾아냈습니다. 반면, Protenix v2, IntelliFold-2, ESMFold2와 같은 가장 진보된 방법들은 동일한 사례의 약 3352%에서 중간 이상의 품질을 가진 모델을 찾는 데 성공했습니다. 가장 뛰어난 성능을 보인 Protenix v2는 표준 항체에 대해 52%의 성공률을 기록했으며, 항원이 익숙한 특정 단일 도메인 항체의 경우에는 훨씬 높은 82%를 달성했습니다. 이러한 진전에도 불구하고, 연구는 거의 절반의 새로운 표적들이 여전히 해결되지 않은 채 남아 있음을 강조하며, 분야가 빠르게 발전하고 있음에도 불구하고 상당수의 항체 상호작용이 여전히 현재 기술의 손길이 닿지 않는 곳에 있음을 나타냈습니다. 연구진은 이러한 개선이 단순히 새로운 프로그램을 더 많은 데이터로 학습시켰기 때문이 아니라, 복잡한 형태를 모델링하는 방식의 근본적인 개선 덕분이라는 점을 언급했습니다.
어떤 예측이 성공하고 어떤 것이 실패했는지에 대한 심층적인 분석은 특정 구조적 특징인 CDRH3 루프를 지목했습니다. 이것은 항체에서 표적과 접촉하는 주요 지점 역할을 하는 유연한 헤어핀 모양의 구조입니다. 연구는 이 단일 루프의 정확도가 예측의 성공 여부를 결정하는 가장 강력한 지표라는 것을 발견했습니다. 컴퓨터는 항원의 딱딱한 부분과 항체의 다른 더 안정적인 루프들을 모델링하는 데는 대체로 능숙했지만, CDRH3 루프는 특히 길 때 가장 구현하기 어려운 구성 요소로 남았습니다. 새로운 방법들은 이 특정 루프를 모델링하는 데서 뚜xt한 개선을 보였으며, 이는 전체적인 성공률의 상승과 직접적인 상관관계를 가졌습니다. 그러나 루프의 국소적 구조가 잘 모델링되었다 하더라도, 그것이 항체 전체가 표적에 대해 올바르게 배치되는 것을 보장하지는 않았는데, 이는 조각들을 제대로 맞추는 것이 전체 퍼즐을 올바르게 조립하는 것과는 다르다는 점을 보여주었습니다.
연구진은 컴퓨터 프로그램에게 항체가 어디에 결합해야 하는지에 대한 힌트를 주었을 때 어떤 일이 일어나는지도 테스트했습니다. 실제 상황에서 과학자들은 항체가 부착되는 표적 단백질의 몇몇 핵심 지점은 알 수 있지만, 항체의 정확한 형태는 모를 수 있습니다. 이러한 제한된 정보를 제약 조건으로 제공함으로써, 기존의 방법들은 성공률이 20~30%포인트 상승하여 가장 강력한 무제약(unconstrained) 방법들의 수준까지 올라섰습니다. 이 발견은 기존 소프트웨어의 주요 한계가 물리학에 대한 이해 부족이 아니라, 수십억 개의 가능성 중에서 올바른 결합 모드를 찾는 능력에 있었음을 시사합니다. 힌트를 통해 탐색 공간이 좁혀지자 기존 프로그램들은 해답을 찾을 수 있었습니다. 그러나 이러한 이점은 제공된 힌트의 정확도에 크게 의존했습니다. 만약 제공된 정보가 부분적으로만 옳다면, 개선 효과는 사라졌습니다.
마지막으로, 팀은 시뮬레이션을 더 많이 실행하는 것이 남은 문제들을 해결할 수 있는지 조사했습니다. 그들은 무제약 방법들의 경우, 주요 문제가 샘플링 실패, 즉 올바른 형태가 생성된 모델 세트에 아예 나타나지 않는 것이라는 점을 발견했습니다. 시뮬레이션 실행 횟수를 늘렸을 때 더 많은 올바른 형태를 찾아내기는 했지만, 컴퓨터의 순위 지정 시스템이 종종 최선의 답을 최상위 답변으로 선택하지 못한다는 사실도 발견했습니다. 이는 새로운 병목 현상을 만들어냈습니다. 즉, 올바른 답이 생성되었음에도 불구하고 소프트웨어가 그것을 최선의 옵션으로 인식하지 못하는 경우가 발생했습니다. 연구는 실행 횟수를 늘리는 것이 도움이 되기는 하지만, 최선의 모델을 올바르게 순위 매기고 선택하는 능력이 모델을 생성하는 능력만큼이나 중요해지고 있다고 결론지었습니다. 해결되지 않은 나머지 사례들은 단 하나의 공통된 특징 없이 다양한 어려운 표적들의 혼합이었으며, 이는 앞으로의 경로가 단 하나의 특정 문제를 고치는 것이 아니라 여러 유형의 도전 과제들을 해결하는 방향이어야 함을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.