← 최신 논문
🧬 biology

Frequent Hitter Prediction Beyond Classification Models

본 연구는 경험적 베이즈 보정된 적중률(hit rates)의 직접 회귀와 다중 라벨 집계 전략이 고처리량 스크리닝에서 빈번한 적중자(frequent hitters)를 예측하는 데 있어 전통적인 임계값 특정 이진 분류보다 우수함을 입증하며, 이는 초기 농축과 전역 순위 지표를 개선하는 더욱 견고하고 컷오프에 구애받지 않는 접근 방식을 제공한다.

원저자: Samuli Näppi, Steffen Renner, Jutta Blank, Ansgar Schuffenhauer, Paul Selzer

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Samuli Näppi, Steffen Renner, Jutta Blank, Ansgar Schuffenhauer, Paul Selzer

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ⚕️ 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기

신약 개발의 초기 단계에서 과학자들은 고처리량 스크리닝(high-throughput screening)이라는 대규모 실험을 수행합니다. 로봇이 수십만 개의 작은 화학 분자들을 질병을 일으키는 단백질에 달라붙거나 해로운 세포 과정을 방해할 가능성이 있는지 테스트하는 실험실을 상상해 보십시오. 목표는 미래의 의약품으로서 진정한 가능성을 보여주는 희귀한 '히트(hits)' 즉, 분자들을 찾아내는 것입니다. 하지만 이 과정에는 노이즈가 많습니다. 많은 분자가 가짜 알람을 만들어냅니다. 어떤 것들은 실험을 방해하는 방식으로 뭉치기도 하고, 어떤 것들은 장비와 화학적으로 반응하며, 또 어떤 것들은 단순히 기계가 결과를 읽는 방식에 간섭하기도 합니다. 이러한 문제아들을 '빈번한 히터(frequent hitters)'라고 부릅니다. 이들은 강력한 약물이라서가 아니라 화학적으로 시끄럽기 때문에 수십 또는 수백 개의 서로 다른 테스트에서 활성 반응을 보입니다. 연구자들이 이러한 노이즈가 섞인 화합물을 진짜 약물 후보와 구별하지 못하면, 막다른 길을 쫓느라 시간과 돈을 낭비하게 됩니다. 과제는 값비싼 실험을 시작하기 전에 신호에서 노이즈를 걸러내어, 이러한 빈번한 히터들을 조기에 포착할 수 있는 시스템을 구축하는 것입니다.

수년 동안 이 문제를 다루는 표준적인 방법은 명확한 선을 긋는 것이었습니다. 과학자들은 한 분자가 모든 테스트에서 얼마나 자주 히트로 나타나는지 계산한 다음 고정된 컷오프(기준점)를 설정했습니다. 만약 분자의 히트율이 그 선보다 높으면 '빈번한 히터'로 분류하여 버렸고, 그보다 낮으면 유지했습니다. 이 접근 방식은 단순하지만 중대한 결함이 있습니다. 이는 결정을 단순한 예/아니오의 문제로 취급하여, 선 근처에 위치한 분자들에 대한 귀중한 정보를 버리게 만듭니다. 기준선보다 아주 약간 높은 분자는 엄청난 위반자와 똑같이 취급되는 반면, 기준선 바로 아래에 있는 분자는 문제가 될 위험이 있음에도 불구하고 완벽하게 안전한 것으로 취급됩니다. 게다가, 만약 연구소가 규칙을 변경하여 더 엄격하거나 완화된 기준을 적용하고 싶다면, 완전히 새로운 컴퓨터 모델을 처음부터 다시 만들어야 합니다. 이러한 경직성은 과학자들이 가장 유망한 리드(leads)를 우선순위화하는 능력을 제한합니다.

스위스 연방 공과대학교와 노바티스 바이오메디컬 리서치(Novartis BioMedical Research)의 연구진은 이 과정을 재고하기로 했습니다. 모든 분자를 이분법적인 상자에 강제로 밀어 넣는 대신, 그들은 각 분자가 빈번한 히터가 될 실제 가능성을 반영하는 연속적인 점수를 예측할 수 있는지 자문했습니다. 그들은 분자의 형태, 즉 그래프 신경망(graph neural networks)을 사용하는 고급 컴퓨터 모델을 사용하여 새로운 접근 방식을 개발했습니다. 이 모델들을 단순히 '예' 또는 '아니오'라고 말하도록 훈련시키는 대신, 분자가 실제로 수행된 테스트 횟수를 고려한 보정된 히트율이라는 특정 숫자를 예측하도록 훈련시켰습니다. 경험적 베이즈(empirical Bayes)라는 통계 기법을 사용하여 노이즈를 매끄럽게 처리하는 이 방법은 모델이 위험의 전체 스펙트럼을 볼 수 있게 해줍니다. 이 모델은 명백한 골칫거리인 분자, 명백한 성공 사례인 분자, 그리고 더 면밀한 조사가 필요한 중간 단계의 분자를 구분할 수 있습니다.

연구진은 두 가지 거대한 데이터 컬렉션을 사용하여 이 새로운 방법을 기존 방식과 비교 테스트했습니다. 한 세트는 천 개 이상의 서로 다른 생물학적 테스트를 포함하는 공개 데이터베이스에서 왔고, 다른 하나는 노바티스의 자체 프라이빗 라이브러리 내 스크리닝 결과였습니다. 그들은 컴퓨터 모델이 한 번도 본 적 없는 화학 구조에 대해 테스트될 수 있도록 데이터를 생화학적(biochemical) 테스트 또는 세포 기반(cellular) 테스트로 나누었습니다. 그들은 연속적 예측 모델을 고정된 컷오프에 의존하는 전통적인 모델과 비교했습니다. 결과는 새로운 접근 방식이 우월함을 보여주었습니다. 연속적 모델은 특히 연구자들이 최악의 위반자들을 걸러내기 위해 매우 엄격해져야 할 때, 분자들의 순위를 더 정확하게 매기는 데 뛰어났습니다. 이들은 목록의 앞부분에서 가장 문제가 되는 화합물들을 더 일찍 식별할 수 있었는데, 이는 실험실에서 시간을 절약하는 데 매우 중요합니다.

아마도 가장 중요한 점은, 새 방법이 훨씬 더 유연하다는 것을 입증했다는 것입니다. 모델이 고정된 라벨이 아닌 연속적인 점수를 예측하기 때문에, 과학자들은 컴퓨터를 다시 훈련시키지 않고도 언제든지 결정 규칙을 조정할 수 있습니다. 프로젝트에 매우 높은 안전 마진이 필요하다면, 문제로 간주되는 기준을 단순히 높이면 됩니다. 더 넓은 그물을 던져야 한다면, 기준을 낮추면 됩니다. 연구는 이러한 유연성이 더 나은 정확성과 결합되어, 연속적 접근 방식이 실제 신약 개발에서 더 실용적인 도구임을 보여주었다고 밝혔습니다. 또한 연구진은 모델이 각 특정 테스트의 결과를 개별적으로 예측한 다음 그 예측들을 하나의 점수로 결합하는 두 번째 전략을 탐구했습니다. 이 방법 역시 잘 작동했으며, 분자가 왜 문제를 일으키는지 이해하는 또 다른 방법을 제공했습니다.

이러한 발견은 스크리닝의 미래가 경직된 흑백 분류에서 벗어나 위험에 대한 더 미묘한 이해로 나아가야 함을 시사합니다. 빈번한 히팅을 하나의 범주가 아닌 하나의 스펙트럼으로 취급함으로써, 이 새로운 모델들은 어떤 분자가 추가 연구를 받을 가치가 있는지에 대해 더 명확하고 신뢰할 수 있는 우선순위를 제공합니다. 이것이 기존의 방법들이 쓸모없다는 뜻은 아니지만, 그것들이 훨씬 더 효율적일 수 있다는 점을 보여줍니다. 연속적 모델은 복잡한 화학 데이터의 현실을 처리하면서도 가장 중요한 미세한 차이를 버리지 않는 견고한 기준점 역할을 합니다. 신약 개발이 방대한 양의 데이터에 계속 의존함에 따라, 변화하는 요구에 적응하고 모든 분자에 대해 상세한 위험 프로필을 제공할 수 있는 시스템을 갖추는 것은 차세대 생명을 구하는 의약품을 찾는 데 필수적일 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →