← 최신 논문
🤖 machine learning

LLM-Guided Retrieval for Prediction of Molecular Perturbation Responses

본 논문은 대규모 언어 모델을 활용하여 생물학적으로 연관된 화합물을 식별하고 이들의 측정된 전사체 반응을 집계함으로써, 기존 베이스라인과 비교하여 보지 못한 약물 및 세포주에 대한 분자 섭동 효과의 우수한 제로샷 예측을 달성하는 방법론인 LLM-Guided Retrieval (LGR)을 제안한다.

원저자: Betty Xiong, Jan-Christian Huetter, Gabriele Scalia, Tommaso Biancalani, Sepideh Maleki

게시일 2026-08-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Betty Xiong, Jan-Christian Huetter, Gabriele Scalia, Tommaso Biancalani, Sepideh Maleki

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 특정 용의자가 새로운 종류의 수갑에 어떻게 반응할지 알아내려는 형사라고 상상해 보십시오. 의학의 세계에서 이 "용의자들"은 아주 작은 살아있는 세포이며, "수갑"은 저분자 약물입니다. 과학자들은 수천 개의 서로 다른 세포가 수천 개의 서로 다른 약물에 어떻게 반응하는지를 기록한 방대한 데이터 라이브러리를 구축하는 데 수년을 보냈습니다. 이것은 가능한 모든 용의자와 수갑의 조합을 담고 있는 거대한 사진첩과 같습니다. 하지만 문제는, 가능한 조합이 너무 많아서 이를 모두 테스트하는 것이 물리적으로 불가능하다는 점입니다. 우주의 모든 세포에 대해 모든 약물을 일일이 테스트해 볼 수는 없습니다.

그렇다면 과학자들은 아직 테스트하지 않은 세포에 어떤 일이 일어날지 어떻게 예측할까요? 그들은 "검색(retrieval)"이라는 영리한 기술을 사용합니다. 처음부터 답을 추측하기 위해 초복잡한 기계를 만드는 대신, 이미 테스트된 매우 유사한 약물을 찾는 것입니다. 만약 약물 A와 약물 B가 매우 유사하다면, 우리는 약물 A가 세포를 어떻게 변화시켰는지 알고 있으므로 약물 B도 유사한 작용을 할 것이라고 추측할 수 있습니다. 이는 과거에 비슷한 영화들이 어떻게 흥행했는지를 보고 새로운 영화의 성적을 예측하는 것과 같습니다. 이 논문이 다루는 핵심 질문은 바로 이것입니다: 우리는 참조로 사용할 가장 '좋은' 유사 약물을 어떻게 찾을 것인가? 화학적 구조(마치 수갑의 색상과 모양을 비교하는 것처럼)를 보고 찾는 것이 나을까요, 아니면 더 똑똑한 매칭 방법이 있을까요?

Betty Xiong과 그녀의 팀이 이끄는 연구진은 새로운 접근 방식을 시도했습니다. 그들은 대규모 언어 모델(LLM)—수백만 권의 과학 서적과 논문을 읽고 이해하는 유형의 AI—에게 탐정의 가이드 역할을 해달라고 요청했습니다. 그들은 이 방법을 **LLM 유도 검색(LLM-Guided Retrieval, LGR)**이라고 부릅니다.

이 실험이 어떻게 진행되는지 재미있는 비유를 들어 설명해 보겠습니다. 당신이 특정, 테스트되지 않은 세포가 새로운 약물에 어떻게 반응할지 예측하려고 한다고 상상해 보십시오. 당신에게는 동일한 유형의 세포에 대해 이미 테스트된 다른 약물들의 "후보군(candidate pool)"이 있습니다.

  1. 기존 방식: 보통 과학자들은 약물의 화학적 구조를 살펴봅니다. 그들은 "이 두 약물은 화학적으로 닮았으니, 아마도 비슷하게 작용할 것이다"라고 말할 것입니다. 이것은 책을 오직 표지만 보고 판단하는 것과 같습니다.
  2. 새로운 방식 (LGR): 연구진은 새로운 약물의 이름과 후보 약물 목록을 AI에 입력했습니다. 그리고 AI에게 생물학적 지식을 바탕으로 "이 약물들이 체내에서 어떻게 작동하는지(그들의 메커니즘과 경로)를 고려할 때, 어떤 것들이 가장 적합한 매치인가?"라고 물었습니다. AI는 단순히 책의 겉모습뿐만 아니라 그 책이 무엇에 관한 것인지까지 아는 박식한 사서 역할을 합니다.
  3. 예측: AI가 가장 유사한 상위 10개의 약물을 선정하면, 연구진은 단순히 그 10개 약물이 세포에 미친 영향의 평균값을 취합니다. 그들은 복잡한 수학 공식으로 결과를 추측하는 것이 아니라, AI가 찾아낸 이웃들의 실제 결과값을 평균 내는 방식을 사용합니다.

연구진은 이 아이디어를 많은 세포가 약물에 어떻게 반응하는지에 대한 데이터를 담고 있는 Tahoe-100M이라는 거대한 데이터셋을 통해 테스트했습니다. 그들은 세 가지 시나리오를 살펴보았습니다:

  • 미지의 약물 (Unseen Drugs): 모델이 이전에 본 적 없는 약물을 테스트함.
  • 미지의 세포주 (Unseen Cell Lines): 모델이 본 적 없는 유형의 세포를 테스트함 (이것이 가장 어려운 과제임).
  • 오픈 월드 (Open World): AI가 제한된 목록이 아닌, 데이터베이스 내의 모든 약물 중에서 선택할 수 있게 함.

그들은 무엇을 발견했을까요?
결과는 AI를 사용하여 이웃을 선택하는 것이 게임 체인저라는 것을 시사하며, 특히 새로운 유형의 세포를 다룰 때 더욱 그러합니다.

  • 더 나은 방향성: 가장 흥ral한 발견은 "부호 정확도(sign accuracy)"에 관한 것입니다. 이는 특정 유전자가 활성화될지(up) 혹은 억제될지(down)를 예측하는 것을 의미합니다. AI 유도 방식은 모든 약물을 평균 내거나 화학적 유사성을 사용하는 방식보다 방향을 맞추는 데 훨씬 뛰어났습니다. 즉, 다른 방법들은 방향을 틀리는 경우가 많았던 반면, AI는 약물이 특정 유전자의 활동을 증가시킬 것인지 정확히 맞혔습니다.
  • "미지의 세포"에서의 승리: 연구진이 완전히 새로운 유형의 세포가 어떻게 반응할지 예측하려 했을 때, AI 방식은 경쟁자들을 압도했습니다. AI 방식은 0.56의 상관계수(실제와 예측이 얼마나 가까운지를 나타내는 척도)를 기록한 반면, 그다음으로 좋은 방법은 0.42에 그쳤습니다. 오차 측면에서 AI 방식의 평균 절대 오차(MAE)는 0.011로, 약물 평균 베이스라인의 0.0137보다 낮았습니다(낮을수록 좋습니다).
  • 단순함의 승리: 이 논문은 복잡하고 고성능인 예측 모델을 굳이 만들 필요가 없다고 주장합니다. "비법 소스"는 답을 계산하기 위한 화려한 알고리즘이 아니라, 단순히 올바른 이웃을 찾는 데 있었습니다. AI가 적절한 친구를 찾는 힘든 일을 수행했고, 단순한 평균 계산이 나머지를 처리했습니다.

이것이 의미하는 바는 무엇일까요?
저자들은 약물이 세포에 미치는 영향을 예측하는 데 있어, 예측 모델의 복잡성보다 "검색(retrieval, 적절한 유사 약물을 찾는 것)"의 품질이 더 중요하다고 제안합니다. 그들은 AI가 제약 조건이 있는 가이드로서 역할을 할 때, 단순한 화학적 비교가 놓칠 수 있는 생물학적 지식을 활용할 수 있다는 것을 발견했습니다.

하지만 이 논문은 이것이 모든 것을 해결하는 마법의 탄환은 아니라는 점을 주의 깊게 명시합니다. AI는 약물이 매우 생소하거나 목록에서 유효한 매치를 충분히 찾을 수 없을 때 때때로 어려움을 겪었습니다. 또한, AI가 효과의 방향(증가 또는 감소)을 맞추는 데는 뛰어났지만, 효과의 정확한 크기를 예측하는 데는 항상 완벽하지는 않았습니다. 저자들은 향ate에 이 AI 가이드와 다른 방법들을 결로하여 최상의 결과를 얻을 수 있을 것이라고 제언합니다.

요약하자면, 이 논문은 때때로 미래를 예측하는 가장 좋은 방법이 더 크고 똑똑한 수정구슬을 만드는 것이 아니라, 배울 수 있는 적절한 역사책을 찾도록 매우 박식한 사서에게 도움을 구하는 것임을 보여줍니다. AI가 유사한 약물을 찾는 과정을 안내하게 함으로써, 과학자들은 데이터가 거의 없는 상황에서도 새로운 치료제가 어떻게 작용할지에 대해 훨씬 더 나은 추측을 할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →