Assessing the Reliability of LLM-Generated Phenotype-Genotype Associations Through External Validation
이 연구는 네 가지 거대 언어 모델의 표현형-유전자형 연관성 생성 능력을 벤치마킹하여, 이들이 중간 또는 강한 외부 검증 지원을 받는 상당한 양의 후보군을 생성할 수 있는 반면, 그 정확도는 연관 유형과 모델에 따라 크게 달라진다는 점을 발견하였으며, 이는 엄격한 검증 파이프라인의 결정적인 필요성을 강조한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
현대 의학의 세계에서 환자의 건강 이야기는 종종 두 가지 서로 다른 언어로 기록됩니다. 한 가지 언어는 의사가 관찰하는 것을 설명합니다: 고열, 특정한 심장 리듬, 또는 특정한 형태의 뼈와 같은 것들입니다. 과학자들은 이러한 관찰 가능한 형질을 표현형(phenotypes)이라고 부릅니다. 또 다른 언어는 신체의 세포 안에 숨겨져 있으며, DNA의 코드 속에 쓰여 있습니다. 이 코드는 유전자와 유전적 스크립트 내의 미세한 변이들을 포함하고 있으며, 이것이 왜 어떤 사람이 특정 형질을 갖게 되는지, 혹은 왜 특정 질병을 앓게 되는지를 설명해 줄 수 있습니다. 이 두 언어를 연결하는 것, 즉 눈에 보이는 증상과 보이지 않는 유전적 원인을 맞추는 것이 정밀 의료의 기초입니다. 이를 통해 의사들은 희귀 질환을 진단하고, 위험을 예측하며, 개인의 고유한 생물학적 특성에 맞는 치료법을 선택할 수 있습니다. 그러나 알려진 증상과 유전자 사이의 연결 관계를 담은 도서관이 너무 빠르게 성장하고 있어, 인간 전문가가 모든 새로운 과학 논문을 읽고 기록을 업데이트하는 것은 불가능합니다. 발표된 내용과 공식적으로 기록된 내용 사이의 간극이 점점 벌어지고 있으며, 이로 인해 의사들은 자신들에게 필요한 최신 답변을 얻지 못하는 상황에 놓여 있습니다.
이 간극을 메우기 위해 연구자들은 인공지능, 구체적으로는 대규모 언어 모델(large language model)이라 불리는 일종의 컴퓨터 프로그램에 주목하고 있습니다. 이 프로그램들은 방대한 양의 텍스트를 읽었으며, 인간의 글쓰기와 유사하게 보이는 새로운 문장을 생성할 수 있습니다. 만약 이 프로그램들이 충분한 양의 의학 문헌을 읽었다면, 환자의 증상과 연결된 유전자나 유전적 변이를 즉각적으로 제안하여 초고속 연구 조수 역할을 할 수 있을 것이라는 아이디어입니다. 하지만 심각한 우려 사항이 있습니다. 이 프로그램들은 때때로 사실을 지어내는 것으로 알려져 있습니다. 존재하지 않는 가짜 유전자 이름을 만들어내거나, 실제 존재하는 유전자를 전혀 상관없는 질병과 연결하기도 합니다. 만약 의사가 이러한 실수를 신뢰한다면, 잘못된 진단으로 이어질 수 있습니다. 핵심적인 질문은, 이 인공지능 도구들이 실제로 검증된 실재하는 연결 고리를 찾아낼 수 있는지, 아니면 그저 추측하고 있는 것인지에 대한 것입니다.
밴더빌트 대학교(Vanderbilt University)의 한 연구팀은 이 질문을 테스트하기 위해 엄격한 실험을 수행했습니다. 그들은 단순히 컴퓨터에게 추측하도록 시킨 것이 아니라, 모든 답변을 세계에서 가장 신뢰받는 데이터베이스와 대조하여 확인하는 시스템을 구축했습니다. 연구진은 가장 발전된 네 가지 언어 모델을 선정하여 여섯 가지 유형의 과업을 수행하도록 했습니다. 어떤 과업에서는 컴퓨터에 증상 목록을 주고 그 원인이 되는 유전자나 유전적 변이의 이름을 묻기도 했습니다. 또 다른 과업에서는 유전자나 유전적 변이를 주고 그것이 유발하는 증상을 설명하도록 했습니다. 그들은 흔한 질환인 고혈압이나 당뇨병뿐만 아니라, 단 몇 명에게만 나타나는 매우 희귀한 질병에 대해서도 이 모델들을 테스트했습니다. 그 후 연구진은 모델이 생성한 모든 연관성을 검증 파이프라인에 통과시켰습니다. 유전자 이름이 실제 존재하는지, 유전적 변이가 표준 기록에 존재하는지, 그리고 무엇보다 중요한 점은 증상과 유전자 사이의 연결이 주요 과학 카탈로그의 증거에 의해 뒷받침되는지를 확인했습니다.
결과는 이 도구들이 할 수 있는 것과 할 수 없는 것에 대한 복잡한 그림을 보여주었습니다. 전반적으로, 인공지나 모델들은 실재하는 이름을 생성하는 데 있어 놀라울 정도로 뛰어났습니다. 모델이 제안한 거의 모든 유전자와 유전적 변이는 실제 생물학적 세계에 존재했습니다. 즉, 컴퓨터가 가짜 이름을 만들어내는 경우는 드물었습니다. 그러나 진짜 시험대는 증상과 유전자 사이의 연결이 진실인지 여부였습니다. 연구진이 증거를 확인했을 때, 모델이 생성한 연관성의 약 74%가 적어도 하나 이상의 확립된 과학 데이터베이스와 일치하는 것으로 나타났습니다. 이는 모델의 제안 중 약 4개 중 3개 꼴로 이를 뒷받침하는 근거가 문헌에 존재한다는 것을 의미합니다. 그중 약 9%는 매우 강력한 지지를 받았고, 또 다른 54%는 중간 정도의 지지를 받았습니다. 이는 이러한 도구들이 의사와 과학자들이 조사할 후보 아이디어를 생성하는 강력한 도구가 될 수 있음을 시사합니다.
하지만 성능은 모든 유형의 질문에서 균일하지 않았습니다. 모델들은 특정 유전적 변이(단일 염기 다형성, SNP라고 불리는)에 대해 물었을 때보다 유전자에 대해 물었을 때 훨씬 더 좋은 성과를 보였습니다. 증상과 유전자를 연결하는 과업에서는 모델들이 약 3분의 2 정도의 답변에서 강하거나 중간 정도의 증거를 찾아낼 수 있었습니다. 그러나 과업이 증상과 특정 유전적 변이를 연결하는 것으로 바뀌자 성공률은 크게 떨어졌습니다. 모델들은 희귀 질환에 대해 가장 큰 어려움을 겪었습니다. 심장병이나 당뇨병 같은 흔한 질환에 대해서는 연결 고리를 잘 찾아냈지만, 초희귀 질환에 대해서는 검증된 연결을 찾는 데 자주 실패했습니다. 이는 인공지능뿐만 아니라 데이터베이스 자체의 한계를 드러냅니다. 희귀 질환에 대한 과학적 기록은 종종 불완전하거나 흩어져 있어, 설령 연결 고리가 존재하더라도 컴퓨터가 일치하는 항목을 찾기 어렵게 만듭니다.
연구는 또한 네 가지 서로 다른 모델을 비교하여 어느 하나가 확실히 우월한지 살펴보았습니다. 클로드 소네트(Claude Sonnet) 모델이 전체적으로 가장 우수한 성능을 보였으며, 증거가 뒷받침되는 연관성을 약 69%의 확률로 생성해 냈습니다. GPT-5.5는 약 65%의 성공률로 2위를 차지했습니다. 나머지 두 모델은 각각 61%와 57%의 성공률을 기록하며 뒤처졌습니다. 흥ло로운 점은, 유전자 연결을 가장 잘 찾는 모델이 반드시 유전적 변이 연결을 가장 잘 찾는 모델은 아니었다는 것입니다. 이는 각 모델이 훈련된 방대한 양의 텍스트로부터 서로 다른 패턴을 학습했음을 시사합니다. 연구진은 또한 서로 다른 모델들이 얼마나 자주 일치하는지도 살펴보았습니다. 그들은 모델들이 동일한 질문을 받았을 때도 정확히 같은 답변 목록을 생성하는 경우가 드물다는 것을 발견했습니다. 때로는 잘 알려진 사실에 대해 동의하기도 했지만, 많은 다른 질문에 대해서는 완전히 다른 제안을 내놓았습니다. 이러한 불일치는 단일 모델에 의존하는 것이 위험하다는 것을 의미합니다. 한 모델이 연결 고리를 제안한다고 해서 그것이 반드시 옳다는 보장이 없으며, 두 모델이 서로 의견이 다르다고 해서 둘 다 틀렸다는 뜻도 아닙니다.
아마도 가장 중요한 발견은 모델들이 범하는 오류의 성격이었습니다. 연구진이 어떤 데이터베이스에서도 찾을 수 없는 제안들을 수동으로 검토했을 때, 그 대다수가 단순한 무작위 추측이 아님을 발견했습니다. 실패한 매칭의 약 60%는 모델이 실제 존재하는 유전자나 변이를 엉뚱한 질병과 연결한 경우였습니다. 나머지 실패 사례들은 대개 과학 데이터베이스에 아직 해당 정보가 없기 때문에 발생했습니다. 이 차이는 매우 중요합니다. 이는 모델들이 단순히 가짜 이름을 지어내는 것이 아니라, 잘못된 연결에 대해 매우 확신을 가지고 있다는 것을 의미합니다. 이는 임상 현장에서 특정한 위험을 초래합니다. 의사는 출력된 결과만 보고서는 그것이 검증된 올바른 연결인지, 아니면 확신에 찬 환각(hallucination)인지 구분할 수 없습니다.
연구진은 이러한 인공지능 도구들이 유용하지만 주의해서 다루어야 한다고 결론지었습니다. 이 도구들은 전문가를 위한 시작점으로서 긴 가능성의 목록을 생성하는 데 탁-월합니다. 하지만 최종적인 답을 제공한다고 믿을 수는 없습니다. 모델이 내놓는 모든 제안은 의료 현장에서 사용되기 전에 반드시 확립된 기록과 대조하여 확인되어야 합니다. 연구는 출력의 신뢰도가 질문의 유형에 따라 크게 달라진다는 것을 보여주었습니다. 흔한 질병과 유전자 수준의 질문에 대해서는 이 도구들이 상당히 신뢰할 만합니다. 하지만 희귀 질환과 특정 유전적 변이에 대해서는 현재의 집단적 과학 지식의 공백을 반영하듯 훨씬 덜 확실합니다. 앞으로의 방향은 이러한 모델을 사용하여 발견 과정을 가속화하되, 항상 엄격한 검증 단계를 병행하는 것입니다. 이렇게 함으로써 인공지능의 속도와 인간이 큐레이션한 과학의 정확성을 결합하여, 환자의 증상과 유전자 사이의 연결이 빠르면서도 진실되도록 보장할 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.