← 최신 논문
🤖 AI

Generative Artificial Intelligence in Bioinformatics: A Systematic Review of Models, Applications, and Methodological Advances

이 체계적 문헌 고찰은 생성형 인공지능이 생물정보학에 미치는 변혁적 영향을 평가하며, 유전체학 및 신약 개발과 같은 특화된 응용 분야에서의 우수한 성능을 강조하는 동시에 데이터 편향 및 확장성과 같은 주요 과제를 식별한다.

원저자: Wasimul Karim, Riasad Alvi, Sayeem Been Zaman, Arefin Ittesafun Abian, Mohaimenul Azam Khan Raiaan, Saddam Mukta, Md Rafi Ur Rashid, Md Rafiqul Islam, Yakub Sebastian, Sami Azam

게시일 2026-07-27
📖 6 분 읽기🧠 심층 분석

원저자: Wasimul Karim, Riasad Alvi, Sayeem Been Zaman, Arefin Ittesafun Abian, Mohaimenul Azam Khan Raiaan, Saddam Mukta, Md Rafi Ur Rashid, Md Rafiqul Islam, Yakub Sebastian, Sami Azam

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인체의 구조를 거대하고 북적이는 도서관이라고 상상해 보세요. 그 안에는 이상한 암호로 쓰인 수십억 권의 책들이 있습니다. 어떤 책은 당신을 만드는 설계도인 긴 DNA 두루마리이고, 어떤 것은 실제 업무를 수행하는 일꾼인 단백질 레시피이며, 어떤 것은 지침을 전달하는 메신저인 RNA 메모입니다. 수십 년 동안 과학자들은 경직된 규칙 기반의 사전을 사용하여 이 책들을 읽으려고 노력했습니다. 그들은 특정 단어나 패턴을 찾아낼 수는 있었지만, 특히 책이 엉망이거나 불완전하거나 혹은 아무도 본 적 없는 언어로 쓰여 있을 때 전체적인 이야기를 이해하는 데는 어려움을 겪었습니다.

이제 생성형 인공지능(GenAI)이 등장했습니다. GenAI를 단순한 사전이 아니라, 도서관의 모든 책을 읽고 그 언어의 리듬, 문법, 스타일을 익힌 매우 똑똑하고 창의적인 이야기꾼이라고 생각해보세요. 이 이야기꾼은 단순히 단어를 찾는 대신, 다음에 올 내용을 예측하고, 원래 저자와 똑같은 느낌으로 새로운 장을 써 내려가거나, 도서관의 규칙에 완벽하게 부합하는 완전히 새로운 이야기까지 상상해낼 수 있습니다. 이 논문은 이 새로운 '이야기꾼'이 생명 공학(생명의 도서관을 해독하는 과학)의 판도를 어떻게 바꾸고 있는지 탐구합니다. 이 논문은 질문을 던집니다. 이 AI가 실제로 새로운 단백질을 설계할 수 있을까요? 기존의 방식보다 세포의 복잡한 이야기를 더 잘 이해할 수 있을까요? 그리고 가장 중요한 것은, 이 AI가 질병을 치료하는 데 도움을 줄 준비가 되어 있는 것일까요, 아니면 가끔씩 가짜를 만들어내는 아주 뛰어난 흉내쟁이에 불과한 것일까요?


위대한 생물학적 이야기꾼: 생명 과학 분야 AI에 관한 리뷰

이 논문은 일종의 방대한 '체계적 문헌 고찰(systematic review)'입니다. 이는 저자들이 Generative AI가 생명을 해독하는 데 어떻게 사용되고 있는지 정확히 파악하기 위해 수천 개의 과학 연구를 샅샅이 뒤지는 보물 찾기를 수행했음을 의미합니다. 저자들은 단순히 한두 개의 멋진 실험만을 살펴본 것이 아니라, 전체적인 그림을 얻기 위해 2021년부터 2026년까지의 고품질 연구 82개를 수집했습니다. 그들의 목표는 이 AI 모델들이 어떻게 작동하는지, 어디에서 빛을 발하는지, 그리고 어디에서 실수할 수 있는지에 대한 여섯 가지 핵심 질문에 답하는 것이었습니다.

새로운 초능력: GenAI는 실제로 무엇을 할 수 있는가?

저자들은 GenAI가 과거에는 불가능했거나 인간이 파악하는 데 수년이 걸렸던 일들을 해내고 있다는 것을 발견했습니다.

1. DNA 스크립트 읽기 (유전체학)
단어 사이에 공백이 없는 책에서 특정 지침을 찾는 것을 상상해 보세요. 컴퓨터에게 DNA는 바로 그런 모습입니다. 기존의 방법들이 단 하나의 단어를 찾기 위해 돋보기를 사용하는 것이었다면, GenAI는 DNA 서열 전체를 하나의 문장처럼 취급합니다. DNABERT와 같은 모델들은 이 '언어'를 매우 잘 읽도록 학습되어, 유전자가 어디서 시작하고 끝나는지, 혹은 유전자가 어떻게 행동할지를 놀라운 정확도(일부 테스트에서 약 91.8% ~ 91.9%)로 예측할 수 있습니다. 이는 마치 AI가 생명의 문법을 학습하여, DNA 문장에 쓰이기도 전에 다음에 올 단어를 추측할 수 있게 된 것과 같습니다.

2. 새로운 단백질 설계 (단백질체학)
단백질은 당신의 몸을 움직이는 작은 기계들입니다. 보통 과학자들은 자연이 새로운 단백질을 발명하기를 기다리거나, 기존의 것을 수정하려고 노력합니다. GenAI는 창의적인 건축가 역할을 함으로써 이 과정을 바꿉니다. ProGen이나 ProtGPT2와 같은 모델들은 무에서 유로 새로운 단백질 서열을 설계할 수 있습니다. 한 유명한 실험에서, AI는 자연적인 것만큼이나 잘 작동하는 새로운 효소(화학 반응을 가속화하는 단백질)를 설계했습니다. 이는 AI가 단순히 청사진을 복사한 것이 아니라, 인간이 만든 집만큼이나 견고하고 기능적인 새 집을 직접 그려낸 것과 같습니다.

3. 세포의 이웃 이해하기 (단일 세포 분석)
당신의 몸에는 수조 개의 세포가 있으며, 그들은 모두 다릅니다. 기존의 도구들은 전체 집단을 보고 평균적인 답변을 내놓았습니다. 하지만 scGPT와 같은 GenAI 모델은 개별 세포를 들여다보고 그들의 고유한 '개성'을 이해할 수 있습니다. 이들은 세포가 약물에 어떻게 반응할지, 혹은 병이 들었을 때 어떻게 변할지를 예측할 수 있습니다. 이는 마치 시끄러운 경기장에서 단 하나의 세포가 속삭이는 소리를 듣고 그 의미를 정확히 이해하는 통역사를 가진 것과 같습니다.

4. 신약 발견 (신약 개발)
새로운 약을 찾는 것은 자물쇠가 어떻게 생겼는지 모르는 상태에서 그 자물쇠에 딱 맞는 열쇠를 찾는 것과 같습니다. GenAI는 수백만 개의 잠재적인 '열쇠'(분자)를 생성하고 이를 가상으로 테스트함으로써 도움을 줍니다. DrugAssist와 같은 도구를 사용하면 과학자들은 AI와 대화하며 "물에 잘 녹고 뇌 장벽을 통과할 수 있는 분자를 만들어줘"라고 요청할 수 있습니다. 그러면 AI가 이를 설계합니다. 이러한 설계들은 유망하지만, 논문은 이들이 여전히 디지털 스케치 단계에 불과하며, 실제로 인체에서 작동하는지 증명하기 위해서는 실제 실험실 테스트가 필요하다고 지적합니다.

비결: 특화된 AI vs 일반 AI

이 논문의 가장 큰 발견 중 하나는 생물학에서는 일반적인(general) AI보다 특화된(specialized) AI가 더 뛰어나다는 점입니다.

온라인에서 대화할 수 있는 일반적인 AI(예: 챗봇)를 도서관의 모든 책을 읽었지만 실험실에서 일해본 적은 없는 똑똑한 학생이라고 생각해 보세요. 그들은 많은 사실을 알고 있지만, 생물학의 특정 전문 용어에는 혼란을 느낄 수 있습니다. 반면, 특화된 모델(단백질을 위한 ESM-2나 DNA를 위한 DNABERT 등)은 평생을 실험실에서 보낸 학생들과 같습니다. 이들은 생물학적 데이터에 특화되어 훈련되었습니다. 논문은 이러한 특화된 모델들이 일반 모델보다 일관되게 우수한 성능을 보인다는 것을 보여줍니다. 예를 들어, 단백질의 돌연변이가 기능에 어떤 변화를 줄지 예측할 때, 특화된 모델들이 훨씬 더 자주 정답을 맞혔습니다. 저자들은 일반 AI가 텍스트를 요약하거나 코드를 쓰는 데는 훌륭할지 몰라도, 생명의 복잡하고 무질서한 언어를 진정으로 이해하려면 '생물학 훈련을 받은' AI가 필요하다고 제안합니다.

결함: AI가 막히는 지점

이러한 기대에도 불구하고, 논문은 이 문제가 아직 '해결된 문제'라고 부르는 것에 매우 신중합니다. 저자들은 과학자들이 여전히 해결해야 할 몇 가지 심각한 한계점을 지적합니다.

  • '환각(Hallucination)' 문제: 창의적인 작가가 실제처럼 들리는 가짜 사실을 지어내는 것처럼, GenAI는 컴퓨터상으로는 완벽해 보이지만 실제 생활에서는 제대로 된 모양으로 접히지(fold) 않는 단백질 서열을 생성할 수 있습니다. 논문은 이러한 디지털 창작물이 실제 실험실(테스트 튜브와 세포가 있는 실제 실험실)에서 검증되기 전까지는 신뢰할 수 없다고 경고합니다.
  • 데이터 편향(Data Bias): AI는 이미 쓰여진 책들을 통해 학습했습니다. 하지만 그 책들 대부분은 인간이나 쥐와 같은 흔한 생물들에 관한 것입니다. AI는 희귀한 동물이나 희귀 질환에 대해서는 이해도가 떨어집니다. 이는 수학 시험 공부만 하고 생물학 단원을 읽는 것을 잊어버린 학생과 같습니다.
  • 두뇌의 비용: 이러한 거대한 AI 모델을 훈련시키는 데는 엄청난 양의 전기를 사용하는 슈퍼컴퓨터가 필요합니다. 논문은 이것이 비용이 많이 들고 탄소 배출을 유발하며, 이로 인해 작은 연구실들이 이러한 도구를 사용하는 데 어려움을 겪게 된다고 언급합니다.
  • '블랙박스(Black Box)'의 미스터리: 때때로 AI는 정답을 제시하지만, 왜 그런 답이 나왔는지는 아무도 모릅니다. 의학에서는 답 자체만큼이나 '왜'를 아는 것이 중요합니다. 만약 AI가 어떤 약이 효과가 있을 것이라고 말한다면, 의사들은 그 근거를 이해해야 신뢰할 수 있습니다. 현재 많은 모델은 내부 논리가 숨겨져 있는 '블랙박스' 형태입니다.

미래: 더 나은 팀을 구축하기 위하여

그렇다면 앞으로 어디로 가야 할까요? 저자들은 미래가 하나의 거대하고 완벽한 AI를 만드는 것이 아니라고 제안합니다. 대신, **모듈형 접근 방식(modular approach)**을 제안합니다. 일반 AI가 매니저 역할을 하여 당신의 질문을 받고, 어려운 부분은 전문 도구들에게 위임하는 팀을 상상해 보세요. 만약 당신이 "이 유전자가 심장에 어떤 영향을 미치는가?"라고 묻는다면, 매니저 AI는 단백질 모델에게 구조를 묻고, 약물 모델에게 상호작용을 묻고, 문헌 모델에게 과거 연구를 묻는 방식으로 각자의 답을 모아 당신에게 전달할 것입니다.

또한 저자들은 효율성을 강조합니다. 우리는 슈퍼컴퓨터 없이도 실행할 수 있는 더 스마트하고 작은 모델을 만들어 더 많은 과학자가 사용할 수 있도록 해야 합니다. 마지막으로, 실제 세계에서의 검증이 필요하다고 강조합니다. 논문은 결론적으로 GenAI가 아이디어나 설계를 생성하는 강력한 도구이긴 하지만, 아직 과학적 방법론을 대체할 수는 없다고 명시합니다. AI가 이야기를 쓸 수는 있지만, 그 이야기가 현실 세계에서도 참인지 확인하는 과정은 여전히 필요합니다.

요약하자면, 생성형 AI는 생물학자의 도구 상자에 들어온 혁신적인 새로운 도구입니다. 이는 그 어느 때보다 빠르게 새로운 단백질을 쓰고, 복잡한 유전자를 해독하며, 약물을 설계할 수 있습니다. 하지만 강력한 도구인 만큼, 그 이야기가 단지 창의적인 것에 그치지 않고 '진실'이 될 수 있도록 주의 깊게 사용되고, 끊임없이 검증되며, 인간 전문가의 안내를 받아야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →