MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models
이 논문은 분자 프로파일과 텍스트 설명 간의 양방향 대조 정렬을 통해 물성 예측 및 교차 모달 검색에 대한 타당성을 입증함으로써, 멀티모달 거대 언어 모델이 범용적이고 문맥 인식적인 분자 임베딩 모델로서 기능하도록 적응시키는 경량 프레임워크인 MolEmb을 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
계산 화학의 정적인 연구실에서 과학자들은 분자의 보이지 않는 세계를 이해하기 위해 오랫동안 특정한 종류의 디지털 지문을 활용해 왔습니다. '임베딩(embeddings)'이라 불리는 이 지문은 화학 구조의 본질을 포착하는 수학적 요약본으로, 컴퓨터가 어떤 물질이 물에 녹을지, 혹은 독성이 있을지 등 그 물질이 어떻게 행동할지를 예측할 수 있게 해줍니다. 수년 동안 이러한 지문을 만드는 데는 단 하나의 목적, 즉 분자의 사진을 찍거나 화학 코드를 읽어 들여 하나의 고정된 숫자를 내뱉도록 설계된 특수 도구가 필요했습니다. 이러한 방식은 특정 작업에는 효과적이었지만, 유연성이 부족했습니다. 과학자가 무엇을 묻느냐에 따라 초점을 쉽게 바꿀 수 없었기 때문입니다. 만약 연구자가 분자의 혈뇌장벽 통과 능력에 대해 알고 싶어 한다면, 기존의 도구는 질문의 내용과 상관없이 분자의 형태만을 파악하여 동일한 답을 내놓았습니다. 도구가 질문을 이해하는 것이 아니라 오직 분자의 모양만을 이해했기 때문입니다.
이러한 한계는 분야가 더 복잡한 신약 개발 및 재료 설계로 나아감에 따라 병목 현상이 되었습니다. 과학자들에게는 이러한 디지털 지문에 말을 걸 수 있는 방법, 즉 문의 맥락에 따라 서로 다른 특징을 강조하도록 요청할 수 있는 방법이 필요했습니다. 문제는 이미 텍스트를 읽고 이미지를 볼 수 있는 강력하고 유연한 인공지능 시스템을 활용하여 적응형 화학 지문을 만들 수 있을 것인가 하는 점이었습니다. 매번 새로운 좁은 의미의 도구를 만드는 대신, 하나의 범용 시스템이 언어를 통해 묘사된 방식에 따라 분자를 표현하는 법을 배울 수 있을지 연구자들은 궁금해했습니다.
홍콩중문대학교 선전 캠퍼스와 상하이 인공지능 실험실의 연구진은 'MolEmb'라고 부르는 새로운 프레임워크를 통해 이 질문에 답하고자 했습니다. 그들은 사진을 보고 문장을 읽으며 둘 사이의 관계를 이해할 수 있는 멀티모달 거대 언어 모델(multimodal large language model)이라는 유형의 인공지능에서 시작했습니다. 연구진은 이러한 모델들이 분자를 설명하는 다양한 방식, 즉 2차원 그림, 화학 구조를 나타내는 텍스트 문자열, 또는 조사하고자 하는 속성에 대한 지침을 처리하는 데 자연스럽게 적합하다는 것을 깨달았습니다.
연구팀은 이 거대 모델이 분자 임베딩 전문가로서 역할을 수행하도록 가르치는 경량화된 시스템을 구축했습니다. 그들은 모델에게 새로운 분자를 생성하거나 화학 논문을 처음부터 쓰도록 가르치려 하지 않았습니다. 대신, 분자의 시각적 및 텍textual 묘사를 특정 텍스트 지침과 일치시키도록 모델을 훈련하는 데 집중했습니다. 분자를 다양한 렌즈를 통해 볼 수 있는 복잡한 객체라고 상상해 보십시오. 연구진은 모델에게 분자의 사진과 화학 코드를 보여준 뒤, 이를 "독성 분석" 또는 "용해도 분석"과 같은 텍스트 지침과 짝지어 제시했습니다. 목표는 모델이 해당 지시에 따라 미세하게 변화하는 고유한 디지털 지문을 생성하도록 만드는 것이었습니다. 지침이 독성에 관한 것이라면 지문은 안전과 관련된 분자의 부분을 강조할 것이고, 지침이 용해도로 바뀌면 지문은 물에 녹는 것과 관련된 부분을 강조하도록 변화할 것입니다.
이 접근 방식이 효과적인지 테스트하기 위해 연구진은 일련의 엄격한 실험을 수행했습니다. 첫째, 새로운 시스템이 현재 사용 중인 특수 도구만큼 정확하게 화학적 특성을 예측할 수 있는지 확인했습니다. 그 결과, 이 시스템은 특정 화학 작업에 대한 별도의 학습 없이도 용해도나 독성과 같은 특성을 기존의 최고 방법들과 대등한 수준의 정확도로 예측할 수 있음을 발견했습니다. 이는 범용 모델이 분자의 이미지, 텍스트 코드, 그리고 이를 설명하는 언어 사이의 관계를 이해함으로써 이미 화학 구조에 대해 충분히 유용한 정보를 학습했음을 시사하는 중요한 발견이었습니다.
다음으로, 연구팀은 이 지문들을 사용하여 텍스트로 분자를 검색할 수 있는지 테스트했습니다. 전통적인 시스템에서는 "간 세포에 독성이 있는 분자를 찾아줘"와 같은 문장을 입력하여 데이터베이스에서 분자를 검색할 수 없습니다. 왜냐하면 화학 데이터와 텍스트 데이터가 서로 다른 세계에 존재하기 때문입니다. 연구진은 새로운 시스템이 분자와 텍스트 묘사를 직접 비교할 수 있는 공유 공간을 만들어냈음을 보여주었습니다. 특정 묘사에 맞는 분자를 찾아달라고 요청했을 때 시스템은 높은 정확도로 성공하였으며, 이는 모델이 화학의 시각적 측면과 텍스트적 측면을 하나의 통합된 표현으로 연결하는 법을 진정으로 배웠음을 입증했습니다.
그러나 가장 결정적인 테스트는 시스템이 맥락에 따라 정말로 생각을 바꿀 수 있는지 확인하는 것이었습니다. 연구진은 모델이 동일한 분자에 대한 서로 다른 유효한 묘사들을 구별할 수 있는지 확인하기 위해 'MolCAR'라는 진단 벤치마크를 만들었습니다. 연구진은 하나의 분자를 제시하고, 예를 들어 독성에 관한 특정 작업을 수행할 때는 수화(hydration)와 같은 다른 유효한 묘사들은 무시하면서 해당 작업에 맞는 올ー바른 묘사를 찾도록 요청했습니다. 최종적인 특화 훈련 단계를 추가하기 전에는 모델이 어려움을 겪었습니다. 모델은 질문에 상관없이 분자를 하나의 고정된 정체성으로 취급했습니다. 그러나 연구진이 분자를 다양한 작업 중심의 묘사와 짝지은 데이터셋으로 모델을 훈련시킨 후, 시스템은 초점을 전환하는 법을 배웠습니다. 모델은 질문이 독성에 관한 것인지 용해도에 관한 것인지에 따라 동일한 분자에 대해 서로 다른 지문을 생성하기 시작했습니다.
이 결과는 멀티모달 거대 언어 모델이 단순히 화학적 아이디어를 생성하거나 질문에 답하는 도구에 그치지 않고, 새로운 종류의 분자 표현의 토대가 될 수 있음을 시사합니다. 이 연구는 맥락 인식형 화학 지문을 만드는 능력이 모델 아키텍처의 내재적 결함이 아니라, 모델이 학습하는 데이터의 문제라는 점을 보여줍니다. 훈련 데이터에 동일한 분자를 다양한 과학적 관점에서 묘사한 사례가 포함될 때, 모델은 적응하는 법을 배웁니다. 이 발견은 하나의 범용 시스템이 일련의 좁고 특화된 도구들을 대체하여, 과학자들이 도서관에서 정보를 검색할 때와 같은 유연성으로 화학 데이터를 질의할 수 있는 미래를 향하고 있습니다. 이 연구는 분자 프로필을 자연어 지침과 정렬함으로써, 이 강력한 모델들이 차세대 신약 개발 및 화학 연구를 위한 다재다능한 인프라가 될 수 있음을 입증합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.