MoleCode unlocks structural intelligence in large language models
MoleCode 는 SMILES 와 같은 암시적 선형 표현을 명시적 구조 관계로 대체하여 대규모 언어 모델이 복잡한 화학 작업에서 성능을 향상시키기 위해 분자 토폴로지를 직접 추론하고 조작할 수 있게 하는 훈련이 불필요한 그래프 기반 분자 언어를 도입합니다.
원본 논문은 CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/)에 따라 공공 도메인에 제공됩니다. 이것은 동료 심사를 거치지 않은 프리프린트의 AI 생성 설명입니다. 의학적 조언이 아닙니다. 이 내용을 바탕으로 건강 관련 결정을 내리지 마세요. 전체 면책 조항 읽기
이 논문은 간단한 언어와 창의적인 비유를 사용하여 설명합니다.
문제: 분자의 "미스터리 상자"
당신이 건축가라고 상상해 보세요. 명확한 벽, 문, 창문이 담긴 도면을 대신해 누군가 집의 특징을 설명하는 길고 단일한 문장 하나를 건네줍니다.
"벽돌로 시작해서 왼쪽으로 가고, 오른쪽으로 돌아, 여기에 창문을 만들고, 그 다음에 문을 만들고, 시작점으로 다시 연결되는 벽돌 고리를 만들고..."
이것이 현재 인공지능 모델 (대규모 언어 모델 또는 LLM) 이 분자를 바라보는 일반적인 방식입니다. 분자를 표기하는 표준 방식은 SMILES라고 불립니다. 이는 분자의 실제 3 차원 형태와 연결 관계를 코드 한 줄 안에 숨긴 간결한 텍스트 문자열입니다.
인공지능이 SMILES 로 작성된 분자를 이해하려 할 때, 많은 정신적 체조가 필요합니다. 문장을 읽고, 멈추고, *"잠깐, 지붕이 안전한지, 새로운 방을 추가할 수 있는지 말해 주기 전에 이 집 전체를 머릿속으로 재구성해 봐야겠다"*라고 말해야 합니다. 이 "재구성" 단계는 느리고 오류가 발생하기 쉬우며, 집 (분자) 이 거대하거나 인공지능이 이전에 본 적이 없는 특정 디자인일 때 훨씬 더 어려워집니다.
해결책: MoleCode(레고 도면)
연구자들은 MoleCode라는 새로운 언어를 소개했습니다. MoleCode 를 문장이 아니라 디지털 레고 조립 설명서나 스프레드시트로 생각하세요.
혼란스러운 긴 문장 대신, MoleCode 는 모든 조각 (원자) 과 모든 연결 (결합) 을 명시적으로 나열합니다.
- 원자 1은 탄소입니다.
- 원자 2는 산소입니다.
- 연결: 원자 1 이 원자 2 와 연결되어 있습니다.
이 형식에서 "도면"은 인공지능의 바로 앞에 있습니다. 인공지능은 형태를 추측하거나 재구성할 필요가 없습니다. 형태는 이미 눈에 보이고 수정 가능합니다.
시도했을 때 어떤 일이 일어났나요?
팀은 최상급 인공지능 모델을 사용하여 여러 작업에서 이 새로운 언어를 테스트했습니다. 간단한 비교를 통해 그들이 발견한 바는 다음과 같습니다.
1. 퍼즐 풀기 (추론)
- 이전 방식: 복잡하고 낯선 집의 창문 수를 세어달라고 요청했을 때, SMILES 를 사용하는 인공지능은 종종 긴 문장에 혼란을 느껴 잘못된 답변을 했습니다.
- MoleCode 방식: MoleCode 를 사용하면 인공지능은 부품 목록을 보고 즉시 세어볼 수 있습니다. 인공지능은 복잡한 분자나 낯선 분자의 화학 반응 예측이나 원자 수 세기 같은 작업에서 훨씬 더 뛰어난 성과를 보였습니다.
2. 집 리모델링 (최적화)
- 이전 방식: "이 집을 더 에너지 효율적으로 만들어라"라고 요청하면, 인공지능은 때때로 전체 구조를 헐어내고 완전히 다른 것을 짓거나, 집을 무너뜨리는 변경을 가하기도 했습니다.
- MoleCode 방식: 인공지능이 정확히 어느 "벽돌" (원자) 이 어디에 있는지 볼 수 있었기 때문에, 구조를 무너뜨리지 않고 집을 개선하는 작은 정밀한 변경 (더 좋은 창문으로 교체하는 등) 을 가할 수 있었습니다. 더 지능적이고 안전한 편집을 수행했습니다.
3. 더 빠르게 생각하기 (효율성)
- 이전 방식: 인공지능은 "생각하는 시간"의 대부분을 분자가 어떻게 생겼는지 파악하는 데 보냈습니다. 마치 수학 문제를 풀기 전에 지도를 그리는 데 10 분을 보내는 학생과 같았습니다.
- MoleCode 방식: 지도가 이미 있기 때문에 인공지능은 지도를 그리는 데 더 적은 시간을 보냈습니다. 비록 MoleCode "지시사항"을 읽는 데는 더 오랜 시간이 걸렸지만, 인공지능이 생각하는 데는 더 적은 시간이 소요되어 전체 과정이 더 빠르고 정확해졌습니다.
4. 고층 빌딩 건설 (고분자)
- 이전 방식: 고분자는 반복되는 링크의 거대한 사슬과 같습니다. 이를 문장 (SMILES) 으로 작성하면 거대하고 읽을 수 없는 텍스트 블록이 만들어집니다. 인공지능은 혼란을 겪고 실패했습니다.
- MoleCode 방식: MoleCode 는 이러한 사슬을 "이 블록을 100 번 반복하라"는 지시사항처럼 처리합니다. 인공지능은 이러한 거대하고 반복적인 구조를 완벽하게 처리할 수 있었으며, 반면 이전 방식은 긴 텍스트의 무게에 무너졌습니다.
5. 복잡한 문서 읽기
- 연구자들은 MoleCode 가 단일 분자뿐만 아니라 더 넓은 범위에 적용될 수 있음을 보여주었습니다. 텍스트와 도표를 혼합한 과학 논문과 특허를 읽어서 이를 단일하고 조직화된 그래프로 변환할 수 있습니다. 또한 "마크슈 구조"(여기서 어떤 과일을 추가하든 되는 것과 같은 가변 부분을 가진 화학식) 처럼 표준 텍스트 형식으로 설명하기 매우 어려운 것도 처리할 수 있습니다.
핵심 교훈
이 논문의 주요 교훈은 우리가 과학에 대해 인공지능과 어떻게 소통하는가에 관한 것입니다.
현재 우리는 인공지능에게 과학적 형태를 텍스트로 번역하게 한 뒤, 다시 그 텍스트를 머릿속에서 형태로 번역하게 하고 있습니다. 이 논문은 우리가 연구하는 대상이 (분자와 같은) 구조라면, 인공지능에게 작업할 수 있는 구조적 언어를 제공해야 한다고 주장합니다.
"미스터리 문장"(SMILES) 에서 "명시적 도면"(MoleCode) 으로 전환함으로써, 인공지능은 분자가 어떻게 생겼는지 추측하는 데 에너지를 낭비하는 것을 멈추고 실제로 화학 문제를 해결하는 데 두뇌를 사용하기 시작합니다.
한계점에 대한 note: 논문은 MoleCode 가 인공지능에게 기존에 없던 새로운 화학 지식을 마법처럼 부여하지는 않는다고 명확히 합니다. 인공지능이 화학을 모른다면 여전히 화학을 모를 것입니다. 하지만, 인공지능이 이미 가지고 있는 지식을 훨씬 더 효과적으로 활용할 수 있게 해줍니다. 또한, 새로운 언어는 기존 언어보다 입력하는 데 더 길지만, 인공지능이 덜 생각하면서 더 많은 성과를 거두기 때문에 그 교환 가치는 충분합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.