← 최신 논문
🤖 machine learning

Molecular Representations for Large Language Models

본 논문은 대규모 언어 모델과 함께 사용될 때 SMILES 및 IUPAC 명명과 같은 기존 형식보다 다양한 추론 작업에서 체계적으로 우수한 성능을 보이는 새로운 분자 표현인 MolJSON 을 소개하며, 명시적인 분자 그래프 스키마가 화학 분야에서 대규모 언어 모델의 성능을 크게 향상시킨다는 점을 입증합니다.

원저자: Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

게시일 2026-05-05
📖 3 분 읽기☕ 가벼운 읽기

원저자: Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

상상해 보세요. 당신은 천재적이지만 문자 그대로만 이해하는 로봇에게 분자처럼 복잡한 3 차원 구조를 이해하고 그리는 법을 가르치려 합니다. 문제가 로봇이 멍청해서가 아니라, 당신이 로봇에게 잘못된 언어로 말하고 있기 때문입니다.

이 논문은 대형 언어 모델 (LLM) 이 화학에 대해 이야기할 때 올바른 "방언"을 찾는 것에 관한 것입니다.

문제: "화학자"로 말하기 vs "로봇"으로 말하기

수십 년 동안 화학자들은 컴퓨터에 분자를 기록하기 위해 두 가지 주요 방식을 사용해 왔습니다.

  1. SMILES: 분자를 "걸어 다니며" 설명하는 길고 혼란스러운 문자열이라고 생각하세요. 마치 "정문에서 시작해 왼쪽으로 돌아 계단을 올라가 오른쪽으로 돌아 주방에 도착한다"고 말하며 집을 설명하는 것과 같습니다. 한 걸음이라도 놓치거나 순서를 잘못하면 전체 설명이 무너집니다.
  2. IUPAC 이름: "에탄산"과 같은 공식적이고 사람이 읽을 수 있는 이름들입니다. 이는 집을 설명하기 위해 복잡한 법적 계약을 읽는 것과 같습니다. 인간에게는 정밀하지만 규칙이 매우 엄격하고 문장이 길기 때문에 로봇이 구문 분석하기 매우 어렵습니다.

연구자들은 AI 모델에게 이러한 오래된 형식을 사용하여 분자를 읽거나 쓰도록 요청했을 때, 모델들이 많은 실수를 저지른다는 사실을 발견했습니다. 이는 로봇에게 외국어로 쓰인 문단 형태의 지시를 바탕으로 레고 성을 쌓으라고 요청하는 것과 같아, 종종 잘못된 것을 만들거나 혼란을 겪었습니다.

해결책: "MolJSON" 소개

저자들은 MolJSON이라는 새로운 형식을 만들었습니다.

MolJSON 을 이야기나 일련의 지시문이 아니라 청사진이나 부품 목록으로 생각하세요.

  • "A 지점에서 B 지점으로 걸어 가라"고 말하는 대신, MolJSON 은 "여기에 모든 벽돌 (원자) 목록이 있고, 여기에는 정확히 어떤 벽돌들이 서로 붙어 있는지 (결합) 에 대한 목록이 있다"고 말합니다.
  • 이는 컴퓨터가 좋아하는 구조화된 목록 (JSON) 형태를 띠고 있습니다. AI 가 분자를 "걸어 다니게" 하거나 복잡한 문법 규칙을 해독하게 강요하지 않고, 모든 조각과 그 연결 방식을 명시적으로 나열합니다.

실험: 번역 테스트

이 새로운 언어가 더 잘 작동하는지 확인하기 위해 연구자들은 다양한 AI 모델 (GPT-5 및 Claude 등) 을 대상으로 세 가지 유형의 테스트를 설정했습니다.

  1. 번역사 테스트: AI 에게 한 형식 (예: SMILES 문자열) 으로 된 분자를 주고 다른 형식으로 다시 쓰도록 요청합니다.

    • 결과: AI 가 새로운 형식을 MolJSON 으로 출력해야 할 때, **71%**의 정확도를 보였습니다. 반면 SMILES 나 IUPAC 이름으로 출력해야 할 때는 정확도가 **43%**에 불과했습니다. AI 는 단순히 오래된 언어를 잘 구사하지 못했습니다.
  2. 미로 테스트 (최단 경로): AI 에게 분자를 주고 "이 불소 원자와 저 염소 원자 사이에는 몇 개의 결합이 있나요?"라고 묻습니다.

    • 결과: MolJSON 을 사용할 때 AI 는 **98.5%**의 정확도로 정답을 맞췄습니다. SMILES 를 사용할 때는 92%, IUPAC 이름을 사용할 때는 **82%**로 떨어졌습니다.
    • 보너스: AI 는 MolJSON 청사진을 제공받을 때 미로를 풀기 위해 더 적은 "브레인 토큰 (연산 능력)"을 사용했습니다. 구조를 먼저 파악하려고 에너지를 낭비할 필요가 없었기 때문입니다.
  3. 건설가 테스트 (제약 생성): AI 에게 "불소 하나, 염소 하나, 고리 두 개를 가진 분자를 만들어라"고 요청합니다.

    • 결과: AI 가 MolJSON 으로 답을 출력할 수 있도록 허용되었을 때, **95%**의 성공률을 보였습니다. 반면 SMILES 문자열로 출력하도록 강요당했을 때는 **64%**만 성공했습니다.

왜 MolJSON 이 이겼을까요?

이 논문은 SMILES 와 IUPAC 이름이 AI 에게 두 가지 어려운 일을 동시에 하도록 강요한다고 제안합니다.

  1. 구조 해독: 텍스트에서 분자가 어떻게 생겼는지 파악해야 합니다.
  2. 구조 재인코딩: 그 정신적 이미지를 다시 엄격한 텍스트 형식으로 변환해야 합니다.

MolJSON 은 어려운 부분을 건너뜁니다. AI 에게 구조 (원자와 결합) 를 직접 제공하고, 구조를 직접 출력하게 합니다. 이는 분자를 만드는 방법을 설명하는 문단 대신 로봇에게 레고 벽돌 상자와 완성된 성의 그림을 주는 것과 같습니다.

결론

연구자들은 분자를 표현하는 방식의 선택이 AI 자체의 지능만큼이나 중요하다는 사실을 발견했습니다. AI 모델들이 수백만 개의 SMILES 문자열과 IUPAC 이름으로 훈련되었음에도 불구하고, 이 새로운 구조화된 "청사진" 형식 (MolJSON) 을 사용할 때 훨씬 더 뛰어난 성능을 발휘했습니다.

간단히 말해: AI 에게 화학을 시키려면 화학적 수수께끼 (SMILES/IUPAC) 로 말하지 말고, 명확하고 구조화된 청사진 (MolJSON) 으로 말하기 시작하세요.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →