← 최신 논문
💬 NLP

Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES

이 연구는 Byte-Pair Encoding(BPE)과 Unigram-LM이 화학 SMILES에 대해 근본적으로 구별되며 거의 겹치지 않는 서브워드 어휘 집합을 생성한다는 것을 입증하며, 이는 토큰화 알고리즘의 선택이 중립적인 기본 설정이 아니라 결정적인 모델링 의사결정임을 드러낸다.

원저자: Hunter Heidenreich

게시일 2026-07-08
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hunter Heidenreich

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 질문: 컴퓨터에게 화학식을 읽는 법을 어떻게 가르칠 것인가?

당신이 컴퓨터에게 화학의 언어를 이해하도록 가르치려 한다고 상상해 보세요. 화학자들은 CC(=O)Oc1ccccc1과 같은 문자 및 기호의 나열인 SMILES라는 코드를 사용하여 분자를 작성합니다.

컴퓨터가 무언가를 배우기 전에, 먼저 **토크나이저(tokenizer)**가 필요합니다. 토크나이저를 긴 문장을 컴퓨터가 이해할 수 있는 작은 단위(단어 또는 하위 단어)로 나누는 번역가라고 생각해보세요.

오랫동안 화학 분야는 자연어 처리(컴퓨터가 영어를 읽는 방식)에서 사용되는 **BPE (Byte-Pair Encoding)**라는 방식을 맹목적으로 모방해 왔습니다. 이 논문의 연구자들은 다음과 같은 단순한 질문을 던졌습니다. "이것이 화학식을 나누는 최선의 방법일까, 아니면 더 나은 방법이 있을까?"

그들은 표준적인 방식인 BPEUnigram-LM이라고 불리는 다른 방식을 비교했습니다.

실험: 두 종류의 가위

당신에게 다양한 색깔의 구슬로 만들어진 길고 복잡한 목걸이(화학식)가 있다고 상상해 보세요. 당신은 이 목걸이를 연구하기 위해 더 작은 조각으로 잘라야 합니다. 당신에게는 두 종류의 서로 다른 가위가 있습니다.

  1. 탐욕스러운 가위 (BPE): 이 가위는 전체 목걸이 더미에서 가장 자주 함께 나타나는 두 개의 구슬을 찾습니다. 그리고 그 두 개를 하나의 "슈퍼 구슬"로 붙여버리고 이 과정을 반복합니다. 이 가위는 공격적이고 탐욕적이며, 빈번한 패턴을 통해 큰 덩어리를 만들려고 노력합니다.
  2. 확률적 가위 (Unigram-LM): 이 가위는 거대한 구슬 더미에서 시작하여 다음과 같이 묻습니다. "만약 내가 이 특정 구슬을 제거한다면, 전체적인 그림에 얼마나 타격을 줄까?" 이 가위는 필수적이지 않은 부분들을 신중하게 쳐내며, 더 세밀하고 상세한 관점을 유지합니다.

놀라운 발견: 두 가위는 합의하지 않는다

연구자들은 화학식은 매우 엄격하기 때문에(원자들이 특정한 방식으로 연결되어야 함), 두 가위가 거의 같은 곳을 자르게 될 것이라고 예상했습니다. 즉, "화학의 규칙"이 두 방식이 수렴하도록 강제할 것이라고 생각했습니다.

하지만 그들은 틀렸습니다.

두 방식 모두 정확히 동일한 화학 데이터, 동일한 시작 규칙, 그리고 동일한 어휘 크기를 사용했음에도 불구하고, 두 방식은 완전히 다른 집합의 "단어들"을 만들어냈습니다.

  • 겹치는 부분이 매우 적음: 만약 BPE가 만든 "슈퍼 구슬" 목록과 Unigram-LM이 만든 목록을 비교한다면, 두 목록은 거의 아무것도 공유하지 않았습니다. 최악의 경우, 공유하는 조각은 16% 미만이었습니다. 가장 중요한 고빈도 조각들만 살펴보는 최선의 경우에도, 공유하는 비율은 5% 미만이었습니다.
  • "자르는" 깊이: 두 방식은 어디에서 자를지에 대해서는 동의했지만(분자의 골격), 얼마나 깊게 자를지에 대해서는 의견이 엇갈렸습니다.
    • BPE는 더 거친(coarse) 절단을 하는 경향이 있었습니다. 즉, 원자 고리 전체를 하나의 커다란 토큰으로 묶어버립니다.
    • Unigram-LM은 더 세밀한(fine) 절단을 했습니다. 고리를 더 작은, 원자 수준에 가까운 조각들로 유지했습니다.
    • 결과: Unigram-LM은 동일한 분자를 설명하기 위해 BPE보다 29%에서 41% 더 많은 토큰(조각)을 사용했습니다.

시각적 비유: 지도 vs 거리 뷰

당신이 도시의 지도를 보고 있다고 상상해 보세요.

  • BPE는 전체 동네를 하나의 블록으로 그룹화하는 지도와 같습니다. "이 구역 전체가 '시내'이다"라고 말합니다. 효율적이고 더 적은 단어를 사용합니다.
  • Unigram-LM은 모든 건물과 길모퉁이를 나열하는 거리 뷰와 같습니다. "여기는 빵집, 여기는 공원, 여기는 집이다"라고 말합니다. 훨씬 더 많은 단어를 사용하지만 더 상세한 분석을 제공합니다.

논문은 이 두 지도가 서로 대체 가능하지 않다는 것을 보여주었습니다. 만약 한 쪽에서 다른 쪽으로 바꾼다면, 컴퓨터는 데이터의 구조를 근본적으로 다르게 보게 됩니다.

핵심 결과 (쉬운 설명)

  1. 이것은 기본값이 아닌 설계의 선택입니다: 이 분야는 자연어 모델에서 사용하는 방식이기 때문에 BPE를 기본값으로 사용해 왔습니다. 이 논문은 화학에서 단순히 그 선택을 복사해서 붙여넣을 수 없음을 증명합니다. 어떤 "가위"를 사용할지 적극적으로 결정해야 합니다. 왜냐하면 두 방식은 서로 다른 결과를 만들어내기 때문입니다.
  2. 차이는 안정적입니다: 이러한 불일치는 우연히 발생한 것이 아닙니다. 이는 다양한 유형의 화학 물질(흔한 약물, 희귀한 천연물, 다양한 분자들)에 걸쳐 나타났으며, 심지어 복잡한 원자를 처리하는 규칙을 변경했을 때도 마찬가지였습니다.
  3. 규모가 해결해주지 않습니다: 보통 컴퓨터에게 더 많은 데이터나 더 큰 어휘를 주면 상황이 완화될 수 있습니다. 연구자들은 어휘를 8배 더 크게 만들어 이 테스트를 진행했습니다. 하지만 두 방식은 여전히 일치하지 않았습니다. 그들은 여전히 별개의 상태로 남았습니다.
  4. "중첩(Nesting)" 효과: 비록 서로 다른 단어를 사용하지만, 두 방식은 서로 충돌하지 않습니다. Unigram-LM의 절단선은 거의 항상 BPE의 절단선 "안에" 위치합니다. 마치 BPE는 "피자 전체를 잘라라"라고 말하고, Unigram-LM은 "피자를 자른 다음, 다시 조각을 잘라라"라고 말하는 것과 같습니다. 이들은 서로 호환되지만, 상세 수준이 다를 뿐입니다.

독자를 위한 의미

이 논문은 선택한 알고리즘이 주요한 모델링 결정 사항임을 결론짓습니다.

  • 만약 BPE를 선택한다면, 더 짧은 시퀀스(더 적은 토큰)를 얻게 되어 컴퓨터가 처리하기에 비용이 적게 들지만, 분자의 구조에 대한 세밀한 디테일을 놓칠 수 있습니다.
  • 만약 Unigram-LM을 선택한다면, 분자에 대한 더 상세하고 미세한 관점을 얻을 수 있지만, 컴퓨터가 더 많은 토큰을 처리해야 합니다.

저자들은 어떤 방식이 컴퓨터를 화학 반응이나 약물 특성 예측에 더 똑똑하게 만드는지까지는 테스트하지 않았습니다. 그들은 단지 두 방식이 서로 다른 언어를 만든다는 것을 증명했을 뿐입니다. 따라서 화학계는 이제 이 두 방식이 같다고 가정할 수 없으며, 자신의 "가위"를 신중하게 선택해야 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →