← 최신 논문
📄 chemistry

Evaluating the Impact of Tokenization Schemes on the Performance of Chemical Language Models

본 연구는 세 가지 모델 규모에 걸쳐 9가지 SMILES 토큰화 전략을 체계적으로 평가한 첫 사례를 제시하며, 규칙 기반 토크나이저가 생성적 유효성 측면에서 뛰어나지만 코퍼스 기반 및 하이브리드 접근 방식이 다운스트림 물성 예측에서 더 우수한 성능을 보임을 밝힘으로써, 궁극적으로 일반화 가능한 화학 언어 모델을 위한 하이브리드 전략을 권장한다.

원저자: Naafey Aamer, Arooj Zaib, Faiza Hassan, Tayyaba Asif, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

게시일 2026-08-26
📖 3 분 읽기☕ 가벼운 읽기

원저자: Naafey Aamer, Arooj Zaib, Faiza Hassan, Tayyaba Asif, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 실험실에서 화학의 언어는 점차 시험관과 비커뿐만 아니라 텍스트의 줄로도 쓰이고 있습니다. 과학자들은 오래전부터 복잡한 분자를 단순한 문자열로 표현하기 위해 SMILES라고 불리는 약어를 사용해 왔는데, 이는 마치 문장이 하나의 이야기를 설명하는 것과 같습니다. 이 형식은 원래 인간의 언어를 읽도록 설계된 강력한 컴퓨터 프로그램이 화학 구조를 분석할 수 있게 해줍니다. 화학 언어 모델이라고 알려진 이러한 프로그램들은 새로운 약물이 어떻게 행동할지 예측하거나, 심지어 완전히 새로운 분자를 무에서 유로 창조해낼 수도 있습니다. 하지만 컴퓨터가 화학 문자열을 이해하기 위해서는 먼저 그 문자열을 더 작고 관리하기 쉬운 조각들로 나누어야 하며, 이 과정을 토큰화(tokenization)라고 부릅니다. 독자가 문장의 의미를 이해하기 위해 문장을 단어로 나누는 것처럼, 컴퓨터는 분자의 구조를 파악하기 위해 화학 문자열을 토큰으로 나눕니다. 연구자들이 직면한 핵심적인 질문은 이 분해 작업을 수행하는 최선의 방법이 무엇인가 하는 것입니다. 즉, 컴퓨터가 무엇이 화학적 부분인지를 규정하는 엄격하고 미리 작성된 규칙을 따라야 할까요, 아니면 수백만 개의 사례를 읽으며 스스로 패턴을 찾는 법을 배워야 할까요?

카이저슬라우테른-란다우 대학교와 독일 인공지능 연구 센터의 연구진은 포괄적인 연구를 통해 이 질문에 답하고자 했습니다. 그들은 분야의 역사를 조사하며 200편 이상의 연구 논문을 검토하여 과학자들이 컴퓨터에게 화학 문자열을 읽는 법을 가르쳐 온 다양한 방식들을 식별했습니다. 이 방대한 조사로부터 그들은 9가지의 뚜렷한 방법들을 선정하였고, 이를 세 가지 그룹으로 분류했습니다: 고정된 화학 규칙에 의존하는 방식, 데이터로부터 완전히 학습하는 방식, 그리고 두 가지 접근 방식을 혼합한 방식입니다. 이 방법들을 공정하게 테스트하기 위해, 연구진은 소형부터 매우 대형에 이르기까지 다양한 크기의 일련의 컴퓨터 모델을 구축하였고, 거의 200만 개의 화학 문자열이 담긴 거대한 데이터셋을 사용하여 이들을 훈련시켰습니다. 그 후 그들은 이 모델들을 두 가지 종류의 테스트에 투입했습니다. 첫째, 그들은 모델이 일부를 숨긴 후 원래의 화학 문자열을 얼마나 잘 재구성하는지 확인했는데, 이는 컴퓨터가 화학의 기본 문법을 얼마나 잘 배웠는지를 측정하는 척도입니다. 둘째, 그들은 모델을 실제 세계의 과업에 적용하여, 약물이 물에 얼마나 잘 녹는지 또는 혈뇌장벽을 통과할 가능성이 얼마나 되는지와 같은 특정 분자의 특성을 예측하도록 했습니다.

결과는 새로운 분자를 생성하는 능력과 그 특성을 예측하는 능력 사이에 명확하고 놀라운 절충 관계(trade-off)가 있음을 드러냈습니다. 화학적 정의를 엄격히 따르는 규칙 기반 토크나이저로 훈련된 모델들이 재구성 작업에서 가장 뛰어난 성능을 보였습니다. 이들은 숨겨진 화학 문자열의 부분을 높은 정확도로 결합해 낼 수 있었으며, 무엇보다도 결과물인 분자가 화학적으로 유효하고 물리적으로 가능한 상태임을 보장했습니다. 이는 목표가 새로운 화합물을 발명하는 것일 때 이 모델들이 우월한 선택임을 의미하는데, 왜냐하면 이들은 거의 불가능하거나 터무니없는 결과를 만들어내지 않기 때문입니다. 그러나 연구진이 분자의 특성을 예측하는 과업으로 눈을 돌렸을 때, 이야기는 달라졌습니다. 데이터 중심 또는 하이브리드 접근 방식을 사용한 모델들, 즉 컴퓨터가 데이터 자체로부터 유연한 패턴을 학습할 수 있도록 허용한 모델들이 엄격한 규칙 기반 모델들보다 일관되게 더 나은 성과를 보였습니다. 이러한 유연한 모델들은 엄격한 규칙이 놓치는 화학 문자열 내의 미묘한 관계를 인식하는 법을 배웠으며, 이를 통해 분자가 실제 세계에서 어떻게 행동할지에 대해 더 정확한 예측을 이끌어냈습니다.

또한 이 연구는 단순히 컴퓨터 모델을 크게 만드는 것이 문제를 해결할 수 있는지 탐구했습니다. 그들은 더 많은 컴퓨례 능력이 좋지 않은 토큰화 선택을 극복할 수 있는지 확인하기 위해 700만, 5,000만, 1억 5,000만 개의 파라미터를 가진 모델들을 테스트했습니다. 그들은 모델이 커질수록 일반적으로 성능이 향상되기는 하지만, 모델이 5,000만 개에서 1억 5,000만 개로 성장함에 따라 그 이득이 현저히 감소한다는 것을 발견했습니다. 이는 화학 데이터를 분해하는 방식이 단순히 컴퓨터 모델의 규모 자체보다 더 중요할 수 있음을 시사합니다. 잘 선택된 토큰화 전략은 단순히 더 많은 컴퓨팅 용량을 추가하는 것보다 더 나은 결과를 낼 수 있습니다. 궁극적으로 연구진은 모든 상황에 적용되는 단 하나의 최선의 방법은 없다는 결론을 내렸습니다. 만약 목표가 새로운 분자를 설계하는 것이라면, 규칙 기반 접근 방식이 가장 안전하고 효과적인 경로입니다. 하지만 목표가 분자가 어떻게 작용할지 예측하는 것이라면, 화학적 지식과 데이터 중심의 유연성을 결ền합한 하이브리드 접근 방식이 가장 강력한 해결책을 제공합니다. 이 연구는 컴퓨터에게 화학을 읽는 법을 가르치는 방식의 선택이 컴퓨터 그 자체만큼이나 중요하다는 것을 보여줌으로써 과학자들에게 명확한 가이드를 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →