A Large Scale Investigation of Scaling Limits in Chemical Language Models
3만 개 이상의 실험을 대상으로 한 이 대규모 연구는 화학 언어 모델의 스케일링이 사전 학습 손실과 화학적 구문 이해도를 개선함에도 불구하고, 이러한 이득이 목표 지향적 분자 설계의 비례적인 개선으로 이어지지는 않는다는 점을 밝혀냈으며, 이는 최첨단 NovoMolGen 제품군의 도입에도 불구하고 표현 학습과 다운스트림 유용성 사이의 결정적인 단절을 강조한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
현대 과학의 광활한 풍경 속에서, 단순히 컴퓨터 모델을 더 크게 만들고 더 많은 데이터를 입력하기만 하면 모델이 필연적으로 더 똑똑해질 것이라는 믿음이 커지고 있습니다. '스케일링(scaling)'이라 알려진 이 개념은 기계가 방대한 인류의 저술로부터 학습함으로써 에세이를 쓰고, 텍els를 번역하며, 대화를 나눌 수 있게 함으로써 언어를 이해하는 방식에 혁신을 가져왔습니다. 과학자들은 최근 이와 동일한 논리를 화학에 적용하여 '화학 언어 모델'을 만들어냈습니다. 이는 컴퓨터가 문장을 읽는 법을 배우는 것과 마찬가지로, 분자를 나타내는 문자열을 읽고 쓰는 법을 학습하도록 훈련된 인공지능 시스템입니다. 이러한 화학 모델을 더 크게 만들고 더 많은 분자로 훈련시킨다면, 이들이 자연스럽게 새로운 약물을 설계하고 질병을 치료하거나 완화할 수 있는 새로운 화합물을 찾아낼 수 있을 것이라는 희망이 있었습니다.
그러나 최근의 대규모 조사 결과는 이러한 단순한 가정을 반박합니다. 연구진은 언어 학습을 지배하는 규칙이 화학적 설계라는 복잡한 세계에도 적용되는지 테스트하기 위해 실험을 진행했습니다. 그들은 매우 작은 모델부터 극도로 큰 모델까지 일련의 모델군을 구축하고, 수십억 개의 분자를 학습시켜 성능이 어떻게 변화하는지 관찰했습니다. IIT 마드라스와 밀라(Mila) - 퀘벡 AI 연구소를 포함한 기관들의 연구진이 수행한 이 연구는 놀라운 괴리를 드러냈습니다. 모델이 성장함에 따라 화학의 기초적인 문법을 이해하는 능력은 실제로 향상되었지만, 이러한 개선이 특정하고 유용한 약물을 설계하는 결과로 이어지지는 않았습니다. 사실, 연구진은 새로운 의약품을 찾는 까다로운 과업을 수행할 때 상대적으로 작은 모델이 거대한 모델만큼이나 잘 수행할 수 있다는 것을 발견했으며, 이는 단순히 컴퓨터를 크게 만드는 것이 신약 개발의 비밀을 푸는 열쇠가 아님을 시사합니다.
연구진은 3만 개 이상의 서로 다른 버전의 화학 모델을 훈련하는 것으로 시작했습니다. 그들은 모델의 크기를 50만 개에서 10억 개의 파라미터까지 다양하게 조절했고, 다양한 유형의 분자 데이터를 입력했으며, 화학 구조를 표현하는 다양한 방법들을 사용하여 테스트했습니다. 한 가지 핵심적인 발견은 모델이 커지고 더 많은 데이터를 접할수록 다음 화학 문자열을 예측하는 정확도가 높아졌다는 점입니다. 이는 아이가 언어를 배울 때 문장에서 다음 단어를 추측하는 능력이 점차 향ло지는 것과 유사합니다. 모델들은 화학적 구문론(syntax)의 규칙을 이해하는 데 탁월해졌으며, 어떤 원자 조합이 유효한 분자를 형성하고 어떤 조합이 그렇지 않은지를 알게 되었습니다. 이러한 화학적 구조에 대한 내부적 이해는 가장 큰 모델에서도 계속해서 개선되었으며, 이는 컴퓨터가 성공적으로 화학의 '어휘'와 '문법'을 암기하고 있음을 시사합니다.
하지만 연구진이 실제 약물 설계라는 목표로 모델을 테스트했을 때, 이야기는 극적으로 변했습니다. 연구진은 모델에게 특정 질병 표적에 결합하거나 바람직한 화학적 특성을 충족하는 새로운 분자를 생성하도록 요청했는데, 이는 복잡한 시행착오의 과정을 수반하는 작업입니다. 여기서 모델 크기에 따른 이점은 사라졌습니다. 목표 지향적인 분자를 설계하는 데 있어 모델의 성능은 모델 크기가 약 500만 개의 파라미터에 도달했을 때 정체되거나 평탄해졌습니다. 모델 크기를 200배 더 큰 10억 개의 파라미터로 늘려도, 그들이 설계할 수 있는 약물의 품질 면에서 거의 추가적인 개선이 나타나지 않았습니다. 500만 개의 파라미터를 가진 모델은 신약 후보 물질을 찾는 데 있어 10억 개의 파라미터를 가진 거대 모델만큼이나 잘 수행했습니다.
이 결과는 다음 문자의 예측에 초점을 맞춘 현재의 모델 훈련 방식이 컴퓨터에게 화학의 규칙은 가르칠 수 있지만, 그 분자들이 생물학적 시스템과 어떻게 상호작용하는지에 대한 더 깊은 의미까지는 가르치지 못한다는 것을 시사합니다. 모델들은 화학의 언어를 유창하게 말하는 법은 배웠지만, 그 언어를 사용하여 특정 문제를 해결하는 법은 배우지 못했습니다. 연구진은 큰 모델들이 유효한 분자를 생성할 수는 있었지만, 의학에 필요한 특정 고품질 분자를 찾는 데 있어서는 유의미하게 더 나아지지 않았음을 발견했습니다. 이 연구는 병목 현상이 모델의 크기나 데이터의 양이 아니라, 모델을 훈련하는 방식과 최적화하도록 요구되는 목표에 있음을 보여줍니다.
이 발견이 주는 시사점은 인공지능 과학의 미래에 있어 매우 중요합니다. 이는 신약 개발을 향한 길이 단순히 더 큰 컴퓨터 모델을 구축하는 것이 아니라, 우리가 이미 보유한 모델을 더 똑똑하게 훈련시키는 방법을 개발하는 데 있을 수 있음을 시사합니다. 연구진은 단순히 컴퓨터에게 다음 화학 기호를 예측하도록 가르치는 대신, 단백질과 어떻게 상호작용하는지 또는 인체 내에서 어떻게 행동하는지와 같은 분자의 기능적 특성을 이해하도록 가르쳐야 한다고 제안합니다. 표면적인 패턴보다는 이러한 더 깊은 화학적 의미에 집중함으로써, 과학자들은 차세대 생명을 구하는 의약품을 설계하기 위한 더 효율적이고 효과적인 도구를 만들 수 있을 것입니다. 이 연구는 화학이라는 복잡한 세계에서는 '큰 것이 항상 더 좋은 것은 아니며', 진정한 지능은 방대한 패턴의 기억 그 이상을 필요로 한다는 점을 상기시켜 줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.