← 최신 논문
📄 chemistry

JURY: A Comprehensive Training-Free to Fully-Supervised Framework for Evaluating Chemical Language Models

이 논문은 학습이 필요 없는 방식부터 완전 지도 학습 방식에 이르기까지 네 가지 뚜렷한 프로브를 활용하여 화학 언어 모델을 엄격하게 평가하는 포괄적인 프레임워크인 JURY를 소개하며, 이들을 통해 화학 모델의 진정한 화학적 인코딩 능력이 강력한 예측 헤드에 의해 종종 가려져 있으며 실제로는 이전에 생각했던 것보다 전통적인 핑거프린트와 더 유사하다는 점을 밝혀낸다.

원저자: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Daanish Uddin Khan, Naafey Aamer, Muhammad Sajjad, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

새로운 약물을 발견하기 위한 경주에서, 과학자들은 모든 돌파구를 늦추는 병목 현상에 직면해 있습니다. 새로운 화학 화합물이 약물이 되기 전에는 반드시 엄격한 일련의 안전 점검을 통과해야 하기 때문입니다. 연구자들은 이 물질이 체내에 어떻게 흡수되는지, 혈액을 통해 어떻게 이동하는지, 간에서 어떻게 분해되는지, 그리고 독성이 있는지 알아야 합니다. 흡수, 분포, 대사, 배설 및 독성으로 알려진 이러한 점검은 실험실에서 수행하기에 비용이 많이 들고 시간이 오래 걸립니다. 이를 가속화하기 위해 과학자들은 컴퓨터를 활용하여, 인공지능을 이용해 분자의 구조만 보고 이러한 특성을 예측하는 방법을 사용해 왔습니다. 수년 동안 가장 성공적인 도구들은 텍스트 문자열로 작성된 수백만 개의 화학식으로 학습된 "언어 모델"이었습니다. 이 모델들은 복잡한 분자를 하나의 고정된 숫자 목록, 즉 그 화학적 본질을 포착하는 디지털 지문으로 압축하는 법을 배웁니다. 이 모델들이 얼마나 좋은지를 판단하는 표준적인 방법은 이들에게 간단한 예측 도구를 부착하고, 그 도구를 소수의 실험 데이터로 학습시킨 뒤, 그 도구가 정답을 얼마나 잘 맞히는지 확인하는 것이었습니다. 만약 예측이 정확하다면, 그 모델은 높은 점수를 받았습니다.

하지만 한 새로운 연구는 이 표준적인 방법이 중요한 진실을 숨겨왔을 가능성을 시사합니다. 연구진은 예측 도구 자체가 너무 많은 역할을 수행하여, 근본적인 모델이 실제로 무엇을 배웠는지 가려버리는 경우가 많다는 것을 발견했습니다. 강력한 도구는 설령 읽어 들이는 디지털 지문이 약하거나 도움이 되지 않더라도, 주어진 답으로부터 많은 것을 배울 수 있습니다. 이를 해결하기 위해 독일의 연구팀은 JURY라고 불리는 새로운 모델 테스트 방식을 개발했습니다. 연구진은 모델의 디지털 지문을 읽기 위해 단 하나의 학습된 도구에 의존하는 대신 네 가지 서로 다른 방법을 사용했습니다. 두 가지 방법은 학습이 전혀 필요하지 않았으며, 단순히 디지털 공간에서 분자들이 서로 얼마나 가까이 위치하는지만을 살펴보았습니다. 나머지 두 가지 방법은 기본적인 직선 계산부터 작은 유연한 네트워크에 이르기까지 간단한 학습을 사용했습니다. 이 네 가지 방법을 73가지의 다양한 안전 테스트에 걸쳐 10개의 화학 모델에 적용했을 때, 연구진은 모델들이 생각보다 훨씬 더 서로 유사하다는 것을 발견했습니다. 어떤 단일 모델도 모든 분야에서 최고는 아니었습니다. 사실, 수십 년 된 수작업 방식의 분자 기술법이 많은 경우 최첨단 현대 AI만큼이나 뛰어난 성능을 보였습니다.

가장 놀라운 발견은 모델들이 보유한 화학적 지식의 양이 다른 것이 아니라, 그 지식을 조직하는 방식이 다르다는 점이었습니다. 어떤 모델은 유사한 특성을 가진 분자들이 자연스럽게 가까이 위치하도록 디지털 지문을 배치하여, 추가 학습 없이도 쉽게 찾을 수 있게 만듭니다. 반면 다른 모델들은 동일한 화학적 지식을 학습된 예측 도구가 데이터를 재배열해야만 비로소 드러나도록 숨겨둡니다. 이는 마치 한 사서는 책을 장르별로 이미 분류해 놓았지만, 다른 사서는 책을 무작위로 쌓아두었으나 올바른 질문을 던지면 특정 책을 정확히 찾아낼 수 있는 도서관을 보는 것과 같습니다. 연구는 첫 번째 방식에 뛰어난 모델이 두 번째 방식에서는 실패할 수 있으며, 그 반대도 마찬가지라는 것을 보여주었습니다. 이는 단 하나의 점수로는 모델이 좋은지 알 수 없으며, 모델의 강점이 어디에 있는지 이해하기 위해서는 다양한 테스트 방식에 걸친 프로필을 살펴봐야 함을 의미합니다.

연구진은 세 가지 다른 트랜스포머 계열을 사용하는 여러 모델을 포함하여 10가지의 서로 다른 화학 언어 모델과, '확장 연결 지문(extended-connectivity fingerprint)'이라 불리는 전통적인 수작업 방식을 테스트했습니다. 연구진은 약물의 흡수부터 독성 여부에 이르기까지 73가지의 다양한 과제에 이 네 가지 테스트 방법을 적용했습니다. 결과 분석 결과, 어떤 테스트 방법을 사용하느냐에 따라 모델의 순위가 완전히 바뀌는 것을 발견했습니다. 학습이 필요 없는 방법으로 테스트했을 때 1위를 차지했던 모델이, 예측 도구를 학습시키는 방법을 사용하면 리스트의 최하위로 떨어지는 경우가 빈번했습니다. 반대로, 학습 없이는 고전했던 모델이 단순한 예측 도구가 추가되자 상위권으로 올라오기도 했습니다. 이러한 불일치는 모델들이 단순히 "더 좋거나" "나쁜" 것이 아니라, 화학적 지식을 근본적으로 다른 방식으로 저장하고 있음을 입증했습니다.

MoLFormer-XL이라는 모델은 자신의 디지털 공간을 매우 명확하게 배치하여, 유사한 행동을 보이는 분자들이 이미 그룹화되어 있음을 보여주었습니다. 이 모델은 추가적인 도구를 학습시키지 않고 디지털 공간의 최근접 이웃을 살펴보는 방식에서 탁월한 성능을 보였습니다. 대조적으로, MolEncoder라는 모델은 연구진이 디지털 공간의 원시 배열을 살펴보았을 때는 낮은 성능을 보였습니다. 그러나 단순한 예측 도구를 데이터에 학습시키자, MolEncoder는 순위의 최상단으로 뛰어올랐습니다. 이는 MolEncoder가 동일한 양의 화학적 지식을 보유하고 있었지만, 그것이 학습된 도구를 통해서만 해독될 수 있는 형태로 숨겨져 있었음을 보여줍니다. 또한 연구는 현대 AI 이전에 만들어진 전통적인 수작업 지문 방식이, 학습이 허용되지 않는 상황에서는 인체 내 화학물질의 거동을 예측할 때 최첨단 모델들보다 더 나은 성능을 보이는 경우가 많다는 것을 발견했습니다. 이는 특정 과제의 경우, 화학 데이터를 조직하는 옛 방식이 여전히 매우 효과적임을 시사합니다.

연구팀은 이 분야가 복잡한 시스템을 판단할 때 단 하나의 숫자에 의존해 왔으며, 이는 마치 음악가의 실력을 단 한 곡의 노래로만 판단하는 것과 같다고 결론지었습니다. 모델은 데이터가 내부적으로 어떻게 구조화되어 있느냐에 따라 특정 유형의 예측에는 탁월할 수 있지만, 다른 유형의 예측에는 형편없을 수 있습니다. 새로운 프레임워크인 JURY는 단일 점수 대신, 모델이 다양한 수준의 감독 하에서 어떻게 수행되는지를 보여주는 상세한 프로필로 대체합니다. 이를 통해 과학자들은 목적에 맞는 적절한 도구를 선택할 수 있습니다. 만약 연구자가 새로운 도구를 학습시키는 데 시간을 쓰지 않고 화학 라이브러리를 빠르게 스크리닝하기를 원한다면, 학습되지 않은 테스트에서 성능이 좋은 모델을 선택해야 합니다. 반면, 충분한 데이터가 있고 고도의 정밀도가 필요한 과제를 위해 특정 예측기를 학습시키고자 한다면, 학습 후에만 뛰어난 성능을 보이는 모델을 선택할 수 있습니다. 모델의 지식이 어디에 위치하며 어떻게 조직되어 있는지 이해함으로써, 과학자들은 단순한 순위를 넘어 이 인공지능들이 실제로 무엇을 배웠는지에 대한 더 깊은 이해를 바탕으로 더 나은 결정을 내릴 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →