← 최신 논문
💻 computer science

Empty scaffold allocation bias in molecular distribution shift evaluation

이 논문은 표준 스캐폴드 기반 평가 방법이 화학적으로 이질적인 "노-스캐폴드(no-scaffold)" 분자들을 단일 단위로 잘못 취급함으로써 숨겨진 할당 편향을 유발하고 공통 벤치마크 전반의 일반화 지표를 왜곡한다는 점을 밝히며, 균형 잡힌 표현과 정확한 성능 평가를 복구하기 위한 "엠티-스캐폴드-어웨어(Empty-Scaffold-Aware)" 수정을 제안한다.

원저자: Tao Song, Yong Wang, Shuang Wang, Xun Wang

게시일 2026-07-13
📖 5 분 읽기🧠 심층 분석

원저자: Tao Song, Yong Wang, Shuang Wang, Xun Wang

원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 요리 원리를 배울 수 있는 로봇에게 요리법을 가르치려는 셰프라고 상상해 보십시오. 당신은 로봇이 단순히 특정 레시피를 암기하는 것인지, 아니면 실제로 요리의 원리를 배울 수 있는지 알고 싶습니다. 이를 테스트하기 위해, 당신은 로봇에게 한 번도 본 적 없는 새로운 요리들(테스트 세트)을 시험하기 전, 일련의 연습 요리들(훈련 세트)을 제공하기로 합니다.

AI 화학의 세계에서 과학자들은 이를 수행하기 위해 **스캐폴드 분할(Scaffold Splitting)**이라는 방법을 사용합니다. 그들은 분자들을 그것들을 지탱하는 핵심적인 "골격(ring-and-linker structure)"에 따라 그룹화합니다. 아이디어는 간단합니다. 만약 당신이 로봇에게 한 종류의 골격에 대해 가르쳤다면, 로봇이 정말로 화학을 이해하고 있는지 확인하기 위해 다른 종류의 골격으로 테스트해야 한다는 것입니다. 만약 로봇이 새로운 골격에서 실패한다면, 그것은 로로가 단순히 예전의 것을 암기했을 뿐이라는 것을 의미합니다.

하지만 여기 반전이 있습니다: 골격이 아예 없는 분자들이 존재합니다.

"유령" 분자들

화학에서는 분자의 골격을 찾는 표준적인 방법이 있습니다. 하지만 어떤 기이하거나, 흐물흐물하거나, 아주 작은 분자들의 경우, 이 과정은 빈 바구니를 반환합니다. 이것들이 바로 "노-스캐폴드(no-scaffold)" 분자들입니다. 이들은 공통된 고리 구조를 공유하지 않으며, 남겨진 조각들의 혼란스러운 혼합물입니다.

Tao Song, Yong Wang, 그리고 중국 석유대학교(동중국)와 톈궁 대학교 팀의 연구진은 우리가 AI 셰프를 테스트하는 방식에 중대한 결함이 있음을 발견했습니다.

결함:
표준 테스트 규칙은 다음과 같습니다: "같은 골격을 가진 모든 분자를 같은 그룹에 넣어라." 하지만 "노-스카폴드" 분자들은 모두 골격을 가지고 있기 때문에, 컴퓨터는 이들을 모두 하나의 거대하고 단일한 그룹으로 취급합니다. 이들은 모두 하나의 바구니에 담깁니다.

문제점:
이들은 하나의 나눌 수 없는 집단으로 취급되기 때문에, 컴퓨터는 종종 이 모든 "유령" 분자들을 테스트 세트에 쏟아붓고 훈련 세트에는 하나도 남기지 않습니다.

  • 비유: 당신이 학생에게 과일을 식별하는 법을 가르친다고 상상해 보십시오. 당신은 사과, 바나나, 오렌지를 보여줍니다. 하지만 최종 시험에서, 당신은 "미스터리 죽(mystery mush)"(노-스캐폴드 분자들)이 담긴 그릇을 줍니다. 당신은 학생에게 "죽"이 어떻게 생겼는지 가르쳐준 적이 없지만, 학생에게 그 맛을 맞히라고 기대합니다.
  • 결과: 학생(AI)은 처참하게 실패합니다. 하지만 그것이 학생의 화학 실력이 부족해서일까요? 아니면 당신이 연습 과정에서 "죽"이라는 카테고리를 통째로 숨김으로써 부정행위를 한 것일까요?

이 현상은 얼마나 흔한가?

저자들은 단순히 추측한 것이 아니라 데이터를 조사했습니다. 그들은 이 "유령" 문제가 도처에 깔려 있다는 것을 발견했습니다:

  • 16개의 인기 있는 데이터셋(MoleculeNet) 중 8개에서, 10% 이상의 분자들이 골격이 없었습니다.
  • FreeSolv 및 QM7과 같은 특정 데이터셋에서는 거의 **50%**의 분자가 "유령"이었습니다.
  • 방대한 약물 테스트 컬렉션(Deep-PK/ADMET)에서, 73개 중 40개의 작업이 10% 이상의 노-스캐폴드 분자를 포함하고 있었습니다.

"빈 바구니"는 엉망진창입니다

저자들은 이 "유령" 분자들이 실제로 서로 유사한지 확인했습니다. 그들은 그들이 유사하지 않다는 것을 발견했습니다.

  • 실제 골격 그룹은 사촌 관계인 가족처럼 서로 닮았습니다.
  • "노-스캐폴드" 그룹은 무작위로 모인 잡동사니 더미와 같습니다. 이들의 평균 유사도는 0.110에 불과하며, 이는 무작위 노이즈와 거의 차이가 없습니다.
  • 또한 이들은 AI가 실제로 학습한 분자들과도 매우 멀리 떨어져 있습니다. 훈련 세트에 있는 유령 분자의 가장 가까운 "이웃"은 유사도가 0.300뿐인 반면, 실제 가족들의 이웃은 0.477에서 0.573의 유사도를 보였습니다.

이들은 훈련 데이터와 너무 다르기 때문에, AI가 이들을 학습할 기회는 없습니다.

결과의 함의: 점수가 거짓말을 하는 이유

AI가 훈련 중에 이 "유령" 분자들을 본 적이 없다면, 테스트 결과는 형편없게 나오지만, 이는 AI가 "똑똑하지만 운이 없는" 상태라서 발생하는 결과가 아닙니다.

1. 분류 (Yes/No 질문):
AI는 더 이상 항목들을 올바르게 순위 매기려 하지 않습니다. 점수는 "사전 기준값(prior baseline)"으로 찌그러집니다.

  • 비유: 만약 당신이 학생에게 100개의 미스터리 아이템을 "최고"부터 "최악"까지 순위를 매기라고 했는데, 학생이 그 아이템들이 무엇인지 전혀 모른다면, 학생은 모든 것에 대해 그냥 "보통"이라고 답할 수도 있습니다.
  • 데이터: 저자들은 순위 성능이 크게 떨어졌음을 발견했습니다. MoleculeNet 데이터셋에서 중앙값 점수는 정상적인 경우의 0.259에서 유령 분자의 경우 0.035로 급락했습니다. ADMET에서는 0.409에서 0.119로 떨어졌습니다.
  • 충격: Tox21 데이터셋에서, 일반 분자의 경우 0.303이었던 점수가 유령 분자에게는 0.018로 폭락했습니다. AI는 단순히 실패한 것이 아니라, 포기하고 무작위로 찍고 있었던 것입니다.

2. 회귀 (숫자 예측):
오차가 폭발했습니다.

  • 데이터: 상대적 오차(relMAE)가 평균적으로 1.35배 증가했습니다.
  • 극단적인 경우: 어떤 경우에는 오차가 정상보다 2배 또는 심지어 3배까지 높았습니다. MoleculeNet의 경우, **44.8%**의 테스트 포인트가 최소 2배 이상의 오차를 보였습니다. 이는 보통의 변동폭에 비해 엄청나게 큰 수치입니다.

다른 방법들은 이를 해결했는가?

저자들은 UMAP 클러스터링, DataSAIL, LoHi와 같은 다른 인기 있는 데이터 분할 방식들을 확인했습니다. 그들은 더 똑똑한 이 방법들이 문제를 해결해주기를 희망했습니다.

  • 판결: 해결하지 못했습니다. 이 방법들은 표준 방식처럼 모든 유령을 테스트 세트에 몰아넣지는 않았지만, 여전히 훈련 세트에는 유령 분자를 아주 적게 남겨두었습니다.
  • 데이터: 표준 분할 방식에서는 최악의 경우 훈련 세트에 유령이 **0%**였습니다. DataSAIL의 경우, 훈련 세트에는 여전히 유령이 **14.7%**뿐이었고, 테스트 세트에는 **81.6%**가 몰려 있었습니다.
  • 결론: 현재의 어떤 방법도 AI가 테스트 전에 이 "유령" 분자들을 연습할 수 있도록 보장하지 않습니다.

해결책: "빈 스캐폴드 인지형" 수정 (ESA)

저자들은 단순히 문제 제기에 그치지 않고, ESA라는 패치를 구축했습니다.

  • 작동 방식: "실제" 분자(골격이 있는 것들)에 대해서는 표준 분할을 유지하되, "유령" 분자들을 가져와서 신중하게 재분배했습니다. 그들은 훈련 세트가 유령 분자를 공정하게 나누어 가질 수 있도록 하면서도, AI가 이를 다룰 수 있는지 확인하기 위해 테스트 세트에도 일부를 남겨두었습니다.
  • 결과: 이것은 불균형을 해결했습니다. 훈련 세트의 유령 비율은 **14.7%**에서 **26.0%**로 늘어났고, 테스트 세트는 **81.6%**에서 **11.5%**로 줄어들었습니다.
  • 안전 점검: 그들은 이 과정이 AI가 테스트 정답을 "훔쳐보는(peek)" 부정행위가 되지 않도록 확인했습니다. 훈련 세트의 유령과 테스트 세트의 유령 사이의 유사도는 낮게 유지되었으므로, AI는 단순히 암기하는 것이 아니라 여전히 학습해야 했습니다.

시사점

이 논문은 높은 점수만 보고 "좋아, AI가 준비되었어!"라고 말해서는 안 된다고 주장합니다. 만약 테스트 세트가 AI가 훈련 중에 한 번도 보지 못한 "유령" 분자들로 가득 차 있다면, 그 점수는 오해의 소지가 있습니다. 그것은 일반화 능력에 대한 테스트가 아니라, 구명조끼도 없이 깊은 물에 던져졌을 때 AI가 어떻게 대처하는지를 보는 테스트입니다.

저자들은 향-후 테스트에서 다음 세 가지를 명확히 보고해야 한다고 제안합니다:

  1. "유령" 분들이 얼마나 많은가?
  2. AI가 연습할 수 있었던 유령 분들은 몇 개인가?
  3. 테스트를 위해 남겨진 유령은 몇 개인가?

이를 해결하기 전까지, 우리는 우리가 가진 분자 AI가 실제로 얼마나 똑똑한지를 과대평가하고 있을지도 모릅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →