Probing out-of-distribution generalization in machine learning for materials
이 연구는 재료 과학 머신러닝에서 흔히 쓰이는 휴리스틱 평가들이 주로 훈련 도메인 내에서의 보간을 테스트할 뿐 진정한 분포 외 외삽, 즉 데이터나 모델의 크기를 키울수록 수익이 감소하거나 부정적인 결과를 낳는 상황을 테스트하지 못하기 때문에 일반화 가능성과 신경망 스케일링의 이점을 과대평가한다는 것을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 물질을 발견하려는 탐구 과정에서, 과학자들은 과정을 가속화하기 위해 인공지능에 점점 더 의존하고 있습니다. 각각 강도, 전도성, 또는 형성하는 데 드는 에너지와 같은 고유한 특성을 가진 수백만 개의 서로 다른 물질 레시피가 담긴 거대한 도서관을 상상해 보십시오. 전통적으로 새로운 물질을 찾는 것은 실험실에서 하나의 레시피를 테스트한 뒤 다음 것을 테스트하는 방식이었으며, 이는 느리고 비용이 많이 드는 일이었습니다. 머신러닝은 지름길을 제공합니다. 기존의 도서관을 학습함으로써 컴퓨터는 화학의 법칙을 배우고, 이전에 본 적 없는 물질의 특성을 예측할 수 있습니다. 궁극적인 목표는 진정으로 일반적인 모델을 구축하는 것입니다. 즉, 이미 학습한 것과 유사한 것뿐만 아니라 완전히 새로운 유형의 물질에 대해서도 정확한 예측을 할 수 있는 모델을 만드는 것입니다. 이러한 미지의 영역을 다루는 능력은 더 나은 배터리를 만들거나 더 효율적인 태양광 패널을 설계하는 것과 같은 글로벌 과제를 해결하는 데 매우 중요합니다. 그러나 이러한 디지털 도구들이 정말로 낯선 상황에 직면했을 때 얼마나 잘 작동하는지에 대해서는 여전히 의문이 남아 있습니다.
한 연구팀은 재료 과학 분야에서 이러한 머신러닝 모델의 한계를 테스트하기 위해 나섰습니다. 그들은 모델이 진정으로 자연의 심오한 법칙을 배우고 있는지, 아니면 단순히 새로운 발견처럼 보이는 패턴을 암기하고 있는 것인지를 알고 싶었습니다. 이를 위해 그들은 700개가 넘는 서로 다른 도전 과제를 포함하는 대규모 실험을 설계했습니다. 각 도전 과제에서, 그들은 알려진 물질의 대규모 컬렉션으로 컴퓨터 모델을 훈련시킨 다음, 훈련 데이터에는 전혀 존재하지 않는 특정 물질 그룹의 특성을 예측하도록 요청했습니다. 이 그룹들은 "특정 원소를 포함하는 모든 물질" 또는 "특정 결정 구조를 가진 모든 물질"과 같은 구체적인 규칙에 의해 정의되었습니다. 연구진은 단순하고 확립된 알고리즘부터 인간의 뇌를 모방한 복잡하고 현대적인 신경망에 이르기까지 다양한 모델을 테스트했습니다.
결과는 놀라웠습니다. 700개의 도전 과제 중 대다수에서 모델들은 훈련 중에 접해보지 못한 원소나 구조를 포함하고 있음에도 불구하고 매우 뛰어난 성능을 보였습니다. 기본적인 의사결정 규칙을 사용하는 단순한 모델들도 가장 정교한 딥러닝 시스템만큼이나 잘 수행되는 경우가 많았습니다. 이러한 높은 성공률은 모델이 이전에 생각했던 것만큼 새로운 화학적 성질로 일반화하는 데 어려움을 겪고 있지 않음을 시사했습니다. 그러나 연구진은 왜 이런 현상이 발생하는지 이해하기 위해 더 깊이 파고들었습니다. 그들은 이 테스트에서 '새롭다'는 정의가 종종 오해의 소지가 있다는 것을 발견했습니다. 테스트 대상 물질들이 화학적 성분 측면에서는 기술적으로 다르지만, 모델이 물질을 이해하는 데 사용하는 수학적 공간 내에서는 종종 동일한 일반적 영역 안에 위치하고 있었습니다. 즉, 모델들이 진정으로 미지의 영역으로 나아간 것이 아니라, 이미 알고 있는 것들 사이의 간극을 메우고 있었던 것입니다.
이를 증명하기 위해 연구팀은 물질들이 존재하는 수학적 지형을 매핑했습니다. 그들은 모델이 성공한 작업들의 경우, 새로운 물질들이 실제로 훈련 데이터에 의해 둘러싸여 있어 모델이 주변 사례를 바탕으로 안전한 추측을 할 수 있었다는 것을 발견했습니다. 하지만 모델이 실패한 몇몇 과제들을 살펴보았을 때, 테스트 물질들은 모델이 본 적이 없는 데이터로부터 멀리 떨어진 채 완전히 고립되어 있었습니다. 이 차이는 이 분야가 성공을 측정하는 방식에 중대한 결함이 있음을 드러냈습니다. 모델의 능력을 입증하는 것으로 칭송받았던 많은 테스트가 실제로는 보간(interpolation), 즉 알려진 지점들 사이의 중간 값을 추측하는 능력을 테스트한 것에 불과했습니다. 모델들은 화학적 공간의 먼 곳까지 외삽(extrapolate)하는 마법 같은 능력을 보여준 것이 아니라, 이미 이해하고 있는 영역 안에서 점들을 연결하고 있었을 뿐입니다.
이 연구는 또한 스케일링(scaling)이라고 불리는 인공지능의 대중적인 아이디어에 도전했습니다. 훈련 데이터셋을 더 크게 만들거나 모델을 더 오래 훈련시키면 일반화 능력이 항상 향상될 것이라는 믿음이 지배적입니다. 연구진은 점점 더 많은 데이터를 모델에 입력하며 이를 테스트했습니다. 새로운 물질이 기존 물질과 가까운 쉬운 작업의 경우, 데이터가 많아질수록 성능이 향려되었습니다. 하지만 물질이 훈련 영역 밖에 멀리 떨어져 있는 진정으로 어려운 작업의 경우, 데이터를 추가하거나 훈련 시간을 늘리는 것이 도움이 되지 않았습니다. 어떤 경우에는 모델이 알려진 데이터에 과적합(overfit)되어 미지의 것에 대해 올바르게 추측하는 능력을 잃게 함으로써 오히려 성능을 악화시키기도 했습니다. 이는 모든 일반화 문제를 해결하기 위해 규모를 키우는 것이 만능이라는 약속이 진정으로 새로운 물질에 대해서는 과장되었을 수 있음을 시사합니다.
연구진은 이 분야가 일반화를 정의하고 테스트하는 방식에 더 주의를 기울여야 한다고 결론지었습니다. 훈련 데이터와 테스트 데이터를 단순한 규칙으로 분리하는 데 의존하는 현재의 방식은 종종 성공의 환상을 만들어냅니다. 이러한 방식은 모델이 잘하는 것에 대해서는 잘한다고 보여주지만, 미래의 과학적 돌파구를 이끌어낼 진정으로 어렵고 보이지 않는 도전 과제들을 다룰 수 있다는 것을 반드시 증명하는 것은 아닙니다. 이 연구는 머신러닝이 실패하고 있다고 말하는 것이 아니라, 우리가 잘못된 질문을 던지고 있다고 제안합니다. 우리의 '어려운' 테스트 중 상당수가 모델에게는 사실 꽤 쉽다는 것을 인식함으로써, 과학자들은 이제 진정으로 어려운 도전 과제를 설계하는 데 집중할 수 있습니다. 이러한 전환은 실질적인 격차를 식서히 파악하고, 재료 과학의 미개척 영역을 진정으로 항해할 수 있는 모델의 발전을 이끌 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.