← 최신 논문
🤖 machine learning

gp2Scale: A Class of Compactly Supported Non-Stationary Kernels and Distributed Computing for Exact Gaussian Processes on 10 Million Data Points

이 논문은 컴팩트하게 지지되는 비정상성 커널을 활용하여 공분산 행렬에 자연스러운 희소성을 유도함으로써, 유도점(inducing points)이나 다른 근사 기법의 필요 없이 모델 설계의 완전한 유연성을 유지하면서도 1,000만 개 이상의 데이터 포인트에 대해 정확한 가우시안 프로세스 추론을 가능하게 하는 방법론인 gp2Scale을 소개한다.

원저자: Marcus M. Noack, Mark D. Risser, Hengrui Luo, Vardaan Tekriwal, Ronald J. Pandolfi

게시일 2026-07-27
📖 6 분 읽기🧠 심층 분석

원저자: Marcus M. Noack, Mark D. Risser, Hengrui Luo, Vardaan Tekriwal, Ronald J. Pandolfi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 날씨를 예측하거나, 집값을 예측하거나, 혹은 로봇의 경로를 예측하려고 한다고 상상해 보십시오. 그런데 당신에게는 수백만 개의 데이터 포인트라는 방대한 양의 데이터가 있습니다. 데이터 과학의 세계에는 **가우시안 프로세스(Gaussian Process, GP)**라는 강력한 도구가 있습니다. 가우시안 프로세스를 아주 똑똑하고 유연한 고무판이라고 생각해보십시오. 당신은 실제 데이터(온도 측정값이나 집값 등)가 있는 특정 지점들을 이 고무판으로 쿡쿡 찌르고, 그러면 고무판은 그 지점들에 완벽하게 맞도록 늘어나고 휘어집니다. 이것은 "확률적" 도구이기 때문에 단순히 하나의 숫자를 추측하는 것이 아니라, 데이터 주변에 가능한 형태들의 구름을 그려냄으로써 답이 무엇인지뿐만 {만 아니라} 그 답이 얼마나 확실한지도 알려줍니다. 이 "불확실성"은 새로운 약을 설계하거나 기후 변화를 예측하는 것과 같이 중대한 결정을 내려야 하는 과학자들에게 매우 중요합니다.

하지만 문제가 하나 있습니다. 오랫동안 이 고무판 도구는 매우 느리고 메모리를 많이 잡아먹었습니다. 데이터 포인트가 몇 천 개 정도라면 아주 잘 작동합니다. 하지만 수백만 개의 포인트에 맞춰 이 고무판을 늘리려고 하면 수학적 계산이 폭발해 버립니다. 이는 마치 1,000만 명의 인구가 사는 도시에서 모든 사람 사이의 연결 관계를 한꺼번에 계산하려는 것과 같습니다. 컴퓨터는 메모리가 부족해져서 멈춰버릴 것입니다. 이를 해결하기 위해 대부분의 과학자들은 "근사법(approximations)"을 사용해야만 했습니다. 기본적으로, 시간 절약을 위해 고무판의 미세한 세부 사항을 무시하는 더 저렴하고 덜 정확한 버전의 고고무판을 사용하는 것입니다. 하지만 이는 이 도구를 특별하게 만드는 바로 그 능력, 즉 완벽하게 정확하고 고도로 맞춤화될 수 있는 능력을 잃게 된다는 것을 의미합니다.

여기서 새로운 연구가 등장합니다. 이 연구는 원래의 완벽한 고무판이 비용을 크게 들이지 않고도 거대한 데이터셋에서 작동할 수 있는 방법을 제안합니다. 마커스 M. 노악(Marcus M. Noack)과 동료들이 이끄는 연구진은 gp2Scale이라고 부르는 방법을 소개합니다. 그들의 핵심 아이디어는 문제가 데이터 자체에 있는 것이 아니라, 고무판을 늘리는 데 사용하는 "규칙"에 있다는 것입니다. 전통적인 방식은 모든 점이 서로 연결되어 있다고 가정하며, 이는 조밀하고 무거운 수학적 웹을 만들어냅니다. 연구진은 규칙을 "비정상성(non-stationary)"(즉, 위치에 따라 규칙이 변할 수 있음)과 "콤팩트 지지(compactly supported)"(즉, 데이터의 특성에 따라 희소한 구조를 형성함)로 변경하면, 이 거대한 웹이 갑자기 희소하고 가벼운 골격으로 변한다는 사실을 깨달았습니다.

이러한 새로운 유연한 규칙을 사용함으로써, 연구진은 1,0밀리언(1,000만) 개의 데이터 포인트에 대해 정확한 가우시안 프로세스를 실행할 수 있었습니다. 그들은 지름길을 써서 속임수를 쓴 것이 아닙니다. 단지 대부분의 연결이 계산될 필요가 없다는 것을 깨닫도록 수학을 더 똑똑하게 만든 것뿐입니다. 그들은 1차원의 구불구불한 선부터 미국 전역의 3차원 온도 지도에 이르기까지 다양한 테스트를 진행했습니다. 결과에 따르면, 그들의 방법은 "속임수" 방법들보다 더 많은 컴퓨팅 파워를 소모하지만, 훨씬 더 나은 정확도를 제공하며 어떤 특정 문제에도 맞춤화될 수 있는 능력을 유지합니다. 이것은 마치 스케치에서 고해상도 사진으로 업그레이드하는 것과 같습니다. 처리하는 데 시간은 더 걸리지만, 디테일이 실제적이며 그림자 속에 무엇이 있는지 추측할 필요가 없습니다.

핵심 문제: "조밀한" 웹

이것이 왜 중요한 일인지 이해하려면, 작은 마을의 우정 네트워크를 지도화한다고 상상해 보십시오. 만약 모든 사람이 서로를 안다면, 당신은 모든 쌍 사이에 선을 그려야 합니다. 마을에 100명이 있다면 감당할 수 있습니다. 하지만 마을에 1,000만 명이 있고 모두가 서로 연결되어 있다면, 당신은 100조 개의 선을 그려야 합니다. 이것이 전통적인 가우시안 프로세스가 하는 일입니다. 그들은 모든 데이터 포인트가 다른 모든 포인트와 연결되어 있다고 가정하여, 컴퓨터가 처리하기에는 너무 무거운 숫자들의 "조밀한" 행렬을 만들어냅니다.

수년 동안의 해결책은 "좋아, 몇몇 사람은 서로 모른다고 치자"라거나 "전체 그룹을 대표할 몇 명의 사람을 뽑자"라고 말하는 것이었습니다. 이것들이 바로 논문에서 비교 대상으로 삼은 근사법(SVGP, Vecchia, SKI 등)입니다. 이것들은 빠르게 작동하지만, 안개가 낀 창문을 통해 사진을 보는 것과 같습니다. 대략적인 느낌은 얻을 수 있지만, 날카로운 모서리와 미세한 디테일은 놓치게 됩니다. 설상가라, 이 방법들은 종종 당신이 특정하고 경직된 유형의 규칙(커널)을 사용하도록 강요합니다.

gp2Scale 솔루션: "스마트 마스크"

이 논문의 저자들인 gp2Scale은 "조밀한" 웹이 잘못된 규칙에 의해 만들어진 환상이라고 주장합니다. 그들은 새로운 클래스의 커널(고무판이 어떻게 늘어나는지를 정의하는 수학적 규칙)을 제안합니다. 그들의 비법은 "비정상성, 콤팩트 지지" 커널입니다.

비유를 들어보겠습니다. 당신이 거대한 벽화를 그리고 있다고 상상해 보십시오.

  • 기존 방식: 당신은 모든 붓터치가 벽의 다른 모든 부분에 영향을 준다고 가정합니다. 전체를 그리려면 모든 평방 인치와 다른 모든 평방 인치를 대조하여 색을 섞어야 합니다. 그것은 불가능합니다.
  • 근사법: 당신은 몇몇 핵심 지점에만 색을 칠하고 나머지는 추측하기로 결정합니다. 빠르긴 하지만, 그림이 흐릿하게 보입니다.
  • gp2Scale 방식: 당신은 데이터의 구조에 따라 연결 관계가 유연하게 변할 수 있음을 활용합니다. 단순히 인접한 곳만 보는 것이 아니라, 데이터의 특성에 따라 특정 지점들 사이의 원거리 상관관계(far-field correlations)를 유지하면서도 계산을 단순화하는 "스마트 마스크"를 사용합니다. 이를 통해 거대한 연결의 웹이 사라지고, 계산이 훨씬 더 가벼운 "희소한(sparse)" 구조로 변합니다.

논문은 거리 기반 컷오프 역할을 하는 Wendland 커널과 연결의 온/오프 스위치 역할을 하는 Bump-function 커널을 포함하여 이러한 "마스크"의 여러 유형을 소개합니다. 이러한 마스크를 사용하면 컴퓨터가 불필요한 계산의 대다수를 무시할 수 있게 되어, 영원히 걸릴 것 같던 문제를 수천 대의 컴퓨터에 나누어 처리할 수 있는 문제로 바꿔 놓습니다.

실험: 구불구불한 선에서 1,000만 개의 포인트까지

연구팀은 단순히 수학적 계산만 한 것이 아니라, 이 방법이 제대로 작동하는지 확인하기 위해 실제 시나리오에서 테스트했습니다.

  1. 1D 구불구불한 선: 그들은 단순하면서도 복잡한 파동으로 시작했습니다. 그들은 "근사" 방법들이 날카롭고 구불구불한 디테일을 뭉개뜨려 곡선을 너무 둥글게 만든다는 것을 발견했습니다. 그러나 gp2Scale은 날카로운 모서리를 완벽하게 유지하며 "그라운드 트루스(실제 값)"와 거의 정확히 일치했습니다.
  2. 미국 지형: 그들은 20,000개의 포인트를 사용하여 미국 지형의 높이를 매핑했습니다. 지형은 급격하게 변하기 때문에(산 vs 평원), 데이터는 "비정상성"을 띝니다. 표준 방법들은 어려움을 겪었지만, gp2Scale은 지형에 맞춰 규칙을 적응시켜 가장 낮은 오차와 함께 가장 정확한 지도를 만들어냈습니다.
  3. 캘리포니아 주택 가격: 그들은 8차원 공간에서 집값을 예측하려고 시도했습니다. 여기서 데이터는 희소했습니다(패턴을 찾기 어려움). gp2Scale은 이 특정 고차원, 희소 케이스에서도 매우 뛰어난 성능을 보이며 다른 방법들보다 더 나은 결과를 보여주었습니다. 이는 중요한 뉘앙스입니다. 저자들은 자신들의 방법이 모든 상황에 적용되는 마법의 탄환은 아니라는 점을 인정하지만, 데이터가 밀집되고 복잡할 때 빛을 발한다는 점을 분명히 했습니다.
  4. MNIST 숫자: 그들은 유명한 이미지 인식 작업(손으로 쓴 숫자 식별)을 회귀 문제로 전환했습니다. gp2Scale은 28x28 픽셀 그리드를 큰 어려움 없이 처리한 반면, 다른 방법들은 실패하거나 너무 많은 조정이 필요했습니다.
  5. 1,000만 포인트 챌리인지: 대망의 피날레입니다. 그들은 미국 전역의 1,000만 개의 온도 측정값을 가져왔습니다. 이를 위해 그들은 1,024개의 A100 GPU(거대한 슈퍼컴퓨터 설정)를 사용했습니다. 그들은 약 100회의 반복 학습(iteration)을 수행했습니다. 결과는 어땠을까요? 그들은 최고의 경쟁자였던 Vecchia를 근소한 차이로 이겼으며, 이는 정확한 가우시안 프로세스가 실제로 수백만 개의 포인트로 확장될 수 있음을 입증했습니다. 그들은 처음부터 전체 실행을 하는 데 약 일주일이 걸릴 것이라고 언급했는데, 이는 오늘날 대규모 AI 모델을 훈련하는 것과 맞먹는 시간입니다.

결론: 정확성 vs 속도

이 논문은 명확한 구분을 둡니다. gp2Scale은 가장 빠른 방법을 목표로 하는 것이 아닙니다. 만약 당신이 제한된 컴퓨터 자원을 가지고 있고 빠르게 "적당히 괜찮은" 답이 필요하다면, 기존의 근사법들이 여전히 최선의 선택입니다.

하지만 gp2Scale정확성과 유연성이 타협 불가능한 상황에서 게임의 판도를 바꿉니다. 만 if 당신이 기후 변화를 모델링하거나, 새로운 재료를 설계하거나, 혹은 잘못된 예측이 위험을 초래할 수 있는 자율 실험을 수행하는 과학자라면, "안개가 낀 창문" 같은 근사치를 감수할 수 없습니다. 당신은 고해상도의 뷰가 필요합니다.

저자들은 이러한 새로운 커널을 사용함으로써, 마침내 거대한 데이터셋에 대해 "정확한" 버전의 가우시안 프로세스를 실행할 수 있다고 결론지을 수 있습니다. 우리는 모델을 맞춤화하는 능력이나 불확실성 추정의 정밀함을 희생할 필요가 없습니다. 트레이드오프(절충안)는 단지 이를 수행하기 위해 더 많은 컴퓨팅 파워가 필요하다는 것뿐입니다. 하지만 논문이 시사하듯, 강력한 슈퍼컴퓨터와 GPU의 등장과 함께, 그 절충안은 우리가 마침내 감당할 수 있는 수준이 되고 있습니다.

요약하자면, gp2Scale은 정확한 가우시안 프로세스의 "불가능한" 수학이 사실은 불가능한 것이 아니라, 단지 데이터를 바라보는 더 똑똑한 방법이 필요했을 뿐임을 증명합니다. 모든 점이 서로 소통할 필요가 없다는 사실을 깨달음으로써, 그들은 1,000만 개의 포인트를 가진 괴물을 미래 과학을 위한 관리 가능하고 매우 정확한 도구로 탈바꿈시켰습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →