← 최신 논문
🤖 machine learning

Flow Sampling: Learning to Sample from Unnormalized Densities via Denoising Conditional Processes

본 논문은 에너지 함수에서 유도된 탈노이즈 드리프트에 대한 회귀를 통해 정규화되지 않은 밀도에 대한 샘플러를 효율적으로 학습하기 위해 확산 모델과 흐름 매칭을 활용하는 데이터 프리 프레임워크인 Flow Sampling 을 소개하며, 이는 또한 상수 곡률 공간에 대한 폐형 해를 갖는 리만 다양체로 자연스럽게 확장됩니다.

원저자: Aaron Havens, Brian Karrer, Neta Shaul

게시일 2026-05-06
📖 4 분 읽기☕ 가벼운 읽기

원저자: Aaron Havens, Brian Karrer, Neta Shaul

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

거대하고 어두운 극장에서 최고의 좌석을 찾으려 한다고 상상해 보세요. 당신은 '좋은' 좌석이 정확히 어디에 있는지 알고 있습니다. 왜냐하면 모든 좌석의 '에너지'나 '편안함 수준'을 알려주는 지도를 가지고 있기 때문입니다. 하지만 함정이 하나 있습니다. 총共有 몇 개의 좋은 좌석이 있는지 (정규화 상수) 알 수 없으며, 지도를 읽는 비용이 좌석 하나하나마다 너무 비싸서 극장 전체를 돌아다니며 모든 좌석을 확인할 수 없다는 점입니다.

이것은 과학자들이 **정규화되지 않은 분포 (unnormalized densities)**에서 표본을 추출하려 할 때 직면하는 문제입니다. 그들은 '좋은' 표본이 어떤 모습인지 알려주는 규칙 (에너지 함수) 을 가지고 있지만, 그러한 표본들을 쉽게 생성할 수는 없습니다.

이제 아론 헤이븐스 (Aaron Havens), 브라이언 카러 (Brian Karrer), 네타 샤울 (Neta Shaul) 이 소개한 새로운 방법인 **플로우 샘플링 (Flow Sampling)**이 등장합니다. 여기서는 간단한 비유를 통해 그 작동 원리를 설명합니다.

구식 방법: 느린 등산객

이전까지 과학자들은 MCMC(Markov Chain Monte Carlo)와 같은 방법을 사용했습니다. 등산객이 최고의 좌석을 찾으려 한다고 상상해 보세요. 등산객은 한 걸음을 내딛고 지도를 확인한 뒤, 또 다른 한 걸음을 내딛고 다시 지도를 확인하는 식으로 반복합니다. 결국 좋은 좌석을 찾게 되지만, 하나씩 아주 천천히 찾아냅니다. 백만 개의 표본이 필요하다면 등산객은 백만 걸음을 내딛어야 합니다. 새로운 재료나 의약품을 설계하는 것과 같은 대규모 문제에는 이 방법이 너무 느립니다.

새로운 방법: '탈노이즈' 조각가

플로우 샘플링은 마치 원래 조각상을 먼저 보지 않고도 완벽한 조각상 (목표 분포) 을 조각하는 법을 배우는 조각가를 고용하는 것과 같습니다. 대신, 그들은 점토 덩어리가 서서히 노이즈를 제거하며 조각상으로 변하는 과정을 지켜보며 배웁니다.

다음은 단계별 마법입니다.

1. 역재생 영화 (탈노이즈)

아름다운 풍경을 담은 선명한 고화질 사진 (목표 데이터) 이 있다고 상상해 보세요. 여기에 정적 노이즈를 추가하면 흐릿한 엉망진창이 됩니다.

  • 기존 AI는 보통 흐릿한 엉망진창에서 시작해 원래 사진을 추측하는 방식으로 학습합니다.
  • 플로우 샘플링은 이 방식을 뒤집습니다. 무작위 노이즈 샘플 (빈 캔버스) 로 시작해 에너지 지도의 안내를 받으며 그 풍경을 맞추기 위해 노이즈를 '정화'하는 법을 학습합니다.

2. '분리된' 학생 (비용 절감)

이 과정에서 가장 큰 비용은 에너지 지도를 읽는 것입니다. 지도를 읽는 것은 통행료를 지불하는 것과 같습니다. AI 를 훈련시키기 위해 지도를 수백만 번 읽어야 한다면 비용이 너무 많이 듭니다.

플로우 샘플링은 '분리된 상태 (Detached State)' 또는 **리플레이 버퍼 (Replay Buffer)**라는 교묘한 트릭을 도입합니다.

  • 학생 (AI 모델) 이 학습을 시도한다고 상상해 보세요. 학생이 실수를 할 때마다 매번 교사 (에너지 지도) 에게 도움을 요청하는 대신, 학생은 현재 작업의 '스냅샷'을 찍어 교사에게 그 스냅샷에 대해 한 번만 피드백을 요청하고 그 답변을 노트 (리플레이 버퍼) 에 적어둡니다.
  • 그 후 학생은 교사를 괴롭히지 않고 그 노트를 가지고 반복해서 연습합니다.
  • 이는 비싼 '에너지 지도'를 몇 번만 참조하고 학생이 노트에서 학습한다는 것을 의미합니다. 이로 인해 이전 방법들에 비해 훈련 비용이 4 배에서 8 배까지 절감됩니다.

3. '플로우' (부드러운 이동)

등산객이 작고 흔들리는 발걸음을 내딛는 대신, 플로우 샘플링은 '플로우'를 사용합니다. 강을 상상해 보세요. 물 (데이터) 이 소스 (무작위 노이즈) 에서 목적지 (목표 분포) 로 부드럽게 흐릅니다. AI 는 강물의 흐름 방향을 학습하여 물을 필요한 곳으로 정확히 안내할 수 있도록 하여 효율적이고 빠르게 이동합니다.

평평한 지형을 넘어 (곡면 공간)

대부분의 AI 는 세상이 평평하다고 (종이 한 장처럼) 가정합니다. 하지만 때로는 데이터가 구의 표면 (지구를 생각하세요) 이나 안장 모양과 같은 곡면 위에 존재합니다.

플로우 샘플링은 이러한 곡선을 자연스럽게 이해하기 때문에 특별합니다.

  • 비유: 평평한 바닥을 걷는다면 직선으로 걷습니다. 하지만 구 (지구) 위를 걷는다면 '가장 직선 같은' 경로는 곡선 (대원) 입니다.
  • 이 논문은 AI 가 길을 잃지 않고 이러한 곡선 경로 (측지선) 를 어떻게 걷는지 정확히 알려주는 수학적 공식을 제공합니다. 이를 통해 이 방법은 **구 (spheres)**와 **쌍곡 공간 (hyperbolic spaces)**에서 작동할 수 있게 되며, 이는 로봇 공학과 3D 분자 구조와 같은 분야에서 중요합니다.

그들이 증명한 것

저자들은 이 방법을 여러 가지 도전 과제에서 테스트했습니다.

  1. 합성 퍼즐: 그들은 가상의 에너지 지형을 만들어 플로우 샘플링이 다른 최상위 방법들보다 더 빠르고 정확하게 최고의 지점을 찾았음을 보여주었습니다.
  2. 단백질 접힘: 그들은 작은 단백질 (펩타이드) 의 모양을 찾는 데 이를 사용했습니다. 이는 훨씬 느린 전통적인 시뮬레이션의 결과와 일치하는 분자들의 3D 모양을 성공적으로 예측했습니다.
  3. 분자 생성: 그들은 거대 분자의 수천 가지 다른 모양을 생성하는 데 이를 사용했습니다. 이는 여전히 고품질의 모양을 찾으면서도 경쟁사보다 훨씬 빨랐습니다.
  4. 구 샘플링: 그들은 구 위에 분포된 데이터를 샘플링할 수 있음을 입증하여 곡면 기하학에서도 작동함을 보였습니다.

결론

플로우 샘플링은 '좋은' 것이 어떤 모습인지에 대한 규칙만 있고 예시 목록은 없을 때, 컴퓨터가 복잡한 데이터를 생성하도록 가르치는 새롭고 효율적인 방법입니다. 비싼 계산을 기억하기 위한 '노트'를 사용하고 곡면 공간을 이해함으로써, 이 방법은 과학자들이 이전보다 훨씬 빠르고 저렴하게 고품질 표본 (새로운 의약품 분자 등) 을 생성할 수 있게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →