← 최신 논문
🤖 machine learning

Renormalization Group Flow Matching for Scalable Local Generative Modeling

이 논문은 국소적 모델이 거의 선형적인 계산 비용으로 장거리 상관관계와 전역적 일관성을 정확하게 재현할 수 있도록 재규격화 군 원리를 활용하는 확장 가능한 생성 프레임워크인 재규격화 군 흐름 매칭(Renormalization Group Flow Matching, RGFM)을 소개한다.

원저자: Kanta Masuki, Yuto Ashida

게시일 2026-08-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Kanta Masuki, Yuto Ashida

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 컴퓨터는 점차 무에서 유를 창조하는 법을 배우고 있습니다. 컴퓨터는 방대한 기존 사례의 라이브러리를 학습함으로써 극사실적인 얼굴을 생성하거나, 음악을 작곡하거나, 복잡한 분자 구조를 설계할 수 있습니다. 이러한 시스템은 데이터가 결합되는 숨겨진 패턴을 학습함으로써, 정보의 한 조각이 다른 조각과 어떻게 연관되는지를 효과적으로 매핑합니다. 그러나 이 창조자들을 오랫동안 괴롭혀 온 근본적인 문제는 효율성과 포괄성을 동시에 달弦하기 어렵다는 점이었습니다. 이미지의 가장자리부터 가장자리까지 말이 되는 그림을 만들기 위해 컴퓨터는 보통 이미지를 한꺼번에 전체적으로 보아야 하며, 이 과정은 엄청난 컴퓨팅 능력과 메모리를 요구합니다. 반대로, 에너지를 아끼기 위해 컴퓨터가 작고 관리 가능한 조각들만을 본다면, 점들을 연결하는 데 실패하여 얼굴의 왼쪽과 오른쪽이 서로 맞지 않거나, 장면의 먼 부분들이 일관된 관계를 갖지 못하는 결과가 초래되곤 합니다. 이러한 국소적 효율성과 전역적 일관성 사이의 절충안은 이러한 기술을 더 크고 복잡한 작업으로 확장하는 데 있어 주요한 병목 현상이 되어 왔습니다.

도쿄 대학교의 연구진은 이론 물리학에서 알려진 강력한 개념인 '재규격화 군(renormalization group)'을 빌려와 이 난관을 헤쳐 나갈 새로운 방법을 제안했습니다. 물리학에서 이 방법은 원자의 미시적인 움직임부터 유체의 거시적인 흐름에 이르기까지, 다양한 크기에서 시스템이 어떻게 행동하는지 이해하는 데 사용됩니다. 핵심 아이디어는 시스템의 세부 사항이 확대하거나 축소함에 따라 변할지라도, 그 기저에 깔린 규칙은 종종 일관되게 유지된다는 것이며, 이를 통해 과학자들은 노이즈 속에서 길을 잃지 않고도 매우 작은 것과 매우 큰 것을 연결할 수 있습니다. 연구자 카나타 마스키(Kanta Masuki)와 유토 아시다(Yuto Ashida)는 이 원리를 응용하여 '재규격화 군 흐름 매칭(Renormalization Group Flow Matching)'이라는 새로운 생성 프레임워크를 만들었습니다. 이 방식은 고해상도 이미지를 한 번의 거대하고 값비싼 단계로 처리하려고 시도하는 대신, 넓고 거친 형태에서 시작하여 점차 미세한 세부 사항을 채워 넣으며 이미지를 단계적으로 구축합니다.

혁신의 핵심은 컴퓨터가 데이터를 통과하는 방식에 있습니다. 전통적인 방식은 종종 모든 단일 픽셀과 다른 모든 픽셀 사이의 관계를 동시에 학습하려고 시도하며, 이는 이미지가 커질수록 계산적으로 불가능해집니다. 그러나 새로운 접근 방식은 데이터의 자연스러운 척도 계층 구조를 존중하는 일련의 단계로 생성 과정을 조직합니다. 먼저 얼굴의 일반적인 배치나 풍경의 구성과 같은 데이터의 대규모 구조를 생성하는 것으로 시작합니다. 이러한 굵직한 선들이 배치되면, 시스템은 다음 단계로 넘어가 더 미세한 질감과 가장자리를 추가하며, 이 과정을 최종적인 고해상도 세부 사항이 완성될 때까지 지속합니다. 결정적으로, 각 진행 단계에서 컴퓨터는 이미지를 결정하기 위해 오직 작고 국소적인 이웃 영역만을 살펴볼 필요가 있습니다. 다음 선을 어떻게 그릴지 알기 위해 전체 그림을 볼 필요가 없는 것입니다.

이러한 국소적 집중은 '재규격화 군 흐름'과 관련된 특정 수학적 기법을 통해 가능해집니다. 이 과정에서 시스템은 이미 생성된 고주파 노이즈와 미세한 세부 사항을 효과적으로 걸러내어, 다루기 더 쉬운 단순화된 버전의 데이터를 남깁니다. 데이터를 반복적으로 단순화한 다음 다시 그 과정을 역전시켜 세부 사항을 추가함으로써, 연구진은 컴퓨터가 작은 패치만을 계산하면서도 전체 이미지에 대한 감각을 유지할 수 있는 경로를 만들어냈습니다. 연구진은 정확한 예측을 하기 위해 컴퓨터가 '보아야' 하는 거리가 이미지가 커짐에 따라 매우 느리게 증가한다는 것을 입증했습니다. 구체적으로, 특정 크기의 이미지에 대해 필요한 시야 영역은 로그 함수적으로만 증가하며, 이는 매우 큰 이미지라 할지더라도 컴퓨터가 작업을 완수하기 위해 상대적으로 작은 창만을 조사하면 된다는 것을 의미합니다. 이를 통해 시스템은 계산 비용의 폭발 없이도 거대한 해상도로 확장할 수 있습니다.

연구진은 단순한 수학적 분포와 FFHQ 데이터셋의 인물 사진을 포함한 복잡한 실제 이미지를 대상으로 이 방법을 테스트했습니다. 1차원 테스트에서 새로운 방식은 기존의 국소 모델이 놓쳤던 장거리 상관관계를 성공적으로 재현하여, 생성된 데이터의 먼 부분들이 서로 일관성을 유지하도록 했습니다. 이미지 생성에 적용했을 때 결과는 놀라웠습니다. 64x64 픽셀 해상도에서 새로운 방식은 표준 국소 모델보다 훨씬 더 일관된 구조와 현저히 적은 오류를 가진 얼굴을 만들어냈습니다. 계산적 도전 과제가 훨씬 큰 256x256 픽셀의 높은 해상도에서도, 이 새로운 접근 방식은 경쟁 모델들보다 더 높은 품질의 샘플을 생성했습니다. 비록 아직은 멀리 떨어진 얼굴 특징들 사이의 불일치가 나타나는 등 완벽하지는 않았지만, 전역적 일관성의 개선은 상당했습니다.

이 연구는 물리적 시스템이 다양한 척도에 걸쳐 스스로를 조직하는 방식을 모방하도록 생성 과정을 구조화함으로써, 효율적이면서도 거시적인 관점을 이해할 수 있는 인공지능을 구축하는 것이 가능하다는 점을 시사합니다. 연구진은 속도를 위해 전역적 일관성을 희생할 필요가 없음을 보여주었습니다. 거친 것과 미세한 것을 체계적으로 연결하는 프레 프레임워크를 사용함으로써, 그들은 기계가 오직 국소적인 계산만을 사용하여 복잡한 고차원 데이터를 생성할 수 있는 길을 열었습니다. 이 접근 방식은 단순히 그림을 더 빨리 그리는 법을 제공하는 것이 아니라, 기계가 세상 전체를 한꺼번에 기억 속에 담아두지 않고도, 한 번에 하나의 척도씩 복잡한 현실을 구축하는 법을 배우는 새로운 청사진을 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →