← 최신 논문
🤖 machine learning

Continuous Adversarial MeanFlow Transfer

이 논문은 이질적인 사전 학습된 플로우 모델을 제한된 데이터로 새로운 도메인에 적응시키는 동시에 생성을 몇 단계의 샘플링으로 가속화하여, 최대 125배 적은 신경 함수 평가로 최첨단 품질을 달성하는 통합 프레임워크인 MeanFlow-Transfer와 Continuous Adversarial MeanFlow(CAMF)를 소개한다.

원저자: Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인공지능의 세계에서 컴퓨터는 산 너머로 지는 일몰부터 존재하지 않는 사람의 초상화에 이르기까지, 놀라울 정도로 실감 나는 이미지를 만들어내는 법을 배웠습니다. 흔히 생성 모델(generative models)이라 불리는 이 시스템들은 수백만 장의 사진 속에 담긴 통계적 패턴을 학습함으로써 작동합니다. 이들은 무작위적인 노이즈에서 시작하여 단계적으로 이를 정교하게 다듬어 나가며, 마침내 선명한 그림이 나타나게 합니다. 수년 동안 이 과정은 마치 느리고 신중한 조각 세션과 같았으며, 세부 사항을 제대로 구현하기 위해 수백 번의 미세한 조정을 필요로 했습니다. 결과물은 아름답지만, 이를 만드는 데 필요한 시간과 컴퓨팅 파워는 주요한 병목 현상이었습니다. 연구자들은 고품질의 이미지를 단 몇 단계 만에 만들어내기 위해 이 과정을 가속화하려고 노력해 왔으나, 하나의 고질적인 문제에 직면했습니다. 바로 이러한 이미지를 빠르게 만드는 도구들이 특정 형식에 갇혀 있다는 점입니다. 한 가지 유형의 패턴을 예측하도록 훈련된 모델은 다른 유형의 패턴을 예측하도록 쉽게 학습될 수 없으며, 고양이와 같은 특정 주제를 위해 설계된 모델은 속도나 품질을 잃지 않고 자동차와 같은 새로운 주제로 적응하는 데 어려움을 겪습니다.

ÉTS 몬트리올의 연구진은 이 두 가지 문제를 동시에 해결하는 새로운 접근 방식을 개발했습니다. 그들은 기존의 어떤 느린 이미지 생성기라도—그것이 원래 어떻게 구축되었는지와 상관없이—이를 가져와서 새로운 주제의 이미지를 만들도록 빠르게 적응시킬 수 있는 방법을 만들어냈으며, 이 과정 전체를 수백 배 더 빠르게 만들었습니다. 'MeanFlow-Transfer'라고 명명된 이들의 시스템은 보편적인 번역기 역할을 합니다. 이 시스템은 느린 사전 훈련 모델의 출력을 받아와서, 어떤 빠른 생성기도 이해할 수 있는 공유된 언어로 변환합니다. 이를 통해 시스템은 일반적인 이미지의 방대한 데이터셋으로 훈련된 모델로부터 시작하여, 아주 적은 양의 새로운 데이터만을 사용해 새나 자동차와 같은 특정 사물의 고품질 이미지를 즉각적으로 만들어낼 수 있도록 학습할 수 있습니다. 그 결과, 이 생성기는 이전에는 수백 단계가 필요했던 작업을 단 몇 단계 만에 날카롭고 상세한 이미지를 생성할 수 있게 되었습니다.

연구진은 이 빠른 이미지들이 서두르는 과정에서 미세한 디테일을 놓치지 않도록, 프로세스에 두 번째 단계를 추가했습니다. 그들은 '적대적 학습(adversarial training)'이라는 학습 기법을 사용하는 정교화 단계를 도입했습니다. 이 단계에서는 두 번째 신경망이 비평가 역할을 하여, 빠른 생성기가 만든 이미지와 실제 사진을 비교합니다. 이 비평가는 단순히 전체적인 형태가 맞는지만 확인하는 것이 아니라, 시작 노이즈와 최종 이미지 사이의 미묘한 변화를 살피며 이미지가 도달하기까지 거쳐온 여정이 타당한지를 점검합니다. 이는 시스템이 속도를 높이는 과정에서 흔히 흐릿해지는 미세한 디테일을 복구하는 데 도움을 줍니다. 이 번역 방법론에 비판적인 눈을 결합함으로써, 연구진은 자신들의 시스템이 원래의 느린 모델들과 대등하거나 심지어 능가하는 품질을 달면서도, 계산 단계를 최대 125배까지 줄일 수 있다는 것을 발견했습니다.

연구진은 서로 다른 내부 로직을 가진 네 가지 유형의 사전 훈련 모델을 가져와 새, 자동차, 예술 작품을 포함한 다섯 가지의 서로 다른 새로운 영역에 적응시키는 방식으로 이 방법을 테스트했습니다. 모든 경우에서, 시스템은 기존 모델의 지식을 새로운 주제로 성공적으로 전이시켰습니다. 표준 지표를 사용하여 이미지 품질을 측정했을 이 때, 새로운 시스템은 해당 과업을 위해 미세 조정된 기존 모델들과 대등하거나 혹은 더 나은 결과를 보여주었습니다. 아마도 가장 인상적인 점은, 이 시스템이 훨씬 적은 컴퓨션 파워를 사용하면서도 이 품질을 달성했다는 것입니다. 예를 들어, 새의 좋은 이미지를 만들기 위해 원래 250단계가 필요했던 모델은 이제 명료함을 잃지 않고 단 4단계 만에 이를 수행할 수 있게 되었습니다.

연구진은 또한 기존 모델들이 새로운 단계 스케줄을 따르도록 강제하는 방식—일부 다른 연구자들이 시도했던 방법—이 오히려 훈련을 불안정하게 만들고 결과를 악화시킨다는 사실을 발견했습니다. 대신, 그들의 성공은 모델들이 이미지를 생각하는 서로 다른 방식들을 하나의 공통된 움직임 묘사 방식으로 매핑하는 것에서 왔습니다. 그들은 이 접근 방식이 이미지가 형성되는 근저의 물리 법칙을 존중하기 때문에 작동한다는 것을 증명했습니다. 나아가, 이미지 생성의 전 과정을 점검하는 그들의 정교화 기법은 최종 순간만을 점검하던 기존 방식의 자연스러운 확장임을 보여주었습니다. 점검 사이의 시간 단계가 작아짐에 따라, 그들의 방법은 기존의 더 단순한 버전으로 매끄럽게 전환되며, 이는 그들의 새로운 접근 방식이 이전의 것보다 더 강력하고 유연한 버전임을 입증합니다.

이 연구가 중요한 이유는 빠른 이미지 생성이 특정 유형의 모델이나 주제에 갇혀 있던 장벽을 제거하기 때문입니다. 이전에는 새로운 유형의 이미지를 위한 빠른 생성기를 원한다면 처음부터 다시 시작하거나 품질 저하를 감수해야 했습니다. 이제, 단 하나의 프레임워크가 다양하고 강력한 기존 모델들을 가져와서 어떤 새로운 작업에도 적합한 빠르고 특화된 도구로 바꿀 수 있습니다. 연구진은 자신들의 방법을 사용함으로써, 아주 적은 양의 데이터를 사용하여 새로운 영역을 위한 고품질 생성기를 만드는 것이 가능하다는 것을 입증했으며, 이는 고급 이미지 합성 기술을 훨씬 더 접근 가능하고 효율적으로 만듭니다. 이 발견은 생성형 AI의 미래가 더 크고 느린 모델을 만드는 것이 아니라, 우리가 이미 가지고 있는 모델을 더 똑똑하게 적응시키고 가속화하는 방법을 찾는 데 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →