← 최신 논문
🤖 AI

MixFlow Training: Alleviating Exposure Bias with Slowed Interpolation Mixture

이 논문은 확산 모델의 노출 편향(exposure bias)을 완화하기 위해 훈련과 테스트 조건을 더 잘 정렬하는 "느린 보간 혼합(slowed interpolation mixture)" 전략을 활용함으로써 ImageNet에서 최첨단 이미지 생성 결과를 달성하는 새로운 훈련 방식인 MixFlow를 소개한다.

원저자: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

게시일 2026-07-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Hui Li, Fu-Yun Wang, Haoyuan Xia, Jiayue Lyu, Kaihui Cheng, Siyu Zhu, Jingdong Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 로봇에게 노브를 천천히 돌려 정적 노이즈(static noise)를 선명한 이미지로 바꾸는 과정을 통해 그림 그리는 법을 가르치고 있다고 상상해 보세요. 이것이 현대의 "확산(diffusion)" 모델이 작동하는 방식입니다. 이 모델들은 사진에 노이즈를 추가한 뒤, 원래의 사진을 되찾기 위해 그 노이즈를 단계별로 어떻게 제거해야 하는지 추측하는 법을 배우며 학습합니다.

여기 문제가 있습니다. 학습(training) 단계(학습 단계) 동안, 로봇은 약간의 부정행위를 합니다. 로봇이 다음 단계를 예측하려고 할 때마다, 로봇은 이전 단계의 완벽한 노이즈 버전이 담긴 이미지를 보여받습니다. 이는 마치 학생이 문제를 풀 때, 선생님이 학생이 답을 쓰기도 전에 이전 문제의 정답을 속삭여 주는 것과 같습니다.

하지만 테스트(testing) 단계(실제 그림을 그리는 단계) 동안, 선생님은 속삭임을 멈춥니다. 로봇은 다음 단계를 파악하기 위해 자신의 이전 예측치를 사용해야 합니다. 만약 초기에 아주 작은 실수라도 한다면, 그 실수는 계속 이어지고 점점 커져서 결국 결과물이 이상하거나 흐릿하게 보이게 됩니다. 이를 "노출 편향(exposure bias)"이라고 부릅니다. 로봇은 학습할 때는 완벽한 데이터에 노출되지만, 홀로 있을 때는 지저분한 데이터에 노출되기 때문입니다.

"슬로우 플로우(Slow Flow)"의 발견

이 논문의 저자들은 로봇이 그림을 그리는 모습을 관찰하던 중 기묘한 현상을 발견했습니다. 그들은 로봇이 특정 순간(이를 "시간 T"라고 부릅시다)에 노이즈가 섞인 이미지를 생성할 때, 그 노이즈의 완벽한 버전은 사실 프로세스의 더 이전 단계, 즉 노이즈가 더 많았던 시점의 것이라는 사실을 발견했습니다.

이렇게 생각해 보세요. 당신이 경주를 하고 있다고 가정해 봅시다. 10초 지점에 도달했을 때 뒤를 돌아보니, 당신의 "완벽한" 위치는 사실 8초 지점의 위치였다는 것을 깨닫게 됩니다. 당신은 실질적으로 정답보다 "느린" 상태이며, 정답보다 더 많은 노이즈를 가진 상태에 머물러 있는 것입니다. 즉, 로봇의 생성 경로가 완벽한 경로보다 뒤처져 "느려진(slowed)" 상태에 갇혀 있는 것입니다.

MixFlow 솔루션

저자들은 로봇의 달리기 스타일을 경주가 끝난 후에 고치려고 노력하는 대신(다른 방법들이 시도했던 방식), 로봇이 경주를 배우는 방식 자체를 바꾸기로 했습니다. 그들은 MixFlow라고 불리는 새로운 학습 방법을 도입했습니다.

표준적인 학습에서 로봇은 자신이 있어야 할 바로 그 순간의 완벽한 노이즈만을 바라봅니다. 하지만 MixFlow에서 로봇은 "혼합된(mixture)" 완벽한 노이즈들을 바라보도록 훈련받습니다. 현재 순간의 완벽한 노이즈뿐만 아니라, "느려진" 순간들(즉, 노이즈가 더 많았던 이전 시점들)의 완벽한 노이즈들도 함께 보는 것입니다.

비유하자면:
당신이 자전거 타기를 배우고 있다고 상상해 보세요.

  • 표준 학습: 당신은 오직 완벽하게 평탄하고 매끄러운 도로에서만 연습합니다. 그러다 실제 세상에 나가서 굴곡과 바람을 마주하면, 준비되지 않았던 탓에 넘어집니다.
  • MixFlow 학습: 당신은 매끄러운 도로에서 연습하지만, 동시에 나중에 느낄 지연 현상을 흉내 낸 약간 더 울퉁불퉁하고 "느려진" 버전의 도로에서도 연습합니다. 이를 통해 당신은 훈련 중에도 그 "느려진" 느낌을 다루는 법을 배웁니다.

이 "느려진 보간 혼합(slowed interpolation mixture)"을 통해 학습함으로써, 로봇은 자신의 예측이 완벽한 정답보다 약간 더 "느리고" 노이즈가 많을 것이라는 사실을 대비하여 학습하게 됩니다. 덕히 로봇은 자신의 이전 예측에 의존해야 할 때 혼란에 빠지지 않게 됩니다.

그들이 배제한 것들

저자들은 무엇이 효과가 없는지를 테스트하는 데 매우 신중했습니다. 그들은 훈련 데이터에 무작위 노이즈를 추가하여 실수를 시뮬레이션하는 "입력 섭동(Input Perturbation)"이라는 방법을 시도했습니다. 그들은 만약 "슬로우 플로우" 패턴에 대한 이해 없이 단순히 무작위 노이즈를 추가한다면, 현실과 맞지 않는 "더 빠른(노이즈가 적은)" 데이터를 학습시키거나, 너무 동떨어진 "더 느린" 데이터를 학습시키는 결과를 초래할 수 있다는 것을 발견했습니다. 실험 결과, 무턱대고 노이즈를 추가하는 것은 오히려 상황을 악화시키는 반면, 그들의 특정한 "느려진" 혼합 방식이 핵심이라는 것을 보여주었습니다.

또한 그들은 그림을 그리는 과정(추론) 중에 단계를 미세하게 조정하여 문제를 해결하는 방식과 비교했습니다. 그들은 이러한 미세 조정이 약간의 도움은 줄 수 있지만, 그것은 마치 이미 경로를 이탈하고 있는 자동차의 방향을 틀려고 애쓰는 것과 같으며, 처음부터 엔진(학습)을 고치는 것이 훨씬 낫다는 것을 발견했습니다.

결과: 얼마나 확실한가?

저자들은 단순히 추측만 한 것이 아니라, 실제 이미지 데이터셋을 사용하여 대규모 실험을 수행했습니다.

  • 증거: 그들은 1,000개의 서로 다른 사물 카테고리를 포함하는 120만 장의 이미지가 담긴 ImageNet 데이터셋을 사용하여, 여러 최상위 이미지 생성 모델(SiT, REPA, RAE 등)에 대해 MixFlow 방식을 테스트했습니다.
  • 수치: 256 × 256 픽셀 이미지에서, 그들의 MixFlow 모델은 가이드 없이 1.43, 가이드 적용 시 1.10의 점수를 기록했습니다. 512 × 512 크기의 더 큰 이미지에서는 가이드 없이 1.55, 가이드 적용 시 1.10을 기록했습니다.
    • 참고: 이 분야에서는 FID 점수가 낮을수록 좋습니다. 이 수치들은 믿기 힘들 정도로 낮은데, 이는 생성된 이미지가 실제 사진과 거의 구별할 수 없을 정도임을 의미합니다.
  • 텍스트-투-이미지(Text-to-Image): 그들은 또한 텍스트-투-이미지 모델(SD 3.5)에 대해서도 테스트했습니다. "다섯 개의 맛있는 피자"나 "시계 왼쪽에 있는 새"와 같은 복잡한 장면을 그리라고 요청했을 때, MixFlow 버전은 표준 버전보다 지시 사항을 훨씬 더 잘 따랐으며, 개수와 위치를 정확하게 구현했습니다.

이 논문은 이 접근 방식이 오류 누적의 근본 원인을 직접적으로 해결하기 때문에 중요한 진전임을 시사합니다. 이것은 마법 같은 기술이 아니라, 더 똑똑한 연습 방법입니다. "느려진" 버전의 데이터를 통해 연습하게 함으로써, 로봇은 스스로 이미지를 생성할 때 훨씬 더 견고해질 수 있습니다.

요약하자면, 이 논문은 훈련 식단에 "느려진" 데이터를 포함하도록 변경함으로써, 확산 모델이 자신의 발에 걸려 넘어지는 것을 멈추고 훨씬 더 매끄럽게 경주를 시작할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →