← 최신 논문
💻 computer science

XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

XYZFlow는 시간적 및 공간적 스케일링—구체적으로 비마르코프적 이력 조건화(non-Markovian history conditioning)와 차기 지름길 예측(Next Shortcut Prediction)—을 통한 다차원 플로우 매칭을 활용하여, 경쟁력 있는 품질을 유지하면서도 7.2~8.5배의 속도 향상을 달eros하며 최첨단 이미지 생성을 달성하는 효율적인 생성 모델링을 위한 새로운 프레임워크를 도입한다.

원저자: Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

게시일 2026-08-13
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 완벽한 고양이 그림을 그리는 법을 가르치려 한다고 상상해 보세요. 인공지능의 세계에서 이 작업을 위한 현재의 챔피언들은 "확산 모델(diffusion models)"이라고 불립니다. 이들을 마치 정지 화면의 노이즈(TV 채널이 잡히지 않을 때 나오는 지지직거리는 화면)로 가득 찬 캔버스에서 시작하여, 노이즈를 한 단계씩 천천히 걷어내며 그 아래에 숨겨진 고양이를 드러내는 예술가라고 생각하면 됩니다. 문제는 이 과정이 믿기지 않을 정도로 느리다는 점입니다. 로봇은 그림을 제대로 완성하기 위해 수백 번의 작고 세심한 단계를 거쳐야 할 수도 있으며, 이는 비디오 게임이나 즉각적인 메시징과 같은 실시간 애플리케이션에는 쓸모가 없게 만듭니다.

이 모델들을 더 빠르게 만들기 위해, 과학자들은 모델이 더 큰 보폭으로 움직이도록 가르치려고 노력해 왔습니다. 일반적인 방법은 "증류(distillation)"인데, 이는 마치 숙련된 화가가 학생에게 자신의 작품을 더 적은 획수로 따라 그리도록 가르치는 것과 같습니다. 하지만 이는 까다로운 작업입니다. 왜냐하면 스승의 단계 자체가 완벽하게 명확하지 않으면 학생이 혼란에 빠질 수 있기 때문입니다. 이 분야의 핵심 질문은 이것입니다: 우리는 로봇이 완벽한 스승이나 거대한 컴퓨터 없이도 단 몇 단계 만에 고품질의 고양이를 그리게 할 수 있을까요? XYZFlow라는 논문은 단순히 스승을 더 낫게 만드는 것이 아니라, 로봇이 그림을 바라보는 방식을 바꿈으로써 이 퍼즐을 해결하는 새로운 방법을 제시합니다.


완벽한 고양이를 향한 "지름길"

이미지 생성을 재고하는 새로운 프레임워크인 XYZFlow를 만나보세요. XYZFlow는 AI에게 이미지 전체의 노이즈를 한꺼번에 지우라고 요구하는 대신(이는 마치 지저분한 방 전체를 한 번의 격렬한 움직임으로 청소하려는 것과 같습니다), 이 작업을 영리한 "패치 단위(patch-by-patch)" 탐정 놀이로 세분화합니다.

저자들은 현재의 빠른 방식들이 어려움을 겪는 이유가 "노이즈"에서 "그림"으로 가는 경로가 종종 모호하기 때문이라는 점을 깨달았습니다. 이는 마치 모든 회전 구간이 똑같이 보이는 안개 낀 미로에서 길을 찾는 것과 같습니다. 이를 해결하기 위해 XYZFlow는 **다음 지름길 예측(Next Shortcut Prediction)**이라는 전략을 사용합니다. 여러분이 거대한 레고 성을 쌓고 있다고 상상해 보세요. 무작정 벽돌을 하나씩 놓는 대신, 한 번에 작은 구역을 완성해 나가는 방식입니다.

여기 마법 같은 기술이 있습니다. 첫 번째 구역(예를 들어 왼쪽 탑)을 완성하자마자, 여러분은 완성된 탑만을 보는 것이 아닙니다. 그 탑이 어떻게 만들어졌는지에 대한 전체 여정을 살펴봅니다. 그 탑을 만드는 과정에서 거쳤던 모든 굴곡과 회전을 기억하는 것입니다. 그런 다음, 그 "여정 지도"를 다음 구역(오른쪽 탑)을 만드는 사람에게 전달합니다. 두 번째 구역을 만드는 사람은 첫 번째 구역이 정확히 어떻게 구축되었는지 알기 때문에, 덜 추측해도 됩니다. 그들은 여전히 완벽하게 어울리도록 만들면서도, 훨씬 더 적은 단계와 빠른 속도로 "지름길"을 택해 자신의 부분을 완성할 수 있습니다.

두 가지 차원의 속도

XYZFlow는 저자들이 시간적(Temporal)Spatial(공간적) 스케일링이라고 부르는 두 가지 방향으로 문제를 확장하여 속도를 높입니다.

  1. 시간적 스케일링 (시간 여행자): 보통 AI 모델은 다음에 무엇을 할지 결정하기 위해 현재 이미지의 상태만을 봅니다. 하지만 XYZFlow는 다릅니다. 이 모델은 현재 패치가 어떻게 정화되어 왔는지에 대한 전체 역사를 기억합니다. 이는 마치 범죄 현장을 오늘날의 모습만 보는 것이 아니라, 용의자의 전체 타임라인을 검토하여 다음에 무슨 일이 일어났는지 파악하는 형사와 같습니다. 이 "비마르코프적(non-Markovian)" 접근 방식(과거를 기억한다는 뜻의 어려운 용어)은 경로를 직선화하여, 단계를 더 예측 가능하고 덜 흔들리게 만듭니다.

  2. 공간적 스케일링 (이웃 감시): 이것이 바로 "다음 지름길" 부분입니다. 이미지는 패치 그리드로 나뉩니다. AI가 두 번째 패치를 생성할 때, 단순히 첫 번째 패치의 최종 결과물만을 보는 것이 아닙니다. 첫 번째 패치의 *전체 디노이징 궤적(denoising trajectory)*을 봅니다. 이는 마치 주자가 배턴만 받는 것이 아니라, 앞선 주자의 전체 경기 전략까지 전달받는 이어달리기와 같습니다. 이러한 풍부한 맥락 덕분에 AI는 불필요한 단계를 건너뛸 수 있습니다.

결과: 빠르고, 가볍고, 선명하다

논문은 이 아이디어를 표준 벤치마크인 ImageNet(256x256 픽셀 이미지의 거대한 집합)에서 테스트했습니다. 결과는 매우 인상적이었습니다.

  • 속도: XYZFlow 모델은 기반이 된 "스승" 모델보다 7.2배에서 8.5배 더 빨랐습니다.
  • 품질: 이렇게 훨씬 빨라졌음에도 불구하고, 이미지는 믿기지 않을 정도로 선명했습니다. 예를 들어, 더 작은 XYZFlow 모델(매개변수 1억 7,200만 개)은 품질 점수(FID) 1.63을 기록하며, 훨씬 크고 느린 모델(매개변수 6억 7,600만 개, 점수 2.20)보다 더 나은 성능을 보여주었습니다.
  • 효율성: 저자들은 점진적인 스케줄(첫 번째 패치에서는 5단계로 시작하여, 그다음은 4단계, 그다음은 3단계, 마지막 패치는 2단계로 진행)을 사용함으로써, 높은 품질을 유지하면서도 단 14단계 만에 전체 이미지를 생성할 수 있음을 보여주었습니다. 대조적으로, 표준 방식은 유사한 결과를 얻기 위해 보통 20단계 이상이 필요합니다.

이것이 의미하는 바 (그리고 그렇지 않은 것)

이 논문은 더 빠른 이미지를 얻기 위해 단순히 모델을 크게 만들거나 더 잘 증류하려고 노력하는 기존의 방식이 한계에 부딪혔다고 주장합니다. 대신, 문제의 제약 조건을 더 구체적으로 만드는 것(AI에게 과거와 이웃에 대한 더 많은 맥락을 제공하는 것)이 진정한 열쇠라고 제안합니다.

저자들은 좋은 결과를 얻기 위해 반드시 완벽하고 거대한 스승 모델이 필요하다는 생각에 명시적으로 반대합니다. 실험 결과, "약한" 스승 모델을 사용했을 때도 XYZFlow는 여전히 우수한 성능을 보였으며, 이는 이 방식이 견고함을 시사합니다. 다만, 지름길을 너무 공격적으로 사용하면(너무 빨리 너무 많은 단계를 건너뛰면), 이미지의 다양성이 떨어지고 AI가 계속해서 비슷한 종류의 고양이만을 그려내기 시작한다는 점도 언급했습니다.

요약하자면, XYZFlow는 이미지 생성을 이미지의 각 부분이 서로에게서 얻은 전체 이야기를 바탕으로 나누는 구조적이고 단계적인 대화처럼 다룸으로써, 슈퍼컴퓨터의 힘을 빌리지 않고도 눈 깜짝할 사이에 아름다운 그림을 그리는 법을 AI에게 가르칠 수 있음을 시사합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →