← 최신 논문
💻 computer science

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow는 노이즈가 섞인 잠재 입력을 픽셀 공간 출력으로 직접 매핑함으로써 한 단계만으로 이미지 생성을 가능하게 하는 새로운 교차 공간 흐름(cross-space flow) 정식화를 도입하며, 이를 통해 잠재 표현의 효율성과 픽셀 공간의 직접적인 감독을 결다면 추론 시 별도의 디코더가 필요하지 않게 된다.

원저자: Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 걸작을 그리려고 노력 중이라고 상상해 보세요. 하지만 당신에게는 매우 구체적이고 까다로운 작업 방식이 있습니다.

기존 방식: "번역가" 문제

현재 대부분의 AI 이미지 생성기는 두 단계의 번역 과정을 거칩니다.

  1. 스케치 (잠재 공간/Latent Space): 먼저, AI는 비밀스럽고 추상적인 언어(잠재 공간이라 불리는)로 이미지의 거칠고 압축된 스케치를 그립니다. 이는 모든 픽셀을 일일이 그리는 대신, 넓고 단순한 붓터치로 그리는 것과 같기에 효율적입니다.
  2. 번역 (디코더/Decoder): 그 다음, 별도의 도구(디코더라고 불리는)가 이 거친 스케치를 실제 고화질 사진으로 번역해야 합니다.

문제점: 스케치를 그리는 AI는 "스케치 언어"를 말하도록 훈련되었고, 번역 도구는 "깨끗한 스케치"를 읽도록 훈련되었습니다. 하지만 AI가 스케치를 그릴 때 종종 지저분하거나 불완전할 수 있습니다. 그러면 번역 도구는 이 지저분한 스케치 때문에 혼란을 겪게 되고, 결과적으로 흐릿하거나 왜곡된 이미지를 만들어냅니다. 이는 마치 완벽한 프랑스어만 구사할 줄 아는 번역가가 화자가 속어나 오타를 사용했을 때 당황하는 것과 같습니다.

새로운 방식: CrossFlow (직접 그리는 예술가)

이 논문은 번역 과정을 통째로 건너뛰는 새로운 방법인 CrossFlow를 소개합니다.

스케치를 그린 뒤 번역하는 대신, CrossFlow는 단 한 명의 예술가로서 지저분하고 추상적인 아이디어(노이즈가 섞인 스케치)를 받아 곧바로 최종 사진을 직접 그려냅니다.

작동 방식은 다음과 같은 쉬운 비유를 통해 설명할 수 있습니다.

1. "번역 없는" 가교
보통의 AI 모델은 한 가지 언어만 할 줄 아는 사람과 같습니다. 만약 언어 A(스케치)에서 언어 B(사진)로 넘어가고 싶다면 사전이 필요합니다. 하지만 CrossFlow는 언어 A의 웅얼거리는 문장을 듣고도 중간에 사전 없이 즉시 완벽한 언어 B의 문장으로 말할 수 있는 천재적인 다국어 능력자와 같습니다.

2. "원스텝(One-Step)"의 마법
대부분의 이미지 생성기는 흐릿한 사진을 서서히 선명하게 만드는 것처럼, 이미지를 정교하게 만들기 위해 여러 단계를 거칩니다. CrossFlow는 "원스텝" 생성기입니다. 지저분한 입력을 보고 즉시 최종적인 선명한 이미지를 출력합니다. 이는 암실에서 사진을 천천히 현상하는 것과 현대 스마트폰으로 순식간에 완벽한 사진을 찍는 것의 차이와 같습니다.

3. "실제" 실수를 통한 학습
기존 방식에서 "번역" 도구는 완벽하고 깨끗한 스케치에 대해 학습되었습니다. 하지만 현실 세계에서 그들이 받는 스케치는 지저분합니다. CrossFlow는 예술가가 지저한 스케치를 보면서 학습하도록 함으로써 이 문제를 해결합니다. 즉, 노이즈를 무시하고 최종 사진에 집중하는 법을 배웁니다. 학습 과정 중에 최종 사진을 함께 보기 때문에, 기존의 2단계 방식으로는 쉽게 할 수 없었던 "지각(이것이 진짜처럼 보이는가?)" 및 "적대적(비평가를 속일 수 있는가?)" 체크를 통해 학습할 수 있습니다.

결과

연구진은 이를 대규모 이미지 데이터셋(ImageNet)에 대해 테스트했습니다.

  • 속도: 단 한 번의 단계(한 번의 함수 평가)로 이미지를 생성합니다.
  • 품질: 훨씬 더 빠른 속도로 구현하면서도, 최고의 다단계 방식(multi-step methods)만큼이나 선명하고 사실적인 이미지를 만들어냅니다.
  • 다재다능함: 이 모델은 스스로 메인 예술가가 되어 이미지를 처음부터 생성하거나, 혹은 다른 AI 시스템이 만든 지저분한 스케치를 수정하는 강력한 번역기 역할을 할 수 있습니다.

핵심 요약

CrossFlow는 걸작을 만들기 위해 반드시 같은 언어를 말할 필요는 없다는 점을 깨달음으로써 "불일치" 문제를 해결합니다. 우리는 거칠고 압축된 아이디어에서 시작하여, 오류를 일으키는 중간 매개체를 건너뛰고 직접 멋진 고화질 이미지를 출력할 수 있습니다. 이는 단순한 스케치로 작업할 때의 속도와, 직접 최종 사진을 다룰 때의 품질을 결합한 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →