← 최신 논문
💻 computer science

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image는 확장 가능한 싱글 스트림 확산 트랜스포머(Scalable Single Stream Diffusion Transformer) 아키텍처를 기반으로 구축되어 실사성과 텍스트 렌더링 측면에서 최첨단 성능을 달면서도 계산 비용을 크게 줄여 고품질 생성을 소비자급 하드웨어에서도 접근 가능하게 만든 효율적인 60억 파라미터 규모의 오픈 소스 이미지 생성 파운데이션 모델입니다.

원저자: Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Yuming Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyan
게시일 2026-06-23
📖 4 분 읽기☕ 가벼운 읽기

원저자: Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Yuming Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyang Liu, Qilong Wu, Feng Yu, Zechao Zhan, Chi Zhang, Shifeng Zhang, Ruikai Zhou, Shilin Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

빅 픽처: 작고 똑똑한 요리사 vs 거대한 식품 공장

AI 이미지 생성의 세계를 거대한 주방이라고 상상해 보세요. 현재 가장 유명한 셰프들(예: Nano Banana Pro 또는 Seedream 4.0)은 거대한 산업 공장에서 일하고 있습니다. 그들은 거대한 팀과 막대한 예산을 가지고 있지만, 규모가 너무 커서 오직 부유한 기업들만이 그들을 고용할 여력이 있습니다.

반대편에는 오픈 소스 셰프들(예: Qwen-Image 또는 FLUX.2)이 있습니다. 이들은 무료로 사용할 수 있지만, 규모가 너무 커서(2만에서 800억 개의 "재료" 또는 파라미터 무게) 단 한 끼의 식사를 요리하기 위해서도 슈퍼컴퓨터를 필요로 합니다. 만약 일반 노트북에서 이들을 실행하려고 하면, 당신의 컴퓨터는 다운될 것입니다.

Z-Image는 새로운 도전자입니다. 이것은 60억 파라미터 모델입니다. 이를 숙련된 기술을 가진 콤팩트한 "푸드 트럭" 셰프로 생각하세요. 이 모델은 표준 자동차(당신의 소비자용 노트북이나 단일 GPU)에 들어갈 만큼 작지만, 거대한 식품 공장 셰프들만큼, 혹은 그보다 더 맛있는 음식을 요리합니다.

Z-Image의 개발팀(알리바바 출신)은 이렇게 말합니다. "훌륭한 식사를 만들기 위해 반드시 마천루를 지을 필요는 없습니다. 더 나은 레시피와 더 똑똑한 재료만 있으면 됩니다."


비밀 소스: 그들이 해낸 방법

논문은 이 작은 모델을 강력하게 만든 네 가지 주요 "기둥"을 설명합니다. 여기서는 비유를 사용하여 이 기능들이 어떻게 작동하는지 설명합니다.

1. 데이터 인프라: "스마트 식료품점"

대부분의 AI 모델은 방대한 양의 무질서한 데이터를 컴퓨터에 쏟아붓는 방식으로 훈련됩니다(마치 창고 전체의 식료품을 블렌더에 통째로 던져 넣는 것과 같습니다). 이는 매우 낭비적이고 혼란스럽습니다.

Z-Image는 스마트 식료품점 접근 방식을 사용합니다. 그들은 다음과 같은 시스템을 구축했습니다:

  • 식재료 프로파일링: 모든 이미지의 품질, 선명도, 그리고 그것이 실제인지 아니면 가짜 AI 생성 쓰레기인지를 확인합니다.
  • 선반 정리: "세계 지식 그래프"(거대한 백과사전 같은 것)를 사용하여 "고양이" 같은 흔한 것부터 "쏘가리(Squirrel Fish)"(특정 중국 요리) 같은 희귀한 것까지 모든 재료를 갖추도록 합니다.
  • 능동적 큐레이션: 만약 모델이 특정 사물을 그리는 법을 잊어버리면, 시스템은 자동으로 그 사물의 예시를 더 찾아내어 학습시킵니다.
  • 결과: 모델에게 질 낮은 밀가루 1,000파운드를 먹이는 대신, 완벽하게 측정된 최고의 밀가루 10파운드를 먹이는 것입니다.

2. 아키텍처: "올인원 주방 조리대"

이전 모델들은 종종 텍스트를 읽는 곳과 그림을 그리는 곳이 분리되어 있었습니다. 이는 마치 한 명의 셰프가 레시피를 읽는 동안 다른 셰프가 무엇을 요리할지 추측하며, 서로 소통하기 위해 방 너머로 소리를 질러야 하는 상황과 같습니다.

Z-Image는 **단일 스트림 아키텍처(S3-DiT)**를 사용합니다. 텍스트와 이미지 토큰(그림의 디지털 구성 요소)이 바로 옆에 놓여 있는 하나의 긴 주방 조리대를 상상해 보세요. 이들은 매 단계마다 즉각적으로 서로 소통합니다. 이 덕분에 모델은 매우 효율적이면서도, 6B라는 작은 크기로도 매우 똑똑하게 작동할 수 있습니다.

3. 훈련 전략: "학교 커리큘럼"

그들은 단순히 모델을 깊은 물에 던져 넣지 않았습니다. 단계별 학교 커리큘럼을 사용했습니다:

  • 초등학교 (저해상도 사전 훈련): 모델은 작고 흐릿한 이미지를 사용하여 모양과 색상의 기초를 배웁니다. 이는 저렴하고 빠릅니다.
  • 고등학교 (옴니 사전 훈련): 모델은 다양한 크기, 텍스트, 그리고 심지어 사진 편집(사진 변경)을 동시에 처리하는 법을 배웁니다.
  • 대학교 (미세 조정): 고도로 큐레이션된 데이터를 사용하여 모델이 지시 사항을 완벽하게 따르도록 가르칩니다.
  • 대학원 (증류 및 RLHF): 이것이 "마법의 기술"입니다. 그들은 느리지만 고품질인 모델을 가져와서 "학생" 버전(Z-Image-Turbo)에게 더 빠르게 생각하는 법을 가르쳤습니다.
    • 증류(Distillation): 학생이 매번 수학 문제를 단계별로 풀 필요 없이 최종 정답지를 암기하는 것과 같습니다.
    • 보상 훈련(RLHF): 인간의 선호도에 기반한 "성적표"를 모델에게 주어, 더 사실적이고 지시를 잘 따르는 이미지를 만들도록 가르칩니다.

4. 결과물: Z-Image-Turbo

최종 제품인 Z-Image-Turbo는 "급행 차선" 버전입니다.

  • 속도: 보통 100단계가 필요한 것을 단 8단계 만에 이미지를 생성할 수 있습니다. 이는 강력한 컴퓨터에서 1초도 걸리지 않으며, 일반적인 게이밍 노트북에서도 부드럽게 실행됩니다.
  • 품질: 실사 이미지를 생성하며, 결정적으로 이미지 내부에 텍스트(영어 및 중국어 모두)를 완벽하게 작성합니다. 이는 AI가 수행하기 매우 어려운 작업입니다.

실제로 무엇을 할 수 있는가? (논문 기반)

논문은 이 모델이 달성할 수 있는 몇 가지 시연을 제공합니다:

  • 사실주의(Photorealism): 복잡한 조명, 반사, 피부 질감을 포함하여 휴대폰으로 찍은 실제 사진처럼 보이는 이미지를 생성할 수 있습니다.
  • 이중 언어 텍스트: 이미지 안에 철자 오류나 엉터리 글자 없이 영어와 중국어로 된 긴 문장을 쓸 수 있습니다.
  • 이미지 편집: "빨간 스카프를 주황색으로 바꿔줘" 또는 "꽃을 제거해줘"라고 말하면, 나머지 이미지를 망치지 않고 정확하게 수행합니다.
  • 추론: 만약 "우리 안의 닭과 토끼 문제"(수학 문제)를 주면, 칠판 위에 그 해결 과정을 시각화할 수 있습니다. 시(Poem)를 바탕으로 장면을 그려달라고 하면, 문화적 맥락을 이해하고 올바른 역사적 세부 사항을 그려냅니다.
  • 다문화 이해: 특정 문화적 설정(시드니 오페라 하우스 장면이나 베이징 거리 등)의 사람들을 정확한 랜드마크 및 의복과 함께 생성할 수 있습니다.

핵심 요약

논문은 Z-Image가 최고 수준의 AI를 만들기 위해 수백만 달러를 쓰고 수천 대의 슈퍼컴퓨터를 사용할 필요가 없다는 것을 증명한다고 주장합니다. 사용하는 데이터, 모델 구조, 그리고 훈련 방식에 대해 더 똑똑하게 접근함으로써, 그들은 다음과 같은 모델을 만들어냈습니다:

  1. 훈련 비용이 약 630,000달러로 (다른 모델들이 쓰는 비용의 극히 일부),
  2. 소비자용 하드웨어(16GB 메모리를 가진 노트북)에서 실행되며,
  3. 현재 시장에 나와 있는 거대하고 비싼 폐쇄형 모델들과 대등하거나 더 나은 성능을 보여줍니다.

그들은 누구나 이 "효율적이고, 예산 친화적이며, 최첨단인" 기술을 사용할 수 있도록 코드와 모델을 공개했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →