← 최신 논문
🤖 AI

NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices

NanoFLUX는 트랜스포머 프루닝(transformer pruning), ResNet 기반 토큰 다운샘플링, 시각 신호 가이드 텍스트 인코더 증류를 특징으로 하는 점진적 압축 파이프라인을 통해 17B FLUX.1-Schnell로부터 증류된 2.4B 파라미터 텍스트-이미지 생성 모델로, 모바일 기기에서 약 2.5초 만에 고품질 이미지 생성을 가능하게 합니다.

원저자: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

게시일 2026-02-09
📖 3 분 읽기☕ 가벼운 읽기

원저자: Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Couto Pimentel Ramos, Luca Morreale, Mehdi Noroozi, Abhinav Mehrotra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신에게는 세상에서 가장 맛있고, 복잡하며, 시각적으로 경이로운 요리(이미지)를 만들어낼 수 있는 마스터 셰프, FLUX.1-Schnell이 있다고 상상해 보세요. 이 셰프는 천재이지만, 몸집이 엄청납니다. 무게가 170억 "단위"(파라미터)에 달하며, 이를 운영하기 위해서는 거대한 산업용 주방(강력한 클라우드 서버)이 필요합니다. 당신은 이 셰프를 당신의 작은 아파트(모바일 휴대폰)로 데려갈 수 없습니다. 주방이 너무 크고, 전기료가 너무 많이 들며, 셰프의 움직임이 빠른 저녁 식사를 내놓기에는 너무 느리기 때문입니다.

NanoFLUX는 그 해결책입니다. 이것은 마치 아주 작고 효율적인 견습 셰프를 만드는 것과 같습니다. 마스터 셰프와 거의 똑같이 맛있는 요리를 만들 수 있으면서도, 당신의 주머니 속에 쏙 들어가고 몇 초 만에 요리를 완성할 수 있습니다.

연구진이 이 작은 견습 셰프를 어떻게 만들었는지, 세 가지 기술을 사용하여 다음과 같이 설명합니다:

1. "잡동사니 정리" (중복된 부분 제거/Pruning)

마스터 셰프는 120억 개의 "뉴런"(Diffusion Transformer)을 가진 두뇌를 가지고 있습니다. 연구진은 이 뉴런 중 상당수가 똑같은 일을 반복하거나 별로 하는 일이 없다는 것을 깨달았습니다.

  • 비유: 1,200만 권의 책이 있는 도서관을 상상해 보세요. 하지만 그중 1,000만 권은 단 세 페이지를 복사해 놓은 복사본일 뿐입니다.
  • 해결책: 그들은 스마트 스캐너를 사용하여 중복된 책을 찾아내어 버렸습니다. 또한, 어떤 "셰프"(attention heads)들이 정확히 똑같은 일을 하고 있다는 것을 깨닫고, 남는 인원을 해고했습니다. 그리고 비슷한 업무를 수행하는 다른 셰프들을 하나의 슈퍼 셰프로 합쳤습니다.
  • 결과: 그들은 훌륭한 요리를 만드는 능력을 잃지 않으면서, 두뇌를 120억 단위에서 단 20억 단위로 줄였습니다.

2. "멀리 보기, 가까이 보기" 전략 (토큰 다운샘플링/Token Downsampling)

셰프가 이미지를 재현하기 위해 볼 때, 보통 전체 시간 동안 모든 픽셀(또는 "토큰")을 고해상도로 관찰합니다. 이는 느리고 매우 지치는 일입니다.

  • 비유: 당신이 풍경화를 그리고 있다고 상상해 보세요. 아주 초기 단계에는 나무의 모든 잎사귀를 볼 필요가 없습니다. 그저 숲과 산의 전반적인 형태만 알면 됩니다. 잎사귀를 세밀하게 그려 넣을 때가 되어서야 비로소 확대해서 자세히 보면 됩니다.
  • 해결책: NanoFLUX는 특별한 "ResNet" 렌즈를 사용합니다. 이미지를 생성하는 초기 단계에서는 사진을 멀리서(저해상도) 바라보며, 이는 매우 빠릅니다. 정교한 디테일을 추가할 시점이 되어서야 고해상도의 근접 뷰로 전환합니다.
  • 결과: 셰프는 전체 그림을 쳐다보는 데 시간을 덜 쓰고 중요한 것에 더 집중하게 되어, 과정이 훨씬 빨라졌습니다.

3. "스마트한 조수" (텍스트 인코더 증류/Text Encoder Distillation)

마스터 셰프는 또한 당신의 지시를 이해하기 위한 거대한 백과사전(50억 단위의 텍스트 인코더)을 가지고 있습니다. 만약 당신이 "모자를 쓴 고양이"라고 말한다면, 백과사전은 그것이 정확히 무엇을 의미하는지 알아야 합니다.

  • 비유: 마스터 셰프에게는 50억 페이지짜리 사전가 있습니다. 견습생에게는 3억 3천만 페이지짜리 사전만 있으면 됩니다.
  • 해결책: 단순히 견습생에게 더 작은 사전을 주는 대신, 그들은 견습생에게 마스터의 노트를 읽는 법을 가르쳤습니다. 그들은 마스터 셰프가 지시 사항을 읽는 동안 보았던 시각적 단서들을 견습생에게 보여주었습니다. 이렇게 함으로써, 작은 사전은 거대한 사전만큼의 모든 페이지를 필요로 하지 않고도 단어의 "느낌"과 의미를 똑같이 잘 이해할 수 있게 되었습니다.
  • 결과: 모델의 텍스트 이해 부분은 50억 단위에서 3억 3천만 단위로 줄어들었지만, 여전히 당신의 프롬프트를 완벽하게 이해합니다.

최종 결과

이 세 가지 기술을 결합하여, 연구진은 NanoFLUX를 만들어냈습니다.

  • 크기: 이 모델은 거대한 170억 파라미터 모델에서 아주 작은 24억 파라미터 모델로 변했습니다 (약 7배 작아짐).
  • 속도: 모바일 휴대폰에서 고품질 이미지(512x512 픽셀)를 생성하는 데 약 2.5초가 걸립니다.
  • 품질: 논문은 이 이미지들이 거대하고 비싼 클라우드 버전이 만든 것과 거의 동일해 보인다고 주장합니다.

요약하자면, 그들은 단순히 모델을 작게 만든 것이 아니라, 작동하는 방식을 더 똑똑하게 만들었습니다. 이는 아름다운 AI 예술을 생성하기 위해 더 이상 슈퍼컴퓨터가 필요하지 않다는 것을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →