Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Mage-Flow는 경량 고충실도 VAE, 네이티브 해상도 디퓨전 트랜스포머, 그리고 시스템 수준의 최적화의 공동 설계를 통해 효율적인 고해상도 텍스트-투-이미지 생성과 지시 기반 편집을 달성하며, 단일 GPU에서 초저지연의 경쟁력 있는 성능을 제공하는 컴팩트한 4B 규모의 파운데이션 모델 제품군입니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇 예술가를 만들려고 노력하고 있다고 상상해 보세요. 수년 동안 이 예술가를 진정으로 천재적으로 만드는 유일한 방법은, 이를 실행하기 위해 창고 가득 차 있는 슈퍼컴퓨터가 필요할 정도로 거대한 뇌를 구축하는 것이었습니다. 이러한 "거대 뇌"들은 놀라운 그림을 그리거나 사진을 아주 세밀하게 편집할 수 있었지만, 너무 무겁고 비싸서 오직 몇몇 대기업만이 감당할 수 있었습니다. 그것들은 마치 엔진을 걸기 위해 팀 단위의 정비사가 필요한 페라리와 같았습니다.
"생성형 AI"라는 분야는 컴퓨터에게 아무것도 없는 상태에서 이미지와 같은 새로운 것들을 창조하도록 가르치는 것에 관한 것입니다. 이를 위해 컴퓨터에는 두 가지 주요 도구가 필요합니다. 첫째, **토크나이저(tokenizer)**는 고해상도의 복잡한 사진을 컴퓨터가 이해할 수 있는 압축된 명령 목록으로 바꾸는 번역기와 같습니다. 둘째, **백본(backbone)**은 그 명령들을 바탕으로 실제로 그림을 그리는 핵심 엔진입니다. 큰 문제는 토크나이저(번역기)가 종종 느리고 서툴다는 점이었으며, 특히 크고 상세한 이미지를 다룰 때 더욱 그랬습니다. 연구자들이 던져온 질문은 이것이었습니다. "우리는 거인들만큼이나 재능이 있으면서도, 그 마법을 잃지 않은 채 단 한 대의 노트북에도 들어갈 만큼 작은 로봇 예술가를 만들 수 있을까?"
여기 마이크로소프트 Mage 팀의 새로운 프로젝트인 Mage-Flow가 등장하여 "그렇다, 할 수 있다"라고 말합니다. 팀은 더 큰 뇌를 만드는 대신, 시스템 전체를 믿을 수 없을 정도로 효율적으로 처음부터 다시 구축하기로 결정했습니다. 그들은 현재 이 분야을 지배하고 있는 800억 개의 파라미터(크기를 측정하는 척도)를 가진 거인들과 비교했을 때 아주 작은, 단 40억 개의 파라미터만을 가진 콤팩트한 "예술가"를 만들어냈습니다.
그들이 이 일을 해낸 방법은 다음과 같은 몇 가지 영리한 기술들을 사용한 것입니다:
1. 초고속 번역기 (Mage-VAE)
토크나이저를 사진을 비밀 코드로 바꾸는 번역기라고 생각해 보세요. 기존의 번역기들은 느리고 무거운 여행 가방과 같았습니다. 특히 고해상도 이미지를 다룰 때 짐을 싸고 푸는 데 시간이 너무 오래 걸렸습니다. Mage-Flow는 Mage-VAE라는 새로운 번역기를 도입했습니다. 무거운 여행 가방 대신, 마법 같은 종이접기 기계를 만든 것과 같습니다. 이것은 복잡한 사진을 작고 깔끔한 패키지로 접었다가, 다시 완벽한 사진으로 단 한 번의 빠르고 경쾌한 단계로 펼쳐낼 수 있습니다. 이 새로운 번역기는 매우 효율적이어서, 기존의 무거운 번역기들과 동일한 작업을 수행하면서도 이미지를 푸는 데 약 22배 적은 에너지를 사용합니다. 이는 로봇 예술가가 번역기가 작업을 마칠 때까지 기다리는 시간을 거의 쓰지 않게 된다는 것을 의미합니다.
2. 유연한 캔버스 (Native-Resolution)
보통 컴퓨터가 그림을 그릴 때, 긴 직사각형과 높은 정사각형을 똑같은 정사각형 상자에 억지로 끼워 맞추려는 것처럼 모든 이미지를 경직된 격자에 강제로 맞춥니다. 이는 공간을 낭비하고 창의성을 제한합니다. Mage-Flow는 **네이티브 해상도 패킹(Native-Resolution Packing)**이라는 기술을 사용합니다. 당신이 그리고 싶은 이미지의 정확한 모양에 따라 늘어나고 줄어드는 유연한 캔버스를 상상해 보세요. 영화 포스터처럼 가로로 긴 형태든, 휴대폰 배경화면처럼 세로로 긴 형태든 상관없습니다. 컴퓨터는 이미지를 상자에 구겨 넣느라 시간을 낭비하지 않고, 있는 그대로의 모습으로 그려냅니다. 이 덕분에 훈련 과정이 훨씬 빨라졌으며, 예술가가 극단적인 형태를 다루더라도 혼란을 겪지 않게 되었습니다.
3. 터보 엔진
빠른 번역기와 유연한 캔버스가 있어도, 그림을 단계별로 그리는 것은 시간이 걸릴 수 있습니다. 팀은 그들의 모델에 터보(Turbo) 버전을 만들기 위해 특별한 "증류(distillation)" 기술을 사용했습니다. 이것은 예술가에게 작은 걸음 대신 거대한 도약을 하도록 가르치는 것과 같습니다. 표준적인 예술가는 그림을 완성하는 데 30단계를 거칠 수 있지만, 터보 버전은 단 4단계 만에 해낼 수 있습니다. 단계를 적게 거침에도 불구하고 품질은 여전히 매우 높습니다.
결과
팀은 자신들의 40억 파라미터 예술가를 800억 파라미터의 거인들과 테스트했습니다. 결과는 놀라웠습니다. 단 하나의 강력한 컴퓨터 칩(NVIDIA A100)에서, Mage-Flow는 1024x1024 해상도의 고품질 이미지를 단 0.59초 만에 생성할 수 있었습니다. 기존 사진을 편집하는 데는 1.02초밖에 걸리지 않았습니다.
아마도 가장 인상적인 점은, 터보 버전이 약 18GB의 적은 메모리를 사용하면서 약 1초 만에 사진을 편집할 수 있었다는 것입니다. 반면 거대 모델들은 보통 그 두 배 혹은 세 배의 메모리가 필요했고 실행하는 데 훨씬 더 오랜 시간이 걸렸습니다. 이 논문은 이러한 접근 방식이 고품질의 예술을 만들기 위해 반드시 거대하고 비싼 뇌가 필요한 것은 아니며, 단지 스마트하고 효율적인 설계가 필요하다는 것을 증명한다고 제안합니다.
또한 이 논문은 이 시스템이 편집 작업에도 매우 훌륭하게 작동한다는 것을 보여주었습니다. 당신이 로봇에게 "배경을 해변으로 바꿔줘", "사람을 제거해줘", 또는 "텍스트를 추가해줘"라고 말하면, 로봇은 이를 충실히 수행합니다. 그들은 심지어 화살표와 텍스트가 포함된 과학적 도표를 그리는 매우 구체적인 작업에 대해서도 테스트했습니다. 이 작은 40억 모델은 추가 훈련을 거친 후, 훨씬 더 큰 전문 모델만큼이나 잘 도표를 그려낼 수 있었습니다.
요약하자면, Mage-Flow는 AI 예술의 미래가 더 크고 무겁게 만드는 것에 있지 않다는 것을 시사합니다. 그것은 더 스마트하고, 가볍고, 빠르게 만드는 것에 있으며, 이를 통해 강력한 이미지 생성 및 편집 기능이 슈퍼컴퓨터 없이도 당신의 데스크톱이나 심지어 주머니 속에서도 가능하게 만드는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.