MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
본 논문은 1000 만 개의 샘플로 학습된 200 억 파라미터 규모의 마스킹 영역 확산 모델인 MRT 를 소개하며, 이는 텍스트-레이어, 이미지-레이어, 레이어-레이어 작업을 통합하여 기존 상용 시스템 및 동시 개발 시스템 대비 우수한 품질과 효율성을 갖춘 최첨단 실시간 다중 레이어 투명 이미지 생성 및 편집을 달성합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
디지털 사진 편집기 (예: 포토샵) 를 가지고 있다고 상상해 보세요. 여기서 '레이어'라는 별도의 층을 다룰 수 있습니다. 텍스트 상자를 이동하거나, 배경을 바꾸거나, 아이콘을 교체해도 나머지 그림은 망가지지 않습니다. 이제 평평하고 완성된 그림을 그리는 것이 아니라, 인간 디자이너가 하듯이 그림을 층별로 구축하는 AI 를 상상해 보세요.
그것이 바로 "MRT: Masked Region Transformer"라는 논문이 다루는 내용입니다. 그들이 무엇을 만들었는지 그리고 어떻게 작동하는지 일상적인 비유를 사용해 간단히 설명해 보겠습니다.
큰 문제: "평평한 케이크" 대 "층이 있는 케이크"
오늘날 대부분의 AI 이미지 생성기는 평평한 케이크만 만드는 제빵사와 같습니다. 그들은 완성된 이미지를 제공하지만, 꼭대기의 체리를 바꾸고 싶다면 케이크 전체를 다시 그려야 합니다. 스펀지를 망가뜨리지 않고는 체리를 쉽게 옮기거나 크림을 바꿀 수 없습니다.
연구진들은 층이 있는 케이크를 굽는 AI 를 원했습니다. 스펀지, 속재료, 크림, 체리를 나중에 편집할 수 있는 별도의 이동 가능한 조각으로 생성하는 시스템을 원했습니다. 이를 '레이어드 이미지 생성 (Layered Image Generation)'이라고 합니다.
해결책: MRT (마스터 셰프)
캔바 (Canva) 연구소의 팀은 MRT(Masked Region Transformer) 라는 거대한 AI 모델을 구축했습니다. 이를 1 천만 개 이상의 그래픽 디자인 (포스터, 전단, 광고) 을 연구하여 처음부터 이러한 층이 있는 케이크를 만드는 법을 배운 마스터 셰프로 생각하세요.
이 셰프가 가진 세 가지 주요 '초능력'은 다음과 같습니다.
1. "마법 레시피" (텍스트에서 레이어로)
AI 에게 "빛나는 공과 '20% 할인' 문구가 있는 디스코 파티용 포스터"와 같은 텍스트 설명을 줄 수 있습니다.
- 기존 AI: 평평한 디스코 그림을 그립니다.
- MRT: 배경, 디스코 볼, 텍스트를 별도의 투명한 레이어로 그립니다. 텍스트 레이어를 왼쪽으로 옮기거나 디스코 볼을 별 모양으로 바꾸어도 포스터의 나머지는 완벽하게 유지됩니다.
2. "역공학" (이미지에서 레이어로)
이는 완성된 평평한 케이크를 마법처럼 다시 재료로 분리하는 것과 같습니다.
- 작업: 평평한 이미지 (웹사이트 스크린샷이나 포스터 등) 를 업로드합니다.
- MRT 의 역할: 무엇이 배경에 속하고, 무엇이 텍스트이며, 무엇이 이미지인지 파악합니다. 그런 다음 이를 "벗겨내어" 별도의 편집 가능한 레이어로 분리합니다.
- 비법: 이 논문은 겹치는 요소가 많은 복잡한 디자인에서도 놀라울 정도로 잘 작동하며, 현재 사용 가능한 다른 도구들보다 훨씬 빠르고 정확하다고 주장합니다.
3. "혼합 및 매칭" (레이어에서 레이어로)
이것이 편집 부분입니다. AI 에게 디자인을 주고 "여기에 새 레이어를 추가해 줘" 또는 "이 특정 레이어의 스타일을 나머지와 일치하도록 바꿔 줘"라고 말할 수 있습니다.
- 예시: 파란 하늘이 있는 포스터가 있습니다. 새로운 태양을 추가하고 싶다면 MRT 는 기존 하늘의 조명과 스타일에 완벽하게 어울리는 방식으로 태양을 추가합니다. 또는 고양이 사진을 업로드하고 "이 고양이를 이 포스터에 어울리는 만화 스티커처럼 만들어 줘"라고 하면 MRT 는 즉시 변환을 수행합니다.
비밀 소스: 그들이 어떻게 했는지
1. "오버플로우" 트릭 (거대한 캔버스)
일반적으로 AI 가 그림을 그릴 때 프레임 밖으로 나가는 것 (예: 사진 옆으로 튀어나온 나뭇가지) 을 잘라냅니다.
- MRT 의 혁신: 그들은 AI 에게 최종 이미지보다 더 큰 거대하고 보이지 않는 캔버스에서 그리도록 가르쳤습니다. 이를 통해 요소들이 가장자리 밖으로 "넘쳐날" 수 있게 합니다.
- 중요성: 나중에 그 넘쳐난 나뭇가지를 포스터의 다른 쪽으로 옮기고 싶다면, AI 는 보이는 부분뿐만 아니라 나뭇가지 전체를 저장하고 있습니다. 조각들을 온전하고 편집 가능한 상태로 유지합니다.
2. "마스킹" 게임
담요 아래에 무엇이 있는지 맞춰야 하는 게임을 한다고 상상해 보세요.
- 텍스트에서 레이어로: AI 는 빈 노이즈 캔버스 (오래된 TV 의 정적과 같음) 로 시작하여 레이어를 채워 넣습니다.
- 이미지에서 레이어로: AI 에게 완성된 이미지 (담요가 들어 올려진 상태) 가 주어지지만, 배경과 텍스트를 "마스킹 (가림)"하고, 그 다음 그 특정 부분만 다시 그려서 분리하라고 지시받습니다.
- 이 "마스킹" 기법을 사용하여 동일한 AI 두뇌가 처음부터 작성하고, 분해하고, 편집하는 작업을 모두 동시에 처리할 수 있습니다.
3. 속도 향상 ("증류")
일반적으로 복잡한 레이어 이미지를 생성하는 데는 시간이 오래 걸립니다 (느린 컴퓨터가 렌더링하는 것을 기다리는 것과 같음).
- 연구진들은 증류 (distillation) 라는 기법을 사용했습니다. 이는 마스터 셰프 (느리지만 완벽한 교사) 가 견습생 (빠른 학생) 에게 50 단계 대신 8 단계로 같은 요리를 만드는 법을 가르치는 것과 같습니다.
- 결과: AI 는 이제 품질을 크게 잃지 않고 실시간(약 3~6 초) 에 이러한 복잡한 레이어 디자인을 생성할 수 있습니다.
결과
이 논문은 MRT 를 다른 최상위 AI 모델 및 상업용 도구와 비교합니다.
- 품질: 사용자 테스트에서 사람들은 레이어가 더 깔끔하고, 텍스트가 더 좋으며, 조각들이 더 자연스럽게 어울린다는 이유로 다른 시스템보다 MRT 의 결과를 선호했습니다.
- 속도: 복잡한 이미지를 분해할 때 "Qwen-Image-Layered"라는 경쟁 모델보다 10 배에서 100 배까지 빠릅니다.
- 메모리: 컴퓨터 메모리를 훨씬 적게 사용하므로, 표준 고성능 그래픽 카드에서도 충돌 없이 실행할 수 있습니다.
요약
이 논문은 디지털 이미지를 정적인 그림이 아니라 편집 가능한 레고 세트로 취급하는 도구를 제시합니다. 텍스트 설명에서 이러한 세트를 구축하거나, 완성된 그림을 분해하여 레고 블록을 드러내거나, 디자인을 변경하기 위해 블록을 교체할 수 있습니다. 모든 조각이 상자 가장자리 밖으로 튀어나와 있더라도 조각들을 온전하게 유지하면서 말이죠.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.