← 최신 논문
💻 computer science

Qwen-Image-VAE-2.0 Technical Report

Qwen-Image-VAE-2.0 는 글로벌 스킵 연결, 합성 렌더링을 통한 대규모 학습, 그리고 향상된 의미 정합과 같은 아키텍처 혁신을 통해 최첨단 재구성 충실도와 우수한 확산성을 달성하는 고압축 변이형 오토인코더 스위트로, 특히 텍스트가 풍부한 시나리오에서 탁월한 성능을 발휘합니다.

원저자: Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue
게시일 2026-05-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Zekai Zhang, Deqing Li, Kuan Cao, Yujia Wu, Chenfei Wu, Yu Wu, Liang Peng, Hao Meng, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Yiliang Gu, Yi Wang, Xiaoxiao Xu, Lin Qu

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

친구에게 번잡한 도시 거리의 고해상도 대용량 사진을 보내려는데 인터넷 연결이 매우 느리다고 상상해 보세요. 이때 두 가지 선택지가 있습니다:

  1. 옛날 방식: 사진을 약간만 축소합니다 (일반 엽서 크기처럼). 모양은 괜찮아 보이지만, 친구가 작은 거리 표지판이나 번호판을 읽으려 하면 글자들이 흐릿한 얼룩으로 변합니다.
  2. 새로운 방식 (Qwen-Image-VAE-2.0): 사진을 우표 크기까지 축소합니다 (고압축 비율). 보통 이렇게 하면 이미지가 엉망이 되지만, 이 새로운 기술은 그렇게 작게 축소하면서도 거리 표지판을 완벽하게 읽을 수 있게 하고 디테일을 선명하게 유지합니다.

보고서의 아이디어를 바탕으로 Qwen-Image-Image-VAE-2.0 팀이 이를 달성한 방법을 간단히 설명하면 다음과 같습니다:

1. 문제: "압착"의 트레이드오프

AI 이미지 생성 세계에는 이런 불문율이 있습니다: 이미지를 공간 절약 (압축) 을 위해 너무 작게 짜내면 보통 미세한 디테일 (재구성) 을 잃게 됩니다. 반면, 디테일을 유지하기 위해 "짜낸" 데이터를 크게 만들면 나중에 새로운 이미지를 생성하는 AI 가 혼란을 겪고 학습에 시간이 너무 오래 걸립니다 (확산성). 마치 도서관 전체를 신발상자에 넣으려 하는 것과 같습니다. 책들이 찢어지거나, 상자가 너무 무거워 아무도 들 수 없게 됩니다.

2. 해결책: 더 똑똑한 "여행가방"

Qwen 팀은 세 가지 영리한 작업을 통해 이 문제를 해결하는 새로운 종류의 디지털 여행가방 (VAE) 을 만들었습니다:

  • "글로벌 스킵 연결" (직통 회선):
    여행가방을 싸는 상황을 상상해 보세요. 보통 모든 것을 깔끔하게 접으면 깨지기 쉬운 화분 (미세한 텍스트 디테일) 같은 것들이 으깨집니다. Qwen 팀은 원본 사진에서 여행가방으로 이어지는 "직통 회선"을 추가했습니다. 가장 중요하고 고주파수인 디테일 (글자의 날카로운 가장자리 등) 을 먼저 접지 않고 바로 여행가방 안으로 밀어 넣습니다. 이렇게 하면 이미지가 아주 작아져도 텍스트의 날카로운 가장자리가 온전하게 유지됩니다.

  • "더 넓은" 여행가방 (확장된 채널):
    보통 이미지를 축소할 때 여행가방을 좁게 만듭니다. 하지만 담을 정보가 많다면 좁은 여행가방은 물건을 으깨버립니다. Qwen 팀은 여행가방을 더 넓게 만들었습니다 (채널 차원 증가). 이렇게 하면 축소된 이미지의 디테일을 잃지 않고 더 많은 공간을 확보할 수 있습니다. 여행가방이 더 넓어졌더라도 이를 나르는 AI 가 느려지거나 무거워지지 않는다는 것을 증명했습니다.

  • "훈련용 바퀴" (의미 정렬):
    넓은 여행가방의 일반적인 문제는 이를 나르는 AI 가 안에 무엇이 들어있는지 혼란을 겪는다는 점입니다. 이를 해결하기 위해 팀은 여행가방이 "스마트 지도" (DINOv2 라는 도구 사용) 와 내용을 매칭하도록 contents 를 정리하는 법을 가르쳤습니다. 이 지도는 사물들이 개념적으로 어떻게 생겼는지 알고 있습니다. 여행가방의 내용물을 이 지도와 정렬함으로써 AI 는 더 빠르게 학습하고 나중에 더 좋은 이미지를 생성합니다. 그들은 단계별로 이를 수행했습니다: 먼저 엄격한 정렬을 강요해 기초를 가르친 뒤, 규칙을 완화하여 AI 가 그림을 아름답게 만드는 데 집중하도록 했습니다.

3. "텍스트가 풍부한" 도전 과제

대부분의 AI 테스트는 고양이 사진이나 풍경 사진을 사용합니다. 하지만 Qwen 팀은 텍스트가 축소하기 가장 어려운 요소임을 알고 있었습니다. 흐릿한 고양이는 여전히 고양이이지만, 흐릿한 글자 "A"는 덩어리로 보입니다.

이를 해결하기 위해 그들은 단순히 무작위 사진을 사용하지 않았습니다. 대신 다음과 같이 진행했습니다:

  • 수십억 장의 이미지를 수집했습니다.
  • 교과서, 포스터, 신문과 같은 수백만 개의 문서를 특별히 모았습니다.
  • 텍스트를 무작위 배경 (벽돌 벽이나 나무에 표지판을 붙이는 것 등) 에 인쇄하는 **합성 파이프라인 (로봇 공장)**을 만들어 AI 가 혼란스러운 실제 세계 상황에서 텍스트를 처리하는 법을 배우도록 했습니다.

4. 새로운 테스트: "OmniDoc-TokenBench"

팀은 단순히 픽셀 밝기를 측정하는 기존 테스트가 텍스트 가독성을 확인하는 데 적합하지 않음을 깨달았습니다. 그래서 OmniDoc-TokenBench라는 새로운 테스트를 개발했습니다.

  • 작동 방식: 문서를 가져와 AI 로 축소한 뒤, "읽기 로봇" (OCR) 이 원본과 축소된 버전의 텍스트를 읽게 합니다.
  • 점수: 로봇이 읽은 내용을 비교합니다. 원본에서 "Hello"를 읽었는데 축소된 버전에서 "Helo"로 읽으면 점수가 떨어집니다. 이는 색상이 올바른지 여부가 아니라 텍스트가 실제로 가독성이 있는지를 측정합니다.

5. 결과

  • 재구성: 모델을 테스트했을 때, 이미지를 16 배 또는 32 배까지 축소 (원본 크기의 1/16 또는 1/32) 해도 텍스트를 완벽하게 읽을 수 있었습니다. 같은 크기에서 다른 모델들은 텍스트를 뜻 모를 글자 더미로 만들었습니다.
  • 속도: "인코더" (여행가방을 싸는 부분) 를 매우 가볍게 만들고 무거운 "어텐션" 메커니즘을 제거했기 때문에 이미지를 매우 빠르게 압축합니다.
  • 생성: 이 압축된 여행가방을 사용해 새로운 이미지 생성기 (DiT) 를 학습시켰을 때, 다른 고압축 모델들보다 훨씬 빠르게 학습했습니다.

요약

Qwen-Image-VAE-2.0 은 초고효율 포장 서비스와 같습니다. 텍스트가 풍부한 대용량 문서를 글자를 으깨지 않고 아주 작은 크기로 축소할 수 있으며, 내용을 매우 잘 정리하여 다음 사람 (이미지 생성기) 이 이를 풀어서 매우 빠르게 고품질의 새로운 이미지를 만들 수 있게 합니다. 이는 기존에 "작은 파일 크기", "선명한 텍스트", "빠른 생성" 중 하나를 선택해야 했던 문제를 해결하며, 이 모델은 세 가지를 모두 제공합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →