← 최신 논문
💻 computer science

VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations

본 논문은 기존 확산 모델 및 고정 해상도 자기회귀 모델에 비해 계산 비용이 현저히 낮고 성능이 우수하며 효율적인 동적 해상도 이미지 합성을 가능하게 하는 해상도 무관 1D 이미지 토크나이저인 VibeToken과 이에 상응하는 자기회귀 생성기(VibeToken-Gen)를 소개합니다.

원저자: Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

게시일 2026-04-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maitreya Patel, Jingtao Li, Weiming Zhuang, Yezhou Yang, Lingjuan Lv

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고해상도 도시 스카이라인 사진을 친구에게 보내려고 한다고 상상해 보세요.

기존 방식 (전통적 AI 모델):
대부분의 현재 AI 이미지 생성기는 매우 문자 그대로이고 경직된 번역기처럼 작동합니다. 작은 엽서 (256x256 픽셀) 를 보내고 싶다면, 번역기는 이미지를 256 개의 작은 퍼즐 조각으로 분해합니다. 거대한 간판 (1024x1024 픽셀) 을 보내고 싶다면, 동일한 번역기가 4,096개의 퍼즐 조각으로 분해합니다.

문제는 무엇일까요? AI 는 모든 조각을 하나씩 읽고 써야 합니다.

  • 작은 사진: 256 단계. 빠르고 저렴합니다.
  • 큰 사진: 4,096 단계. 느리고 비싸며, 컴퓨터가 지칩니다 (에너지 소비가 훨씬 더 많습니다).
  • 결과: 큰 사진을 만들려면 보통 작은 것을 늘리기 위한 별도의 무거운 '업스케일러' 기계가 필요하여 비용과 복잡성이 추가됩니다.

새로운 방식 (VibeToken):
이 논문의 저자이자 소니 AI 와 애리조나 주립대학교의 마이트레이야 파텔 (Maitreya Patel) 과 그의 팀은 VibeToken이라는 새로운 번역기를 발명했습니다.

VibeToken 을 조각별 번역기가 아닌 스마트 요약기로 생각하세요.

1. 마법 같은 'Vibe' 요약

AI 에게 작은 썸네일이나 거대한 4K 간판을 입력하든 상관없이, VibeToken 은 픽셀 수를 신경 쓰지 않습니다. 대신 이미지를 보고 "이 전체 그림을 64개의 단어 (또는 토큰) 로 설명할 수 있다"고 말합니다.

  • 비유: 영화 전체를 묘사한다고 상상해 보세요. 기존 방식은 모든 프레임을 읽는 것입니다. VibeToken 은 영화의 본질을 포착하는 완벽한 64 단어 줄거리 작성을 하는 것과 같습니다. 영화가 10 분이든 3 시간이든 상관없이 요약의 길이는 동일하게 유지됩니다.

2. '동적' 디코더

AI 가 그 64 개의 'Vibe 단어'를 얻으면, 이를 다시 이미지로 변환해야 합니다.

  • 기존 AI: 더 큰 이미지를 원하면 AI 는 더 많은 단어를 추측해야 하므로 시간이 더 걸립니다.
  • VibeToken: 동일한 64 단어를 가져와서 원하는 모양이나 크기에 맞게 늘릴 수 있는 특수한 디코더를 갖추고 있습니다. 정사각형, 넓은 직사각형, 혹은 높은 포스터를 요청하더라도 'Vibe'을 완벽하게 맞게 늘릴 수 있으며, 무언가를 다시 학습할 필요가 없습니다.

3. 이것이 큰 문제인 이유 ('효율성' 주장)

이 논문은 이 기술이 게임의 규칙을 두 가지 주요 방식으로 바꾼다고 주장합니다.

  • 일정한 에너지 비용: 기존 방식에서는 1024x1024 이미지를 만드는 데 약 11 조개의 컴퓨터 계산 (FLOPs) 이 필요합니다. VibeToken 을 사용하면 작은 이미지를 만드는 것과 동일한 양의 작업, 즉 1,790 억개의 계산만 필요합니다. 이는 63 배 더 효율적입니다.
    • 비유: 이는 상점까지 걸어가는 것 (기존 방식) 과 텔레포트 장치를 사용하는 것 (VibeToken) 의 차이와 같습니다. 거리 (해상도) 는 중요하지 않으며, 에너지 비용은 동일합니다.
  • 속도: 매우 효율적이기 때문에 VibeToken 은 고품질 1024x1024 이미지를 0.46 초 안에 생성할 수 있습니다. 최상위 경쟁자 (확산 모델) 는 동일한 작업을 1.08 초가 걸리며, 품질은 실제로 약간 더 낮습니다.

4. 그들이 어떻게 했는지 (비밀의 소스)

팀은 이미지 생성기 자체가 아니라 이미지를 조각으로 분해하는 '토크나이저'가 문제임을 깨달았습니다. 그들은 다음을 통해 이를 수정했습니다.

  • 동적 위치 지정: "픽셀 1 은 여기, 픽셀 2 는 저기"라고 말하는 대신, AI 에게 크기와 상관없이 이미지의 형태를 이해하도록 가르쳤습니다.
  • 가변 길이: 32 개에서 256 개 사이의 설명 '단어'에 편안하도록 AI 를 훈련시켜 사용자가 원하는 세부 사항의 양을 선택할 수 있게 했습니다.
  • 네이티브 초해상도: AI 가 'Vibe'을 매우 잘 이해하기 때문에 별도의 '업스케일러' 도구가 필요 없이 저해상도 이미지를 자연스럽게 고해상도로 변환할 수 있습니다.

결론

이 논문은 VibeToken-Gen을 소개합니다. 이는 AI 가 매번 동일한 양의 컴퓨터 성능을 사용하여 크기나 모양이 무엇이든 (작은 아이콘부터 거대한 포스터까지) 이미지를 생성할 수 있게 해주는 시스템입니다.

그들은 ImageNet 데이터셋 (방대한 사진 컬렉션) 에서 이를 테스트한 결과 다음과 같은 사실을 발견했습니다.

  1. 고품질 이미지를 생성합니다 (일부 현재 최상위 모델보다 더 좋습니다).
  2. 실행 속도가 매우 빠르고 비용이 저렴합니다.
  3. 새로운 해상도마다 재학습할 필요가 없으며, 그냥 작동합니다.

요약하자면, 그들은 사진의 크기와 상관없이 텍스트 메시지를 보내는 것처럼 고품질 이미지 생성을 쉽고 효율적으로 만드는 '해상도 무관' 엔진을 구축했습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →