← 최신 논문
💻 computer science

Vision Foundation Models as Generalist Tokenizers for Image Generation

본 논문은 분류기 없는 안내 없이 최첨단 생성 품질과 효율성을 달성하기 위해 영역 적응 양자화와 의미론적 재구성을 활용하는 고정된 비전 기초 모델 위에 구축된 범용 이미지 토크나이저인 VFMTok을 소개합니다.

원저자: Anlin Zheng, Qi Han, Xin Wen, Chuofan Ma, Lanxi Gong, Gang Yu, Xiangyu Zhang, Xiaojuan Qi

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Anlin Zheng, Qi Han, Xin Wen, Chuofan Ma, Lanxi Gong, Gang Yu, Xiangyu Zhang, Xiaojuan Qi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고해상도 수정구 사진을 친구에게 보내려는데 인터넷 연결이 매우 느리다고 상상해 보세요. 유리의 디테일이나 돌 위에 자란 이끼의 모습은 잃지 않은 채 이미지를 아주 작은 파일로 압축해야 합니다.

전통적으로 컴퓨터는 이미지를 픽셀화된 모자이크처럼 딱딱한 작은 사각형의 격자로 잘게 나누어 각 사각형을 하나씩 설명함으로써 이를 수행합니다. 이는 많은 사각형이 (예: 매끄러운 유리처럼) 정확히 동일하게 보이기 때문에 비효율적이며, 결국 많은 중복 데이터를 전송하게 됩니다.

이 논문은 VFMTok이라는 새로운 지능형 압축 방식을 소개합니다. 간단한 비유를 통해 그 작동 원리를 설명하겠습니다:

1. "동결된 전문가" (비전 기반 모델)

일반적으로 이미지를 압축하려면 고양이 나 수정구가 무엇인지 가르치는 새로운 "압축기"를 처음부터 훈련시켜야 합니다. 이는 시간이 많이 걸리며, 종종 픽셀을 그리는 데는 능숙하지만 무엇인지 이해하는 데는 서툰 압축기를 만들어냅니다.

저자들은 이 훈련 단계를 건너뛸 수 있음을 깨달았습니다. 대신 DINOv2 나 CLIP 과 같은 사전 훈련된 비전 기반 모델을 **"동결된 전문가"**로 활용했습니다. 이 전문가를 수백만 장의 이미지를 이미 본 베테랑 미술 비평가로 생각하세요. 그들은 수정구가 무엇인지, 빛이 어떻게 굴절되는지, 이끼가 어떤 질감인지 정확히 알고 있습니다.

  • 혁신: 그들은 이 전문가를 다시 훈련시키지 않았습니다. 단순히 그들의 지식을 "동결"시켜 이미지 압축의 출발점으로 사용했을 뿐입니다. 전문가가 이미 이미지의 의미를 이해하고 있기 때문에 압축된 파일은 훨씬 더 지능적입니다.

2. "지능형 샘플러" (영역 적응형 양자화)

이미지를 압축하는 구식 방법은 주제가 둥근 공임에도 불구하고 사진을 10x10 의 딱딱한 격자에 강제로 넣는 것과 같습니다. 빈 구석을 설명하는 데 공간을 낭비합니다.

VFMTok 은 영역 적응형 전략을 사용합니다. 딱딱한 격자 대신 늘어나고 줄어들 수 있는 유연한 그물을 가지고 있다고 상상해 보세요.

  • 작동 방식: 이미지에 매끄러운 영역 (예: 유리) 이 있다면 그물은 큰 걸음을 내디디며 전체 영역을 하나의 토큰으로 설명합니다. 이미지에 복잡한 영역 (예: 이끼) 이 있다면 그물은 확대하여 디테일을 포착하기 위해 많은 작은 걸음을 밟습니다.
  • 결과: 지루하고 반복적인 부분을 무시하고 흥미롭고 독특한 부분에만 집중합니다. 이는 품질을 잃지 않으면서 토큰 수를 절반으로 줄여(576 개 대신 256 개) 전체 이미지를 설명할 수 있음을 의미합니다.

3. "이중 확인" 시스템 (의미론적 재구성)

이미지를 압축할 때 보통 "재구성된 이미지가 원본 사진과 비슷해 보이는가?"라고만 확인합니다.
VFMTok 은 두 번째 확인을 추가합니다: "압축된 파일이 여전히 사물이 무엇인지 이해하고 있는가?"

  • 비유: 편지를 보내는 것과 같습니다. 구식 방법은 필기가 읽히는지 확인합니다. VFMTok 은 필기가 읽히는지 그리고 그 안에 담긴 이야기가 전문가 비평가에게 여전히 의미가 있는지 확인합니다.
  • 이익: 압축된 파일이 이러한 깊은 이해를 유지하기 때문에, 나중에 이미지를 생성하는 컴퓨터는 올바른 결과를 얻기 위해 추측하거나 비싼 "가이드" 트릭을 사용할 필요가 없습니다. 그냥 무엇을 해야 할지 알기 때문입니다.

4. 결과: 더 빠르고 더 우수함

압축된 파일이 더 작고 (토큰이 적음) 더 지능적 (의미로 가득 참) 이기 때문에 결과는 인상적입니다:

  • 속도: 컴퓨터가 조립해야 할 조각이 적기 때문에 이미지 생성 속도가 3 배 빨라졌습니다.
  • 품질: 이미지가 더 선명하고 정확합니다. 표준 테스트 (ImageNet) 에서 1.36의 점수 (gFID) 를 기록하여 새로운 기록 (State-of-the-Art) 을 세웠습니다.
  • "훈련 바퀴" 불필요: 대부분의 이미지 생성기는 이미지가 설명과 일치하도록 하기 위해 무거운 "가이드"(Classifier-Free Guidance) 가 필요합니다. VFMTok 은 너무 지능적이어서 이 가이드가 필요 없습니다. 자체적으로 고품질 이미지를 생성하여 시간을 더 절약합니다.

5. 비결: 전문가를 훈련시키는 방법

저자들은 왜 일부 "동결된 전문가"가 다른 것들보다 더 잘 작동하는지 조사했습니다. 그들은 최고의 전문가들은 특정 조합의 교훈으로 훈련된 것들임을 발견했습니다:

  1. 대조적 학습 (Contrastive Learning): 고양이와 개를 구분하는 것처럼 유사한 것들을 구별하는 법을 배우는 것.
  2. 잠재적 마스크 이미지 모델링 (Latent Masked Image Modeling): 주변 맥락을 기반으로 숨겨진 부분을 추측하여 그림의 빈칸을 채우는 법을 배우는 것.

전문가가 이 두 가지 교훈으로 훈련될 때, 이미지를 생성하기 위한 완벽한 "토크나이저"가 됩니다.

요약

요약하자면, 이 논문은 처음부터 새로운 이미지 압축기를 구축할 필요가 없음을 보여줍니다. 사전 훈련된 AI 전문가를 가져와 유연한 "지능형 그물"로 이미지를 효율적으로 샘플링하고 품질을 보장하기 위해 "의미 확인"을 추가할 수 있습니다. 이는 더 적은 데이터로, 추가 가이드 없이, 더 빠르게 고품질 이미지를 생성하는 시스템을 만듭니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →