← 최신 논문
🤖 machine learning

End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer

본 논문은 1 차원 의미 토크나이저와 자기회귀 생성 모델을 공동으로 최적화하는 엔드투엔드 학습 파이프라인을 제안하며, 이는 ImageNet 256x256 에서 FID 1.48 의 최첨단 이미지 생성 성능을 달성합니다.

원저자: Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

게시일 2026-05-04
📖 4 분 읽기☕ 가벼운 읽기

원저자: Wenda Chu, Bingliang Zhang, Jiaqi Han, Yizhuo Li, Linjie Yang, Yisong Yue, Qiushan Guo

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터에게 이야기를 들려주듯 단어를 하나씩 설명하며 그림을 그리게 한다고 상상해 보세요. 이를 **자기회귀 생성 (autoregressive generation)**이라고 합니다. 컴퓨터는 이전의 단어 (이 경우 시각적 조각) 를 바탕으로 다음 "단어"를 추측합니다.

하지만 컴퓨터가 보통 이 작업을 수행하는 방식에는 큰 문제가 있습니다.

문제: "그리드" 대 "이야기"

대부분의 이미지 생성 컴퓨터는 그림을 체스판과 같은 2 차원 그리드로 나눕니다. 그리고 책을 읽듯이 이 그리드를 행 (row) 단위로 읽으며 그림을 설명하려 합니다.

  • 문제점: 그리드에서는 오른쪽 위 모서리의 조각이 왼쪽 아래 모서리의 조각에 의존합니다. 하지만 이야기 (1 차원 목록) 에서는 시작을 말하기 전에 끝을 이야기할 수 없습니다. 이 불일치로 인해 컴퓨터가 혼란을 겪고 그림이 지저분하게 보입니다.

이전 시도들은 이를 해결하기 위해 다음 두 가지 방법 중 하나를 사용했습니다:

  1. 이야기 순서 변경: 컴퓨터에게 책을 거꾸로 읽거나 여기저기 뛰어다니는 것처럼 이상하고 무작위적인 순서로 그리드를 읽게 하는 것.
  2. 그리드 평탄화: 2 차원 이미지를 단일 긴 데이터 줄로 압축하는 것. 하지만 종종 이미지를 너무 심하게 압축하여 세부 정보가 손실되거나, 컴퓨터가 이를 잘 그리도록 학습하지 못했습니다.

해결책: EOSTok(종단 간 팀)

이 논문의 저자들은 EOSTok이라는 새로운 시스템을 개발했습니다. 이는 한 명이 다른 한 명을 훈련시키는 것이 아니라, 두 명의 작업자가 함께 학습하는 팀과 같습니다.

1. 두 명의 작업자

  • 작업자 A (토크나이저): 이는 "압축기"입니다. 고화질 사진을 가져와 "토큰" (비밀 코드와 같은) 의 짧은 1 차원 목록으로 압축합니다.
  • 작업자 B (생성기): 이는 "이야기꾼"입니다. 비밀 코드를 보고 이미지를 재현하기 위해 목록의 다음 토큰을 예측하려 합니다.

2. 구식 방법 (2 단계 실수)

과거에는 이 두 작업자가 별도로 훈련되었습니다:

  • 1 단계: 작업자 A 는 이미지를 완벽하게 압축하는 것만 훈련받습니다. 일단 훈련이 끝나면 고정 (잠금) 됩니다.
  • 2 단계: 작업자 B 는 토큰을 예측하도록 훈련받습니다.
  • 결함: 작업자 A 는 자신이 만든 토큰을 작업자 B 가 사용할 것이라는 사실을 알지 못했습니다. 따라서 작업자 A 는 저장 공간에는 훌륭하지만 다음 단계 예측에는 terrible 한 코드를 만들 수 있었습니다. 이는 마치 다음 번역가가 이해할 수 없는 언어로 책을 번역하는 것과 같습니다.

3. 새로운 방법 (종단 간 훈련)

EOSTok 은 두 작업자를 동시에 훈련시킵니다.

  • 피드백 루프: 작업자 B(이야기꾼) 가 실수를 하면, 그 오류 신호는 작업자 A 까지 전달됩니다. 작업자 A 는 "아, 내가 비밀 코드를 약간 변경해야 작업자 B 가 다음 부분을 더 쉽게 예측할 수 있구나"라고 학습합니다.
  • 결과: 그들은 함께 진화합니다. 작업자 A 는 단순히 좋은 압축이 아닌, 예측하기 쉬운 코드를 만들도록 학습합니다.

비밀 소스: 세 가지 비법

이를 완벽하게 작동시키기 위해 저자들은 세 가지 특별한 재료를 추가했습니다.

1. "픽셀 확인" (APR 손실)
보통 컴퓨터는 "다음 토큰" 예측이 맞는지만 확인합니다. 하지만 때로는 컴퓨터가 토큰 추측에는 매우 능숙해지지만, 최종적으로 흐릿하고 추악한 그림을 만들어냅니다.

  • 해결책: 시스템은 컴퓨터의 다음 토큰 추측을 가져와 다시 그림으로 변환한 후, 그 그림이 실제 이미지와 비슷한지 확인합니다. 이는 컴퓨터가 토큰 추측 게임뿐만 아니라 최종 이미지 품질에도 관심을 갖도록 강제합니다.

2. "스마트 교사" (비전 기반 모델)
저자들은 이미 사물이 어떻게 생겼는지 알고 있는 사전 훈련된 AI 인 "스마트 교사"를 데려왔습니다.

  • 함정: 1 차원 목록을 교사의 2 차원 지도와 정확히 일치하도록 강제하면, 1 차원 목록의 이점 (그리드화됨) 을 잃게 됩니다.
  • 해결책: 그들은 **"암시적 정렬 (Implicit Alignment)"**이라는 방법을 사용했습니다. 1 차원 목록이 교사의 지도를 복사하도록 강제하는 대신, 시스템 내부의 숨겨진 이해가 교사의 지식과 일치하도록 했습니다. 이는 학생이 교사의 필적을 복사하도록 강요하는 대신 개념을 배우게 하는 것과 같습니다. 이렇게 하면 1 차원 흐름은 매끄럽게 유지되면서 내용은 훨씬 더 지능적으로 변합니다.

3. "코드북" 균형
시스템은 시각적 토큰의 사전 (코드북) 을 사용합니다.

  • 사전이 너무 작으면 그림이 블록처럼 보입니다.
  • 사전이 너무 크면 컴퓨터가 올바른 단어를 고르려고 혼란을 겪습니다.
  • 저자들은 컴퓨터를 더 크게 (더 강력하게) 만들면 혼란 없이 더 큰 사전도 처리할 수 있음을 발견하여, 세부 사항과 예측 가능성 사이의 트레이드오프를 해결했습니다.

결과

이 논문은 이 새로운 방법이 큰 성공이라고 주장합니다.

  • 표준 테스트 (ImageNet 256x256) 에서 그들의 모델은 1.48 점수를 달성했습니다 (낮을수록 좋습니다).
  • 이는 최첨단 (State-of-the-Art) 결과로, 추가적인 안내 기법 없이 이 특정 유형의 이미지 생성 분야에서 현재 세계 최고 수준임을 의미합니다.
  • 모델은 커질수록 (확대될수록) 더 잘 작동하여 시스템이 견고함을 입증했습니다.

간단히 말해: EOSTok 은 "압축기"와 "예측기"가 함께 학습하고, 실제 픽셀과 작업을 점검하며, 경직된 그리드에 강요하지 않고 스마트 교사의 안내를 받아 컴퓨터에게 그림을 그리는 새로운 방법입니다. 그 결과, 컴퓨터는 퍼즐의 다음 조각을 단순히 예측함으로써 놀랍도록 사실적인 이미지를 생성할 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →