← 최신 논문
🤖 AI

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

이 논문은 데이터 독립적인 교차 길이 표현 정렬을 가능하게 하는 학습 가능한 글로벌 병합(global merging)을 채택함으로써, 기존의 절단 기반 방식에 내재된 의미론적 불일치 문제를 극복하고 디퓨전 트랜스포머(Diffusion Transformers)를 위한 우수한 품질-연산 효율성 트레이드오프를 달성하는 새로운 가변 길이 토크나이저를 소개한다.

원저자: Dong Hoon Lee, Seunghoon Hong

게시일 2026-06-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Dong Hoon Lee, Seunghoon Hong

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

고화질 영화를 친구에게 보내려고 한다고 상상해 보세요. 압축하지 않은 상태 그대로 보내면 다운로드하는 데 시간이 너무 오래 걸리고 엄청난 양의 데이터를 사용하게 됩니다. 그렇다고 너무 많이 압축하면 화면이 흐릿하고 픽셀이 깨져 보입니다.

오랫동안 AI 이미지 생성기(텍로 이미지를 만드는 것과 같은)는 정확히 이 문제에 직면해 있었습니다. 이들은 이미지를 **토큰(token)**이라고 불리는 작은 조각들로 분해하는 번역기인 '토크나이저(tokenizer)'를 사용합니다.

  • 높은 압축률 (적은 수의 토큰) = 빠르고 저렴하지만, 이미지 품질이 떨어짐.
  • 낮은 압축률 (많은 수의 토큰) = 품질은 훌륭하지만, 느리고 비용이 많이 듦.

이전에는 속도와 품질 사이의 다른 균형을 맞추고 싶다면, 각 설정에 맞는 완전히 다른 AI 모델을 새로 학습시켜야 했습니다. 이는 마치 시속 10km로 더 천천히 달리기 위해 자동차 엔진 자체를 통째로 바꿔야 하는 것과 같았습니다.

"자르기(Cutting)"의 문제점

일부 연구자들은 '가변 길이(variable-length)' 토크나이저를 만들어 이 문제를 해결하려고 시도했습니다. 그들의 아이디어는 간단했습니다. "공간을 아끼고 싶다면 토큰 목록의 끝부분을 그냥 잘라버리자."

이것은 마치 중요한 줄거리는 1페이지에 있고 아주 세부적인 내용은 100페이지에 있는 책과 같습니다. 만약 짧은 버전을 원한다면, 마지막 50페이지만 찢어내면 됩니다.

  • 함정: 하지만 이렇게 하면 이야기가 바뀝니다. "짧은" 버전은 큰 그림에만 집중하는 반면, "긴" 버전은 아주 세밀한 디테일까지 포함합니다. 내용 자체가 완전히 달라지기 때문에 AI는 혼란에 빠집니다. 이는 학생에게 짧은 단편 소설과 긴 장편 소설을 가르치려는데, 사용하는 교과서의 챕터가 서로 완전히 다른 것과 같습니다. AI는 두 가지를 동시에 배우는 데 어려움을 겪으며, 결과적으로 이미지가 흐릿하거나 이상하게 나옵니다.

해결책: "자르기" 대신 "병합하기(Merging)"

이 논문의 저자들은 자르는 대신 병합하는 더 똑똑한 방법을 제안합니다.

100명의 사람(토큰)이 줄을 서 있다고 상상해 보세요.

  • 기존 방식 (자르기): 인원이 적게 필요하다면, 그냥 마지막 50명에게 집에 가라고 말하는 것입니다. 남은 50명은 여전히 정확히 같은 자리에 서 있습니다.
  • 새로운 방식 (병합하기): 인원이 적게 필요하다면, 비슷하게 생긴 사람들에게 서로 모여서 하나의 "슈퍼 인물"을 형성하라고 요청하는 것입니다. 빨간 셔츠를 입은 두 사람이 있다면, 그들은 그 그룹을 대표하는 한 명으로 합쳐집니다.

왜 이것이 더 나은가요?

  1. 일관성: 100명이 있든 10명의 "슈퍼 인물"이 있든, 그 그룹들은 동일한 근본 구조를 나타냅니다. "빨간 셔츠 그룹"은 여전히 존재하며, 다만 응축되었을 뿐입니다. 이 덕분에 토큰을 얼마나 사용하든 상관없이 AI를 위한 "이야기"가 일관되게 유지됩니다.
  2. 정렬(Alignment): 그룹이 단순히 위치가 아닌 유사성을 바탕으로 형성되기 때문에, AI는 긴 목록과 짧은 목록 모두에서 완벽하게 작동하는 단일 모델을 학습할 수 있습니다.

핵심 비결: "학습 가능한 전역 병합(Learnable Global Merging)"

여기에는 한 가지 큰 장애물이 있었습니다. 보통 누구와 누가 병합할지 결정하려면 특정 이미지를 살펴봐야 합니다 (예: "이 두 픽셀은 고양이 귀처럼 생겼으니, 이들을 병합하자"). 하지만 AI가 무에서 유를 창조하며 새로운 이미지를 생성하고 있을 때는, 아직 이미지를 가지고 있지 않습니다! 이미지를 보고 어떻게 병합할지 결정할 수 없는 것이죠.

저자들은 학습 가능한 전역 병합으로 이 문제를 해결했습니다.
이것을 미리 정해진 규칙이나 "마스터 플랜"이라고 생각하세요. AI가 이미지를 보고 병합 여부를 결정하는 대신, 고정된 학습 패턴(예: "토큰 1은 항상 토큰 2와 병합한다, 토큰 3은 토큰 4와 병합한다")을 사용하여 최종 이미지가 무엇인지와 관계없이 작동하도록 합니다.

이 규칙책은 고정되어 있지만(이미지에 따라 변하지 않음), AI는 훈련 과정에서 이를 매우 잘 학습하여 자연스럽게 유사한 것들을 그룹화하게 됩니다. 이를 통해 AI는 이미지를 생성하기 전부터 "병합된" 토큰들을 어떻게 다뤄야 할지 정확히 알 수 있게 됩니다.

결과

연구진은 ImageNet(방대한 이미지 데이터베이스)에서 이 방법을 테스트했습니다. 그 결과는 다음과 같습니다:

  • 이 방법은 단일 AI 모델이 재학습 없이도 다양한 속도와 품질로 이미지를 생성할 수 있게 해줍니다.
  • 단순히 토큰을 "자르는" 기존 방식보다 이미지가 더 뛰어나며 수학적으로도 더 효율적입니다.
  • 또한, 아주 작은 "미세 조정(fine-tuning)" 단계(LoRA라는 기술 사용)를 추가하여, 추가 비용 거의 없이 특정 토큰 수에 대해 AI를 더욱 정교하게 만들 수 있었습니다.

요약하자면: 그들은 AI 이미지 생성기를 유연하게 만드는 방법을 찾아냈습니다. "빠른" 모델과 "좋은" 모델 중 하나를 강제로 선택하게 하는 대신, 유사한 부분을 지능적으로 그룹화하여 이미지 데이터를 줄이거나 늘릴 수 있는 하나의 똑똑한 번역기를 구축했습니다. 이를 통해 품질은 높게 유지하면서 비용은 낮출 수 있게 되었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →