← 최신 논문
💻 computer science

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

MergeTok은 토큰 병합을 활용하여 구조적 사전 확률(structural prior)을 구축함으로써 연속적 VAE와 이산적 VQ 모델 사이를 연결하는 통합된 시각적 토크나이저를 도입하며, 이를 통해 확산 및 자기회귀 이미지 생성 모두에 적합한 고충실도 재구성, 안정적인 학습, 그리고 의미론적으로 조직된 표현을 달성합니다.

원저자: Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

게시일 2026-06-01
📖 3 분 읽기☕ 가벼운 읽기

원저자: Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇에게 그림 그리는 법을 가르치려 한다고 상상해 보세요. 이를 위해 로봇은 이미지가 무엇으로 구성되어 있는지 이해할 수 있는 '사전'이 필요합니다. AI 이미지 생성의 세계에서 이 사전은 **토크나이저(tokenizer)**라고 불립니다.

오랫동안 연구자들은 매우 다른 두 가지 유형의 사전 중 하나를 선택해야 했으며, 둘 다 완벽하지는 않았습니다:

  1. "매끄러운" 사전 (연속형/VAE): 이것은 수채화 그림과 같습니다. 믿기지 않을 정도로 세밀하고 매끄러우며, 이미지의 모든 미세한 뉘앙스를 포착합니다. 하지만 색상들이 커다란 물웅덩이처럼 모두 뒤섞여 있습니다. 만약 로봇이 '풀'을 망치지 않고 '하늘'만 바꾸고 싶다면, 정보가 모두 엉켜 있기 때문에 매우 어렵습니다.
  2. "블록형" 사전 (이산형/VQ): 이것은 레고 세트와 같습니다. 이미지를 별개의 뚜렷한 블록(코드)으로 나눕니다. 이는 로봇이 패턴을 학습하고 단계별로 무언가를 구축하는 데(마치 이야기를 쓰는 것처럼) 매우 유용합니다. 하지만 블록들이 불안정할 수 있습니다. 때때로 로봇은 특정 블록을 사용하는 법을 잊어버리거나, 블록들이 뭉쳐서 이미지가 흐릿해지거나 "붕괴(collapsed)"된 것처럼 보이게 만들기도 합니다.

핵심 아이디어: MergeTok

이 논문의 저자들인 MergeTok은 다음과 같이 질문했습니다: "왜 우리는 같은 사전에 수채화의 매끄러움과 레고의 구조를 동시에 가질 수 없을까?"

그들은 "매끄러운" 언어와 "블록형" 언어를 동시에 구사하는 이중 언어 통역사처럼 작동하는 새로운 시스템을 구축했습니다. 그들은 단순히 두 시스템을 붙여 붙인 것이 아니라, **토큰 병합(Token Merging)**이라는 영리한 기술을 사용하여 그들 사이에 다리를 놓았습니다.

작동 원리: "그룹화" 비유

당신이 1,000명의 손님(이미지의 픽셀)이 있는 거대한 파티를 조직하고 있다고 상상해 보세요.

  • 문제점: 만약 당신이 모든 손님에게 개별적으로 말을 걸려고 한다면, 그것은 혼란스럽고 비효율적일 것입니다. 만약 무작위로 그룹을 묶는다면, 중요한 세부 사항을 놓치게 될 것입니다.
  • MergeTok의 해결책: 시스템에는 스마트한 보안 요원(토크너 병합 알고리즘)이 있어 손님들을 살피며 말합니다. "당신 셋은 모두 빨간 셔츠를 입고 스포츠에 대해 이야기하고 있군요. 이들을 하나의 '스포츠 팀' 단위로 묶겠습니다."

이 그룹화는 로봇이 학습을 돕기 위해 두 가지 방식으로 일어납니다:

  1. 매끄러운 측면을 위해 (VAE): 시스템은 수채화 화가에게 이렇게 말합니다. "이봐요, 이 세 사람은 '스포츠 팀'입니다. 이들을 그릴 때, 단순히 무작위적인 빨간 덩어리가 아니라 하나의 응집력 있는 팀처럼 보이도록 하세요." 이는 매끄러운 그림이 논리적으로 조직되도록 강제하며, 나중에 제어하기 더 쉽게 만듭니다.
  2. 블록형 측면을 위해 (VQ): 시스템은 레고 빌더에게 이렇게 말합니다. "우리는 이 세 사람이 한 팀이라는 것을 알고 있으므로, 그들이 모두 똑같아 보이지 않도록 세 개의 서로 다른 레고 브릭을 주되, 다른 팀이 그 특정 브릭들을 가져가지 않도록 하세요." 이는 레고 블록이 붕괴하거나 너무 많이 반복되는 것을 방지합니다.

마법의 다리

비결은 한 번 생성되어 공유되는 "스포츠 팀" 목록(소스 맵/Source Map)에 있습니다.

  • 이것은 매끄러운 측면이 조직화되도록 돕습니다.
  • 이것은 블록형 측면이 안정적이고 다양해지도록 돕습니다.

가장 좋은 점은, 실제로 그림을 그리는 로봇(생성기)은 이 그룹화가 일어났다는 사실조차 모른다는 것입니다. 로봇은 그저 사용될 준비가 된 깔끔한 256개의 토큰 목록을 볼 뿐입니다. 마치 보안 요원이 배후에서 모든 힘든 일을 다 해두어서, 예술가는 오직 그림 그리는 데만 집중할 수 있는 것과 같습니다.

연구 결과

연구진은 이 시스템을 거대한 이미지 데이터셋(ImageNet)에 대해 테스트했습니다. 결과는 다음과 같았습니다:

  • 더 나은 그림: 이 시스템은 이전의 최고 수준인 "매끄러운" 또는 "블록형" 시스템 단독 모델보다 더 높은 품질(더 낮은 "rFID" 점수)로 이미지를 재구성했습니다.
  • 더 똑똑한 조직화: 이 시스템이 생성한 토큰은 기존 방식에 비해 이미지의 의미(예: 고양이와 강아지를 구별하는 것)를 이해하는 능력이 훨씬 뛰어났습니다.
  • 다재다능함: 통합된 시스템이기 때문에, 이미지를 단계별로 구축하는 AI 예술가(자기회귀/Autoregressive 방식)와 노이즈를 제거하며 이미지를 구축하는 AI 예술가(확산/Diffusion 방식) 모두와 완벽하게 작동합니다.

요약

MergeTok은 혼란스러운 군중을 논리적으로 그룹화하여 예술가에게 전달하는 숙련된 조직가와 같습니다. 이는 "매끄럽지만 엉망인 것"과 "구조적이지만 불안정한 것" 사이에서 하나를 선택해야 했던 오래된 문제를 해결합니다. 학습 과정에서 유사한 정보들을 함께 병합함으로써, 고품질이면서도 AI가 제어하기 쉬운 하나의 초효율적인 사전을 만들어냅니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →