← 최신 논문
💻 computer science

WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

WinTok 는 사전 훈련된 기반 모델에서 추출한 학습 가능한 의미 토큰과 픽셀 토큰을 결합하여 이해와 생성을 분리하는 하이브리드 시각 토크나이저로, 기존 통합 접근법보다 훨씬 적은 학습 데이터로 두 작업 모두에서 뛰어난 성능을 달성합니다.

원저자: Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang

게시일 2026-05-19
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

한 번에 두 가지 매우 다른 일을 하도록 로봇을 가르치려 한다고 상상해 보세요: 그림을 말로 설명하는 것 (이해) 과 그 그림을 처음부터 다시 그리는 것 (생성).

문제는 이 두 가지 일이 서로 다른 "언어"를 필요로 한다는 점입니다.

  • 그림을 설명하려면 로봇은 고수준의 추상적 개념 (예: "슬픈 개"나 "화창한 해변") 이 필요합니다. 모든 단일 픽셀의 정확한 색상을 알 필요는 없습니다.
  • 그림을 다시 그리려면 로봇은 저수준의 정밀한 세부 사항 (예: 하늘의 정확한 푸른 색조나 털의 질감) 이 필요합니다. 개가 "슬픈지"는 상관없고 픽셀만 중요할 뿐입니다.

옛날 방식: "모든 일을 하지만 하나도 잘하지 못하는" 접근법
이전 시도들은 로봇이 두 가지 일을 모두 수행하도록 단일 세트의 "토큰"(디지털 구성 블록) 을 사용하도록 강요했습니다. 이는 요리사에게 같은 칼로 야채를 다듬는 일과 섬세한 수술을 모두 하라고 요구하는 것과 같습니다. 그 결과는 타협이었습니다: 로봇은 설명도 그리는 것도 보통 수준이 되었지만, 어느 하나도 뛰어나지는 않았습니다.

새로운 해결책: WinTok("전문가 팀" 접근법)
이 논문은 로봇이 서로 협력하지만 분리되어 유지되는 두 가지 다른 도구 세트를 제공함으로써 이 문제를 해결하는 새로운 시스템인 WinTok을 소개합니다. 두 개의 전문 팀을 갖춘 건설 부대로 생각하세요:

  1. 픽셀 팀 (예술가들): 이 팀은 "픽셀 토큰"을 처리합니다. 그들은 미세한 세부 사항, 질감, 색상에 전적으로 집중하는 화가 팀과 같습니다. 그들의 유일한 임무는 최종 이미지가 원본과 정확히 일치하도록 하는 것입니다. 그들은 생성에 뛰어납니다.
  2. 의미 팀 (철학자들): 이 팀은 "학습 가능한 토큰"을 처리합니다. 그들은 전체 그림을 보고 주요 아이디어 ("개다", "행복하다") 를 요약하는 미술 비평가 팀과 같습니다. 그들은 붓질에 신경 쓰지 않고 의미만 포착합니다. 그들은 이해에 뛰어납니다.

그들이 어떻게 협력하는지: "비대칭 증류"
여기가 교묘한 부분입니다: "철학자들"(의미 팀) 을 처음부터 몇 년 동안 훈련시키지 않고도 얼마나 똑똑하게 만들 수 있을까요?

저자들은 비대칭 토큰 증류라는 기법을 사용합니다. 유명하고 세계적 수준의 미술 비평가 (사전 훈련된 "기반 모델") 가 그림을 보고 로봇의 의미 팀에게 그림의 "본질"을 속삭이는 상황을 상상해 보세요. 로봇 팀은 듣고 배우며 그 전문가의 이해를 모방하려고 노력합니다.

  • 반전: 그 전문가는 "예술가들"(픽셀 팀) 에게 새로운 것을 가르치지 않습니다. 그들은 자신이 잘하는 일 (세부 사항 그리기) 만 계속합니다.
  • 결과: 의미 팀은 전문가로부터 배웠기 때문에 의미의 대가가 되고, 픽셀 팀은 세부 사항의 대가로 남습니다. 그들은 서로 방해하지 않고 나란히 일합니다.

결과: 윈 - 윈
두 팀이 명확하고 분리된 역할을 가지기 때문에 로봇은 타협할 필요가 없습니다.

  • 이해를 위해: "이 사진에 누가 있나요?"나 "분위기는 어떤가요?"와 같은 질문에 답하기 위해 의미 팀의 요약을 사용합니다. 이전 최고의 시스템보다 분류 정확도가 11.2% 향상되었습니다.
  • 생성을 위해: 이미지를 다시 그리기 위해 픽셀 팀의 세부 사항을 사용합니다. 재구성 품질은 최고의 시스템과 똑같이 좋았지만, 훨씬 적은 학습 데이터(10 억 개 대신 5 천만 개 이미지) 로 달성했습니다.

한 줄 요약
WinTok 은 모든 일을 한 명의 요리사가 하려고 했던 식당이 멈춘 것과 같습니다. 대신, 다듬기와 접시 차리기에 뛰어난 수석 요리사(생성) 와 맛과 재료를 설명하는 데 뛰어난 음식 비평가(이해) 를 고용했습니다. 그들이 가장 잘하는 일을 하도록 함으로써, 이 식당은 더 적은 재료 (데이터) 를 사용하면서도 더 좋은 음식 (이미지) 을 제공하고 더 좋은 리뷰 (설명) 를 작성합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →