A More Word-like Image Tokenization for MLLMs
본 논문은 이미지 패치 임베딩을 일관된 의미 단위로 클러스터링하고 이미지 복잡도에 따라 토큰 할당량을 동적으로 조정하여 멀티모달 대규모 언어 모델이 시각적 입력을 처리할 때 메모리 및 지연 비용이 크게 절감된 상태에서 더 효율적이고 호환되게 작동할 수 있도록 하는 새로운 방법인 디센탱글드 비주얼 토크나이제이션 (DiVT) 을 제안한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
상상해 보세요. 매우 똑똑하지만 매우 문자 그대로 해석하는 로봇(대형 언어 모델)에게 그림을 "보는" 법을 가르치려 한다고요. 현재 우리가 이렇게 하는 방식은 조금 어색합니다.
문제: "격자" 대 "이야기"
표준 디지털 사진을 작은 사각형(픽셀)들의 거대한 격자로 생각하세요. 현재 우리가 로봇에게 사진을 입력할 때, 이미지를 고정된 크기의 사각형들(체스판과 같은)로 자른 뒤, 로봇에게 이러한 사각형들의 길고 지루한 목록을 건네줍니다.
- 로봇의 관점: 로봇은 단어를 읽는 데 익숙합니다. 단어는 "고양이", "달리다", "파란색"과 같이 구별되고 의미 있는 단위입니다.
- 현재 방법: 로봇은 비어 있는 하늘이거나 같은 벽의 일부인 사각형들조차 "사각형 -1", "사각형 -2", "사각형 -3"과 같은 길고 반복적인 목록을 읽도록 강요받습니다.
- 결과: 로봇은 중복되고 혼란스러운 데이터의 홍수에 압도됩니다. 이는 "빨간 장미"라고 말하는 대신 프레임 안의 모든 벽돌의 색상을 나열하여 아름다운 그림을 설명하려는 것과 같습니다. 이는 로봇의 메모리를 낭비하고 속도를 느리게 만듭니다.
해결책: DiVT(분리된 시각 토큰화)
이 논문의 저자들은 DiVT라는 새로운 방법을 제안합니다. 이미지를 경직된 격자로 자르는 대신, DiVT는 그림을 보고 "자, 여기서 실제 중요한 것들은 무엇인가?"라고 말하는 똑똑한 편집자처럼 작동합니다.
다음은 간단한 비유를 통해 그 작동 원리를 설명한 것입니다:
1. "그룹화" 게임 (클러스터링)
산만한 방에 흩어진 장난감들이 가득하다고 상상해 보세요.
- 오래된 방법: 레고, 인형, 양말인지 여부와 상관없이 모든 장난감을 하나씩 집어 상자 안에 넣습니다. 결국 500 개의 작은 상자를 얻게 됩니다.
- DiVT 방법: 장난감들을 보고 그들이 무엇인지에 따라 그룹화합니다. 모든 레고를 한 더미에, 모든 인형을 다른 더미에, 양말을 세 번째 더미에 넣습니다. 각 구별된 그룹에 대해서만 하나의 "토큰"(상자) 을 생성합니다.
- 방이 비어 있다면 몇 개의 상자만 만듭니다.
- 방이 복잡한 장난감으로 가득 차 있다면 더 많은 상자를 만듭니다.
- 마법: 상자의 수는 방이 얼마나 "바쁜지"에 따라 자동으로 조정됩니다.
2. "스마트 요약" (토큰 구성)
그룹이 만들어지면 DiVT 는 단순히 장난감을 상자에 버려두지 않습니다. 각 그룹에 대해 단일하고 완벽한 요약을 생성합니다.
- 로봇에게 "고양이 털"의 500 개 패치를 보내는 대신, "고양이"라고 말하는 하나의 토큰을 보냅니다.
- "파란 하늘"의 100 개 패치를 보내는 대신, "하늘"이라고 말하는 하나의 토큰을 보냅니다.
- 결정적으로, 작은 새와 같은 작고 독특한 세부 사항은 별도의 토큰으로 유지하여 중요한 것이 손실되지 않도록 합니다.
3. "볼륨 조절기" (세분성 제어)
연구자들은 요약의 세부 사항을 얼마나 원할지 결정할 수 있는 특별한 조절기(임계값이라고 함) 를 추가했습니다.
- 올려라: 매우 세부적인 설명(많은 작은 그룹) 을 얻습니다. 이는 복잡한 이미지에 좋지만 더 많은 메모리를 사용합니다.
- 내려라: 광범위한 요약(더 적고 더 큰 그룹) 을 얻습니다. 이는 매우 빠르고 메모리를 절약합니다.
- 가장 좋은 점: 이 조절기는 로봇이 이미 훈련된 후에 조절할 수 있습니다. 로봇을 다시 가르칠 필요가 없습니다. 필요에 따라 설정만 변경하면 됩니다.
왜 이것이 중요한가 (결과)
이 논문은 그림에 대한 질문 답변부터 장면 설명까지 다양한 작업에서 이 새로운 방법을 테스트했습니다.
- 속도와 효율성: DiVT 는 기존 방법보다 훨씬 적은 수의 토큰을 사용하면서도 기존 방법과 동일하거나 더 나은 결과를 달성했습니다. 일부 테스트에서는 기존 방법이 필요로 했던 데이터의 1/10 미만을 사용했습니다.
- 덜 혼란스러움: 토큰이 무작위 격자 사각형이 아니라 "컵"이나 "나무"와 같은 실제 개념을 나타내기 때문에 로봇이 이미지를 훨씬 더 잘 이해합니다.
- 재훈련 불필요: 이 방법은 전체 시스템을 다시 구축할 필요 없이 다양한 유형의 카메라(비전 인코더) 와 다양한 로봇 두뇌(LLM) 와 함께 사용할 수 있습니다.
결론
이 논문은 이미지를 격자 사각형(경직된 격자) 이 아니라 이야기(의미 있는 개념의 그룹화) 처럼 취급함으로써 AI 비전을 더 빠르고, 저렴하며, 똑똑하게 만들 수 있다고 주장합니다. 이는 책을 글자별로 읽는 것에서 단어별로 읽는 것으로 전환하는 것과 같습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.