Unified Pix Token And Word Token Generative Language Model
본 논문은 현재 ViT 기반 시각 인코더가 정밀한 시각적 세부 사항을 인식하는 데 있어 겪는 한계를 극복하기 위해 색상 접기와 전역 조건부 주의를 같은 특정 아키텍처 혁신을 통해 픽셀 및 단어 토큰을 통합하는 새로운 생성 언어 모델을 제안하며, 이는 작은 모델과 제한된 데이터로도 강력한 성능을 입증합니다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
컴퓨터가 동시에 "보고" "말하는" 법을 가르치려 한다고 상상해 보세요. 현재 최고의 컴퓨터들은 그림을 보기 위해 ViT(Vision Transformer)라는 방법을 사용합니다. 이 논문의 저자들은 이 현재 방식이 흐릿하게 요약된 스케치만 보고 복잡한 그림을 설명하려는 것과 같다고 주장합니다. 이는 자동차의 번호판 번호나 표지판의 작은 글자 같은 미세한 세부 사항을 놓치게 만듭니다.
다음은 일상적인 비유를 사용하여 그들의 새로운 아이디어인 통합 픽셀 토큰과 단어 토큰 모델을 간단히 설명한 것입니다.
1. 문제: "흐릿한 스케치" 대 "픽셀 단위" 현실
**현재 방식 **(ViT/CLIP)
100 만 개의 작은 타일로 이루어진 거대한 모osa이크가 있다고 상상해 보세요. 현재의 AI 는 모든 타일을 하나하나 보지 않습니다. 대신 타일들을 큰 덩어리 (패치) 로 묶고 "이 전체 덩어리는 어떻게 생겼나요?"라고 묻습니다. 그리고 그 덩어리를 하나의 "단어"나 요약으로 변환합니다.
- 결함: 만약 작은 타일 하나만 변경된다면 (예: 자동차 번호판 번호를 1 에서 6 으로), 전체 덩어리의 요약이 완전히 바뀝니다. 마치 문장 속 한 글자만 바꾸었는데 AI 가 전체 단락이 완전히 다른 의미를 가진다고 생각한 것과 같습니다. 이로 인해 미세한 세부 사항을 포착하는 데는 매우 취약합니다.
**새로운 방식 **(Pix Token)
저자들은 말합니다. "요약하는 것을 멈추자. 이미지 속 가장 작은 색 점인 모든 픽셀에 고유한 이름표와 사전 항목을 부여하자."
- 비유: 타일들을 덩어리로 묶는 대신, 모사이크의 모든 단일 타일에 고유한 신분증을 부여합니다. 타일 하나가 바뀌어도 그 신분증 하나만 바뀝니다. 그림의 나머지는 정확히 그대로 유지됩니다. 이로 인해 AI 는 미세한 세부 사항에 훨씬 더 민감해집니다.
2. 과제: 기억해야 할 이름이 너무 많음
문제:
모든 픽셀에 고유한 이름을 부여하고, 픽셀이 1,670 만 가지 색 중 하나일 수 있다면, 불가능할 정도로 거대한 사전이 만들어집니다. 모든 색을 찾아보는 데는 컴퓨터 성능이 너무 많이 소모됩니다.
**해결책: "색상 접기 **(Color Folding)
저자들은 색상 접기라는 교묘한 트릭을 제안합니다.
- 비유: 1,670 만 가지의 다양한 파란색 음영이 들어 있는 상자가 있다고 상상해 보세요. 인간의 눈에는 "하늘색"과 "하늘색 + 아주 작은 흰색 반점"의 차이가 보이지 않습니다.
- 해결: 모델은 이 구별 불가능한 미세한 음영들을 그룹화합니다. "1,600 만 개의 이름이 필요하지 않다. 인간이 실제로 볼 수 있는 모든 색을 커버하는 4,000 개의 이름만 사용하자"라고 말합니다.
- 결과: 이는 그림을 인간의 눈에 흐릿하게 만들지 않으면서 사전 크기를 대폭 축소합니다 (거대한 지도를 주머니 크기로 접는 것과 같습니다). 이는 막대한 양의 컴퓨팅 파워를 절약합니다.
3. 마법 같은 트릭: "전체에서 지역으로" 주의 (Global to Local Attention)
문제:
사전이 작아졌더라도, 픽셀 단위로 전체 이미지를 보는 것은 여전히 많은 작업입니다. 모든 픽셀을 다른 모든 픽셀과 한 번에 비교하려 한다면 (전체 주의), 컴퓨터는 1 만 명이 동시에 말하는 것을 듣으려 하는 것처럼 압도당합니다.
**해결책: "창문형 주의 **(Windowed Attention)
모델은 이미지를 작은 창문 (작은 정사각형 프레임으로 보는 것과 같음) 으로 나눕니다.
- 단계 1: 작은 픽셀 창문을 보고 그들 간의 관계를 파악합니다.
- 단계 2: 해당 창문의 "요약"을 취하고 다음 창문으로 이동합니다.
- 단계 3: 이러한 창문 요약들을 결합하여 전체 그림을 이해합니다.
- 비유: 콘서트장의 전체 군중을 한 번에 이해하려 하는 대신, 친구들이 이야기하는 작은 그룹들을 듣고, 다음 그룹을 듣고, 마침내 전체 군중이 무엇을 말하고 있는지 조각내어 이해하는 것입니다. 저자들은 이것이 모든 사람을 한 번에 듣는 것과 거의 비슷하게 작동하지만 훨씬 빠른 "스마트한 근사치"라고 주장합니다.
4. 큰 목표: 단어와 그림의 통합
현재 AI 모델들은 텍스트와 이미지를 두 가지 다른 것으로 취급합니다. 그들은 한 뇌로 텍스트를 읽고 별도의 "번역기"(ViT 인코더) 로 이미지를 봅니다.
새로운 모델:
이 모델은 픽셀을 단어와 정확히 같은 방식으로 취급합니다.
- 비유: "사과"가 단어이고, 특정 빨간색 음영도 단어인 언어를 상상해 보세요. AI 는 "The [Red Pixel] is on the [Green Pixel]"이라는 문장을 "The apple is on the table"이라는 문장을 읽는 것처럼 쉽게 읽을 수 있습니다.
- 이점: 픽셀을 단어처럼 취급하기 때문에 비지도 데이터에서 학습할 수 있습니다. 이는 "이것은 고양이입니다"라는 레이블을 인간이 작성할 필요 없이 인터넷의 수백만 장의 원시 이미지만 보고 학습할 수 있음을 의미합니다. 이는 플래시카드로 가르치는 것이 아니라 세상을 그냥 바라보며 보는 법을 배우는 아이와 같습니다.
5. 실제로 무엇을 했나요?
저자들은 이 모델의 작은 버전 (1 억 2 천만 개의 매개변수) 을 구축하고 이미지만으로 학습시켰습니다 (아직 텍스트는 섞이지 않았습니다).
- 결과: 모델은 성공적으로 학습했습니다. "손실"(AI 가 얼마나 혼란스러웠는지를 측정하는 지표) 이 감소하여 픽셀 패턴을 이해하기 시작했습니다.
- 주장: 그들은 이 모델에 더 많은 컴퓨팅 파워와 더 많은 데이터를 제공하면, 텍스트 기반 AI(예: GPT-3) 를 성공적으로 만든 것과 같은 "확장 법칙"을 따라 더 좋아질 것이라고 믿습니다.
요약
이 논문은 컴퓨터가 보는 방식을 위한 새로운 방법을 제안합니다:
- 이미지를 요약하지 말고, 모든 픽셀에 고유한 정체성을 부여하세요.
- 컴퓨터가 압도당하지 않도록 색상을 단순화(색상 접기) 하세요.
- 에너지를 절약하기 위해 한 번에 보지 말고 창문으로 보세요.
- 픽셀을 단어처럼 취급하여 AI 가 인간 교사 없이 원시 이미지에서 학습할 수 있게 하세요.
저자들은 이것이 현재 방식보다 미래 AI 비전의 더 나은 기초라고 믿지만, 대규모 규모로 이를 증명하기 위해서는 더 많은 컴퓨팅 파워가 필요하다고 인정합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.