Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention
Zonkey는 미분 가능한 토크나이저와 확률적 어텐션 메커니즘을 활용하여 고정된 토크나이저 없이 엔드 투 엔드 최적화와 적응적이고 언어학적으로 의미 있는 텍스트 생성을 가능하게 함으로써, 가공되지 않은 문자로부터 문서 수준의 표현에 이르기까지 완전하게 학습 가능한 파이프라인을 도입한 새로운 계층적 확산 언어 모델이다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 이야기를 쓰는 법을 가르치려 한다고 상상해 보세요. 보통 우리는 로봇에게 고정된 "덩어리(chunks)" 사전(단어나 음절 같은 것들)을 주고, "공백을 보면 새 단어를 시작하라"고 가르칩니다. 이것은 마치 로봇에게 오직 한 가지 특정 방식으로만 결합할 수 있는 딱딱한 레고 블록을 주는 것과 같습니다. 만약 로봇이 새로운 종류의 블록이나 엉망으로 쌓인 모래 더미를 마주한다면, 그 규칙이 맞지 않기 때문에 혼란에 빠질 것입니다.
이 논문은 고정된 사전을 사용하지 않는 새로운 종류의 로봇인 Zonkey를 소개합니다. 대신 Zonkey는 개별 글자로부터 시작하여 단어와 문장이 자연스럽게 어디서 시작되고 끝나는지를 파악하며, 진행 과정에서 스스로 자신만의 "덩어리"를 만드는 법을 배웁니다. 이는 마치 조각가가 대리석 덩어리를 깎아 조각상을 만드는 과정과 유사하며, 이 과정에서 대리석은 서서히 먼지로 변했다가 다시 돌로 돌아오기도 합니다.
Zonkey가 어떻게 작동하는지 간단한 부분들로 나누어 설명하겠습니다.
1. "확률적 어텐션(Probabilistic Attention)" (부드러운 필터)
전통적인 로봇들은 문장을 보고 "이 부분은 존재하고, 저 부분은 존재하지 않는다"라고 판단합니다. 즉, 딱딱하게 끊어냅니다. 하지만 Zonkey는 일종의 디머 스위치(밝기 조절 스위치)와 같습니다. 모든 텍스트 부분에 "존재 확률"을 할당합니다.
- 비유: 안개 낀 창문을 바라보는 것을 상상해 보세요. 어떤 부분은 선명하고(높은 확률), 어떤 부분은 매우 뿌옇습니다(낮은 확률). Zonkey는 단순히 뿌연 부분을 잘라내는 것이 아니라, 그 안개를 통해 보는 법을 배웁니다. 단어가 "거의 존재하는" 상태인지 혹은 "간신데 존재"하는 상태인지를 이해함으로써, 고정된 크기에 갇히지 않고 어떤 길이의 문장도 처리할 수 있게 해줍니다.
2. "세그먼트 스플리터(Segment Splitter)" (자기 학습형 검열기)
보통 컴퓨터는 인간으로부터 "여기에 공백을 넣어 새 단어를 시작하라"는 지시를 받아야 합니다. 하지만 Zonkey에는 스스로 이 과정을 학습하는 **세그먼트 스플리터(Segment Splitter)**라는 특별한 모듈이 있습니다.
- 비유:
thequickbrownfox와 같이 끊김 없는 긴 글자 줄기를 생각해 보세요. 일반적인 컴퓨터는 어디를 잘라야 할지 알기 위해 규칙 책이 필요합니다. 반면 Zonkey는 똑똑한 가위와 같아서, "아, 'the' 뒤에서 자르는 게 더 좋은 단어가 되겠구나"라고 스스로 학습합니다. 규칙 책 없이도, 나중에 이야기를 더 잘 재구성할 수 있도록 공백이나 마침표에서 자르는 법을 스스로 터득합니다나. 이를 통해 단어와 문장의 개념을 스스로 발견합니다.
3. "압축기(Compressor)"와 "확산(Diffusion)" (요약가와 조각가)
Zonkey는 텍스트를 덩어리로 나눈 후, 각 덩어리를 아주 작고 조밀한 요약본(벡터)으로 압축합니다.
- 비유: 문단 전체를 가져와서 하나의 작고 밀도 높은 대리석 덩어리로 줄이는 것을 상상해 보세요.
- 확산 부분: 텍스트를 생성하기 위해, Zonkey는 순수한 노이즈(정적) 상태에서 시작합니다. 그런 다음 이 노이즈를 천천히 "디노이징(denoise, 노이즈 제거)"하여, 정적을 명확한 이미지(또는 텍스트)로 변화시킵니다.
- 반전: 대부분의 확산 모델은 텍스트를 다룰 때 어려움을 겪는데, 텍스트는 불연속적이기 때문입니다(글자의 절반만 가질 수는 없습니다). Zonkey는 **혼합 모델(DDMM)**을 사용합니다. 이는 세부 사항을 정확하게 잡기 위해 작고 신중한 발걸음을 떼어야 할 때와, 전체적인 형태를 잡기 위해 크고 대담한 도약을 해야 할 때를 아는 조각가와 같습니다. 이를 통해 길고 일관된 문장을 만들면서도 길을 잃지 않도록 도와줍니다.
4. "스티처(Stitcher)" (재봉사)
Zonkey는 덩어리들을 처리하기 위해 서로 겹치는 부분(overlapping chunks)을 사용하여 텍스트를 나누기 때문에, 이를 다시 하나로 합쳐야 합니다.
- 비유: 두 개의 천 조각을 꿰매는 것을 상상해 보세요. 일반적인 로봇은 단순히 두 조각을 옆에 붙여 놓아 눈에 띄는 못생긴 솔기를 남길 수 있습니다. 하지만 Zonkey의 **스티처(Stitcher)**는 숙련된 재봉사입니다. 두 조각이 겹치는 부분을 살펴보고, 한 조각이 끝나는 지점과 다른 조각이 시작되는 지점을 구분할 수 없을 정도로 매끄럽게 블렌딩합니다. 만약 한 조각에 실수(예: "quantum mechanics" 대신 "classical mechanics"라고 적음)가 있다면, 스티처는 겹치는 부분을 활용해 이를 부드럽게 수정하여 함께 꿰맵니다.
5. 결과: 완전히 학습 가능한 로봇
이 논문의 가장 큰 주장은 Zonkey의 모든 것이 "미분 가능하다(differentiable)"는 점입니다.
- 비유: 일반적인 로봇에서는 단어를 자르는 방식을 바꾸고 싶다면 코드를 수동으로 다시 작성해야 합니다. 하지만 Zonkey에서 전체 시스템은 하나의 거대하고 신축성 있는 고무줄과 같습니다. 만약 로봇이 실수를 하면, 그 "오류"는 스티처를 거쳐 확산 과정, 압축기, 그리고 스플리터까지 파동처럼 되돌아갑니다. 이는 스플리터에게 "이봐, 네가 엉뚱한 곳에서 잘랐어. 다음에는 다른 곳에서 잘라봐"라고 알려주는 역할을 합니다.
Zonkey가 할 수 있는 일 (논문에 따르면)
- 노이즈로부터 텍스트 생성: 무작위 정적 상태에서 시작하여 위키피디아 주제에 관한 일관된 문장으로 천천히 변화시킬 수 있습니다.
- 빈칸 채우기: 문장 중간에 빈칸이 있는 경우(예: "Bob is a [BLANK] player in the NBA"), 왼쪽에서 오른쪽으로 문장을 써 내려가지 않고도 중간 부분을 채울 수 있습니다(예: "basketball"). 이는 시작과 끝을 고정한 채 중간을 수정할 수 있음을 의미합니다.
- 모든 데이터에 적응: 자신만의 "단어"와 "문장"을 학습하기 때문에, 고정된 사전을 가진 로봇보다 더 지저분하거나 특이한 텍스트를 더 잘 처리할 수 있습니다.
아직 할 수 없는 일
이 논문은 자신의 한계를 매우 솔직하게 밝히고 있습니다. 현재 Zon키는 단일 컴퓨터에서 위키피디아 데이터를 사용하여 훈련된 "개념 증명(proof of concept)" 단계입니다.
- 일관된 문장은 쓸 수 있지만, 책 전체나 복잡한 문서를 작성하는 데는 아직 테스트되지 않았습니다.
- 고정된 어휘집이 없기 때문에, 다른 AI 모델의 성능을 측정하는 데 쓰이는 표준 테스트(예: "퍼플렉시티(perplexity)" 측정)를 적용할 수 없습니다.
- 이 논문은 의료 진단, 법률 자문 또는 기타 실제 세계의 응용 분야를 수행할 수 있다고 주장하지 않습니다. 이는 순수하게 새로운 유형의 언어 모델을 향한 연구 단계입니다.
요약하자면, Zonkey는 인간이 먼저 규칙을 정의하지 않고도, 밑바닥부터 스스로 언어의 구조를 읽고, 쓰고, 이해하는 법을 배우는 언어 모델을 구축할 수 있는지 확인하기 위한 실험입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.