Compute Optimal Tokenization
본 논문은 연산 최적화 언어 모델 구성에서 파라미터 수가 토큰 수가 아닌 바이트 단위로 측정된 데이터 크기에 비례하여 확장됨을 보여주며, 이는 최적 토큰 압축률이 표준 BPE 와 다르며 연산량이 증가함에 따라 감소함을 밝혀낸다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
지식의 궁극적인 도서관을 짓는다고 상상해 보세요. 이 도서관을 짓기 위해 고정된 금액 (계산 예산) 이 있습니다. 이때 두 가지 주요 선택지가 있습니다:
- 수백만 개의 빈 선반이 있는 거대한 건물을 구매합니다 (모델 크기).
- 그 선반을 채울 거대한 책 더미를 구매합니다 (학습 데이터).
오랫동안 전문가들은 사서들에게 다음과 같이 조언했습니다. "가장 훌륭한 도서관을 얻으려면, 짓는 선반 하나당 20 권의 책을 구매하세요." 하지만 이 조언에는 숨겨진 결함이 있었습니다. 모든 책의 크기가 동일하다는 가정을 전제로 했기 때문입니다. 실제로는 두꺼운 백과사전도 있고, 얇은 팜플렛도 있습니다.
"계산 최적 토큰화"라는 제목의 이 논문은 우리가 책을 잘못된 단위로 측정해 왔다고 주장합니다. '책' (토큰) 을 세는 대신 '페이지' (바이트) 를 세어야 합니다.
다음은 그들의 발견 사항을 간단한 비유로 정리한 것입니다:
1. "책 크기" 문제 (압축률)
인공지능 세계에서는 텍스트가 토큰이라고 불리는 조각으로 잘립니다.
- 낮은 압축: 문장을 개별 글자로 잘라낸다고 상상해 보세요. 엄청난 양의 작은 조각 (많은 토큰) 이 생깁니다.
- 높은 압축: 전체 단어나 심지어 구까지 하나의 덩어리로 묶는다고 상상해 보세요. 더 적은 수의 큰 덩어리 (적은 토큰) 가 생깁니다.
이 논문은 묻습니다: 우리의 덩어리 크기가 중요한가요?
답은 그렇습니다. 덩어리의 크기 (압축률이라고 함) 는 도서관을 얼마나 효율적으로 지을 수 있는지를 바꿉니다.
2. 최적의 지점 찾기: "바이트 대 토큰" 규칙
연구진은 토큰의 크기와 모델의 크기를 조정하며 약 1,000 개의 서로 다른 인공지능 모델을 훈련시켰습니다. 그들은 완벽한 균형을 위한 새로운 규칙을 발견했습니다:
- 오래된 규칙: "파라미터당 20 토큰을 구매하세요." (이는 토큰이 표준 BPE 토큰과 같은 특정 크기일 때만 작동합니다.)
- 새로운 규칙: "파라미터당 60 바이트의 텍스트를 구매하세요."
비유:
인공지능 모델을 요리사로, 데이터를 재료로 생각하세요.
- 만약 요리사에게 미리 잘게 다진 작은 재료 (높은 압축) 를 주면, 그들은 많은 요리를 빠르게 할 수 있습니다.
- 만약 그들에게 통째로 된 야채 (낮은 압축) 를 주면, 그들은 먼저 다져야 하므로 시간이 걸립니다.
- 이 논문은 야채를 어떻게 잘랐든 상관없이, 요리사가 자신의 기술 (파라미터) 단위당 특정 중량의 재료 (60 바이트) 를 가질 때 가장 잘 수행한다는 사실을 발견했습니다. 그 중량이 20 개의 큰 덩어리이든 100 개의 작은 부스러기이든 상관없습니다. 중요한 것은 총 중량입니다.
3. "골디락스" 압축률
"덩어리를 더 크게 만들면 시간을 더 절약하므로 가능한 한 크게 만들어야 한다!"라고 생각할 수 있습니다.
이 논문은 말합니다: 너무 성급하지 마세요.
그들은 덩어리 크기에 대한 골디락스 존이 있다는 사실을 발견했습니다.
- 너무 작음: 모델이 너무 많은 작은 데이터 조각에 압도됩니다.
- 너무 큼: 덩어리가 너무 거칠어서 모델이 너무 많은 세부 정보를 잃습니다.
- 적당함: 주어진 예산에 대해 가장 똑똑한 모델을 만들어내는 특정 압축률이 있습니다.
반전: 돈 (계산 능력) 이 더 많아질수록 "적당한" 크기는 실제로 더 작아집니다.
- 비유: 작은 부엌이 있다면 시간을 절약하기 위해 미리 다진 야채를 원할 수 있습니다. 하지만 무제한 인력을 갖춘 거대한 전문 부엌이 있다면, 추가적인 세부 정보가 노력할 가치가 있을 만큼 효율적으로 처리할 수 있으므로 통째로 된 야채를 선호할 수 있습니다.
4. 한 가지 크기가 모두에게 맞지 않음 (언어가 중요함)
연구진은 영어, 힌디어, 아랍어, 러시아어 등 다양한 언어로 이를 테스트했습니다. 그들은 "적당한" 덩어리 크기가 언어에 따라 다르다는 사실을 발견했습니다.
- 비유: 다른 여행을 위해 여행 가방을 싸는 상황을 상상해 보세요.
- 매우 간결한 단어를 사용하는 언어 (예: 영어) 를 사용하는 국가로 여행할 때는 약간 더 큰 물건을 싸야 할 수 있습니다.
- 단어가 더 길거나 다른 문자를 사용하는 국가 (예: 힌디어나 아랍어) 로 여행할 때는 "최적"의 포장 방식이 바뀝니다.
- 이 논문은 인기 있는 인공지능 도구 (Llama 3 나 Qwen 등) 가 종종 "한 가지 크기로 모두에 맞는" 포장 방식을 사용한다는 사실을 발견했습니다. 이는 영어에는 괜찮게 작동하지만, 일부 언어에는 너무 많이 압축되어 있고 다른 언어에는 충분히 압축되지 않은 경우가 많습니다. 그들은 본질적으로 특정 여행에 맞는 잘못된 크기의 물건을 싸고 있는 것입니다.
주요 교훈 요약
- 토큰 세기를 멈추고 바이트 세기를 시작하세요. 인공지능에 공급할 데이터를 계획할 때, 조각 (토큰) 의 수를 세는 것이 아니라 텍스트의 원시 크기 (바이트) 를 측정하세요. 비율은 모델의 파라미터 100 만 개당 약 60 바이트의 텍스트여야 합니다.
- 완벽한 덩어리 크기가 존재합니다. 토큰을 너무 크게 만들거나 너무 작게 만들면 성능이 저하됩니다. 압축에 대한 특정 "최적의 지점"이 있습니다.
- 최적의 지점은 변합니다. 더 강력한 컴퓨터를 사용할수록 최상의 결과를 얻기 위해 실제로는 약간 더 작은 덩어리 (낮은 압축) 를 사용해야 합니다.
- 언어가 중요합니다. 힌디어에 대한 완벽한 덩어리 크기는 영어에 대한 것과 다릅니다. 현재 인공지능 모델은 종종 모든 언어에 최적화되지 않은 일반적인 설정을 사용합니다.
요약하자면: 가능한 한 가장 똑똑한 인공지능을 구축하려면 "파라미터당 20 토큰"이라는 오래된 규칙을 따르지 마세요. 대신 텍스트의 중량을 두뇌의 크기에 맞추고, 가지고 있는 계산 능력과 가르치고 있는 언어에 따라 텍스트 덩어리의 크기를 조정하세요.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.