← 최신 논문
💬 NLP

Length-MAX Tokenizer for Language Models

이 논문은 그래프 분할 접근 방식을 통해 어휘 선택을 최적화하여 문자당 평균 토큰 수를 최소화함으로써, 표준 바이트 쌍 인코딩(Byte Pair Encoding) 대비 훈련 단계, 추론 지연 시간 및 메모리 사용량을 크게 줄이는 동시에 다운스트림 성능을 향상시키는 새로운 방법인 Length-MAX 토크나이저를 소개한다.

원저자: Dong Dong, Weijie Su

게시일 2026-08-11
📖 5 분 읽기🧠 심층 분석

원저자: Dong Dong, Weijie Su

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 초지능 로봇에게 인간의 언어를 가르치려 한다고 상상해 보세요. 이를 위해 당신은 모든 문장을 '토큰'이라는 아주 작은 구성 단위로 나누어야 합니다. 이 토큰들을 레고 블록이라고 생각해 보세요. 만약 표준적인 레고 세트를 사용한다면, 단순한 집 한 채를 짓는 데도 수백만 개의 아주 작은 조각들이 필요할 것이고, 이는 건설 과정을 느리고 지저분하게 만들 것입니다. 수년 동안, 이 블록들을 만드는 가장 인기 있는 방식(BPE라고 불리는 '바이트 쌍 인코딩' 방식)은 가장 자주 등장하는 글자 쌍을 찾아 하나로 합치는 것이었습니다. 이는 마치 " 'th'와 'e'가 많이 나오니까, 'the'라는 블록을 만들자"라고 말하는 것과 같았습니다. 하지만 이 방식에는 결함이 있었습니다. 너무 흔한 짧은 단어들을 너무 좋아한 나머지, 길고 의미 있는 구절들을 작고 비효율적인 덩어리들로 계속 쪼개버렸기 때문입니다. 이로 인해 로봇은 필요한 것보다 훨씬 더 많은 블록을 처리해야 했고, 이는 로봇의 사고 속도를 늦추고 메모리를 잡아먹었습니다.

이제, 그 레고 세트를 만드는 새로운 방법을 상상해 보세요. 단순히 가장 빈번한 쌍을 찾는 대신, 이 새로운 방법은 "더 크고 똑똑한 블록을 만들어 더 넓은 범위를 커버할 수 있다면 어떨까?"라고 질문합니다. 이것이 펜실베이니아 대학교의 동 동(Dong Dong)과 웨이제 수(Weijie Su) 연구원이 발표한 새로운 연구의 핵심입니다. 그들은 Length-MAX라는 새로운 토크나이저를 도입했습니다. Length-MAX는 단순히 단어가 얼마나 자주 나타나는지만 보는 것이 아니라, 유용할 만큼 충분히 자주 등장하는 더 긴 구절을 보상합니다. 이는 "the"가 흔하긴 하지만, "the United States"라는 구절이 "the", "United", "States"라는 세 개의 별개 조각보다 훨씬 더 좋은 구성 요소라는 점을 깨닫는 것과 같습니다. 작고 반복적인 블록을 더 길고 의미 있는 블 것이다로 교체함으로써, 로봇은 문장을 더 빠르게 구축하고, 메모리를 덜 사용하며, 실제로 이야기를 더 잘 이해할 수 있게 됩니다.

너무 많은 작은 블록의 문제점

오랫동안 컴퓨터에게 언어를 가르치는 표준적인 방법은 텍스트를 등장 빈도에 따라 작은 조각으로 나누는 것이었습니다. 이를 **바이트 쌍 인코딩(Byte Pair Encoding, BPE)**이라고 합니다. 이 방식은 가장 흔한 두 개의 기호가 나란히 붙어 있는 것을 찾아 새로운 토큰으로 병합하는 방식으로 작동합니다. 이는 마치 더 이상 움직일 수 없을 때까지 가장 인기 있는 이웃들을 계속 결합하는 게임과 같습니다.

문제는 이 게임이 짧고 빈도가 높은 파편들을 선호한다는 점입니다. 이 방식은 "역사적인 눈보라 속에서"와 같은 길고 일관된 구절을 작고 단절된 조각들의 집합으로 취급합니다. 현대의 AI 모델은 전체 문장을 이해하기 위해 모든 개별 조각에 주의를 기울여야 하므로, 조각이 너무 많으면 수학적 복잡성이 폭발합니다. 이는 마치 모든 단어가 세 개의 음절로 나뉘어 있는 책을 읽는 것과 같습니다. 동일한 의미를 얻기 위해 세 배나 많은 "단어"를 읽어야 하는 셈입니다. 이는 훈련을 늦추고, AI의 답변 속도를 느리게 만들며, 더 많은 컴퓨터 메모리를 요구합니다.

Length-MAX의 등장: "길수록 좋다"는 전략

이 논문의 연구자들은 발상을 전환하기로 했습니다. 그들은 이렇게 물었습니다. "우리가 빈도수가 아니라 길이를 최적화한다면 어떨까?" 그들은 Length-MAX라는 새로운 토크나이저를 만들었습니다.

단순히 가장 흔한 쌍을 찾는 대신, Length-MAX는 특정 점수(빈도수 × 길이)를 극대화하는 부분 문자열을 찾습니다. 즉, 흔하면서도 긴 토큰에 보상을 주는 것입니다. 만약 "the United States"라는 구절이 충분히 자주 등장한다면, Length-MAX는 이를 "the", "United", "States"로 나누는 대신 하나의 토큰으로 잡아냅니다.

이를 위해 팀은 까다로운 수학적 퍼즐을 풀어야 했습니다. 그들은 완벽한 세트의 긴 토큰을 찾는 것이 방대한 양의 텍스트에 대해 수학적으로 완벽하게 해결하는 것이 불가능한 문제(NP-hard라고 알려진 문제)라는 것을 알아냈습니다. 그래서 그들은 영리한 '탐욕적(greedy)' 알고리즘을 구축했습니다. 모든 가능한 구절이 길이에 따라 점수를 받는 점수판을 상상해 보세요. 알고식은 가장 높은 점수를 받은 구절을 선택하여 고정하고, 어휘 사전이 가득 찰 때까지 이 과정을 반복합니다. 그들은 라빈-카프 롤링 해시(Rabin-Karp rolling hash) 기술을 사용하여 이 과정을 매우 빠르게 만들었는데, 이 기술은 텍스트를 고속 스캐너처럼 훑을 수 있게 해주며, 수백 개의 컴퓨터 코어에서 동시에 실행되었습니다.

결과: 더 빠르고, 더 작고, 더 똑똑하게

연구팀은 이 새로운 방법을 테스트하기 위해 AI 모델(구체적으로 GPT-2 모델)을 처음부터 훈련시켜 표준 BPE 방식과 비교했습니다. 결과는 전 분야에서 인상적이었습니다:

  • 더 적은 토큰: 다양한 어휘 크기에 걸쳐, Length-MAX는 BPE에 비해 텍스트를 표현하는 데 필요한 토큰 수를 14~18% 줄였습니다. 64,000개의 단어 어휘 사전의 경우 감소율은 **13.0%**였습니다. 이는 AI가 같은 내용을 말하기 위해 훨씬 적은 수의 "블록"을 처리해야 함을 의미합니다.
  • 더 빠른 훈련: 처리해야 할 토큰이 적기 때문에 모델이 더 빨리 학습했습니다. 특정 숙련도에 도달하기 위해 1억 2,400만 파라미터 모델은 18.5% 적은 단계가 필요했고, 3억 5,500만 파라미터 모델은 17.2%, 13억 파라미터 모델은 18.5% 적은 단계가 필요했습니다.
  • 더 빠른 답변: 모델이 텍xt를 생성할 때 더 빨랐습니다. 추론 지연 시간(답변하는 데 걸리는 시간)은 124M 모델에서 13.7% 감소했고, 텍스트 생성 속도(처리량)는 16% 향상되었습니다.
  • 더 적은 메모리: 모델은 메모리도 덜 사용했습니다. 연구진은 모델의 '작업 기억'(KV-캐시라고 불림)과 어휘 임베딩에 필요한 메모리가 18% 감소했음을 발견했습니다.
  • 더 나은 이해력: 놀랍게도, 토큰을 적게 사용하는 것이 AI를 멍청하게 만든 것이 아니라 오히려 더 똑똑하게 만들었습니다. 긴 이야기와 문맥을 이해하는 능력을 측정하는 테스트에서 Length-MAX 모델은 더 우수한 성능을 보였습니다. 예를 들어, LAMBADA 테스트에서 AI의 혼란도(perplexity)는 11.7% 감소했고, 상식 추론 테스트인 HellaSwag에서는 정확도가 4.3포인트 향상되었습니다.

왜 작동하는가 (그리고 무엇을 하지 못하는가)

Length-MAX의 마법은 단순히 시간을 절약하는 것이 아니라, AI가 세상을 바라보는 방식을 바꾸는 데 있습니다. 단어들을 더 길고 의미 있는 구절(예: "in the midst of")로 그룹화함으로써, AI는 문장의 문맥을 더 쉽게 유지할 수 있습니다. 이는 개별 글자를 보고 이야기를 이해하려는 것과 전체 단어 및 구절을 보고 이해하려는 것의 차이와 같습니다.

연구진은 또한 이 방식이 언어의 자연스러운 "리듬"을 깨뜨리지 않는지 확인했습니다. 그들은 Length-MAX가 여전히 언어의 자연스러운 빈도 법칙(지프의 법칙, Zipf's law으로 알려진)을 따른다는 것을 발견했습니다. 즉, 이상하고 무작위적인 긴 단어를 만들어내는 것이 아니라는 뜻입니다. 이는 언어의 자연스러운 구조를 보존하면서 효율성을 높였습니다.

하지만 이 논문은 이 방법이 하지 못하는 것에 대해서도 주의 깊게 명시하고 있습니다. 이미 훈련되어 고정된 모델에는 이 방식이 적용되지 않습니다. 이러한 이점을 얻으려면 새로운 토크나이저를 사용하여 모델을 처음부터 다시 훈련시켜야 합니다. 또한 이 연구는 영어 텍스트에 집중되어 있으므로, 구조가 매우 다른 언어에서도 동일하게 효과적인지는 아직 명확하지 않습니다. 아울러, 결과가 13억 파라미터 규모의 모델까지는 강력하지만, 연구진은 70억 파라미터 이상의 거대 모델에 대해서는 이점이 유사할 것으로 예상하나 아직 완전히 테스트되지는 않았다고 제언합니다.

결론

Length-MAX는 수십 년 된 문제에 대한 신선한 접근 방식입니다. 토큰에 있어 "길이가 더 좋다"는 점을 깨달음으로써, 연구진은 AI 모델을 더 빠르고, 저렴하게 운영하며, 놀랍게도 문맥 이해력을 높이는 방법을 찾아냈습니다. 이는 때때로 앞으로 나아가는 최선의 방법이 더 큰 엔진을 만드는 것이 아니라, 더 똑똑한 변속기를 만드는 것임을 상기시켜 줍니다. 코드와 새로운 어휘 사전은 누구나 시도해 볼 수 있도록 공개되어 있으며, 이는 차세대 언어 모델에서 더 많은 효율성을 끌어낼 수 있는 실질적인 방법을 제시합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →