← 최신 논문
🤖 machine learning

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base

이 논문은 인도어 계열 언어에 대해 더 우수한 압축률을 달성하면서도 영어, 코드, 수학 작업에서 경쟁력 있는 성능을 유지하기 위해 정밀한 어휘 개조를 통해 OpenAI 의 o200k_base 를 즉시 대체할 수 있는 BrahmicTokenizer-131K 를 소개합니다.

원저자: Rohan Shravan

게시일 2026-05-29
📖 3 분 읽기☕ 가벼운 읽기

원저자: Rohan Shravan

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

여행을 준비한다고 상상해 보세요. 영어를 사용하는 도시들과 각각 고유한 문자 체계 (예: 데바나가리, 타밀, 오디아 등) 를 가진 인도의 9 개 지역을 모두 포함하는 여행 말입니다.

문제: "원사이즈피트올" 여행가방
현재 대부분의 AI 모델은 영어와 몇몇 유럽 언어를 주로 위해 설계된 표준 "여행가방" (토크나이저) 을 사용합니다. 이 여행가방에 인도 언어들을 담으려 하면 잘 맞지 않습니다.

  • 비유: 티셔츠용으로 설계된 여행가방에 정교하고 섬세한 인도식 사리를 넣으려 한다고 상상해 보세요. 여행가방에 적절한 구획이 없기 때문에 사리를 작고 지저분한 조각으로 접어 넣어야 합니다.
  • 결과: 오디아와 같은 인도 언어의 단어 하나가 여행가방에 들어가기 위해 세 개의 별도 조각으로 잘려 나갑니다. 반면 영어 단어는 한 조각으로 들어갑니다. 이로 인해 실제 정보량은 동일함에도 불구하고 AI 가 처리하는 "여행가방" (데이터) 이 훨씬 무거워지고 운반 비용이 증가합니다.

해결책: BrahmicTokenizer-131K
이 논문의 저자들은 BrahmicTokenizer-131K라는 새롭고 더 지능적인 여행가방을 만들었습니다. 그들은 처음부터 여행가방을 새로 만든 것이 아니라, 매우 고품질이고 인기 있는 여행가방 (OpenAI 의 o200k_base) 을 가져와서 인도 언어에 완벽하게 적합하도록 "수술"을 가하면서도 영어나 코드를 운반하는 능력을 해치지 않았습니다.

다음은 그들이 사용한 간단한 단계들입니다:

1. "정리" (1 단계)

원래 여행가방에는 20 만 개의 구획이 있었습니다. 이 중 많은 구획은 이번 특정 여행에 필요하지 않은 언어 (한국어, 일본어, 아랍어, 러시아어 등) 를 위한 것이었습니다.

  • 조치: 사용하지 않는 3 만 8 천 개의 구획을 버렸습니다.
  • 결과: 이제 새로운 배치를 준비할 수 있는 더 깨끗하고 작은 여행가방이 되었고, 정확히 131,072 개의 구획이 남았습니다.

2. "수술적 개조" (2 단계)

이제 여행가방에 빈 공간이 생겼습니다. 빈 공간으로 두는 대신, 고빈도 인도어 단어와 문자로 신중하게 채웠습니다.

  • 전략: 어떤 인도어 단어에 자리를 줄지 결정하기 위해 수학적 공식 (선형 프로그래밍) 을 사용했습니다. 오디아와 같이 이전에 무시되었던 언어들을 우선순위로 두었습니다.
  • 마법: 오디아 문자를 위한 725 개의 특정 구획을 추가했습니다. 이전에는 여행가방에 오디아를 위한 자리가 전혀 없어 모든 오디아 글자가 비효율적인 작은 조각으로 분리되어야 했습니다. 이제 전체 오디아 단어나 그 큰 조각들을 담을 수 있습니다.

3. "드롭인" 기능

가장 좋은 점은 이 새로운 여행가방이 바깥에서 보면 이전 것과 정확히 동일하다는 것입니다.

  • 비유: 기존 엔진룸에 정확히 들어맞는 고성능 엔진으로 표준 엔진을 교체하는 것과 같습니다. 차를 다시 만들거나 타이어를 바꾸거나 매뉴얼을 다시 쓸 필요가 없습니다.
  • 주장: 이전 여행가방을 사용하던 모든 AI 학습 파이프라인은 이 새로운 것을 단순히 교체하면 즉시 작동합니다.

결과: 무엇이 변했는가?
이 논문은 2,700 만 개의 인도 문서로 구성된 방대한 컬렉션에서 이 새로운 여행가방을 테스트했습니다. 그들이 발견한 내용은 다음과 같습니다:

  • 엄청난 절감: 인도 언어의 경우, 이 새로운 여행가방은 현재 최고의 경쟁자들 (Tekken/Sarvam-m) 보다 26.7% 적은 조각 (토큰) 을 생성했습니다.
    • 예시: 오디아 언어의 경우 개선 폭이 매우 컸습니다. 이전 여행가방은 동일한 텍스트를 운반하기 위해 4.3 배 더 많은 조각이 필요했습니다. 새로운 여행가방은 이를 효율적으로 운반합니다.
  • 교환 조건 없음: 보통 한 가지 용도로 여행가방을 더 잘 만들면 다른 용도에서는 성능이 떨어지기 마련입니다. 하지만 이 새로운 여행가방은 "범용" 승리자입니다.
    • 영어 단어를 포장하는 능력은 원본과 동일하게 뛰어납니다.
    • 실제로 컴퓨터 코드와 수학 문제를 포장하는 능력은 경쟁자들보다 뛰어납니다.
  • "전문가" 대 "일반인" 교환 조건:
    • 인도 언어 만을 위해 설계된 다른 여행가방들 (전문가) 이 있습니다. 이들은 인도어를 약간 더 잘 포장합니다 (약 12~18% 더 좋음).
    • 그러나 이러한 전문가 여행가방들은 영어나 코드를 포장하는 데는 형편없습니다.
    • BrahmicTokenizer-131K는 동일한 크기 제한 내에서 인도 언어, 영어, 코드, 수학 등 모든 것을 동시에 탁월하게 처리하는 유일한 여행가방입니다.

요약
이 논문은 AI 가 인도 언어를 처리하는 방식의 구조적 비효율성을 해결하는 도구를 제시합니다. 사용하지 않는 언어 슬롯을 수술적으로 제거하고 신중하게 선별된 인도어 언어 슬롯으로 교체함으로써, 현대 AI 모델이 의존하는 영어와 코드의 고성능을 유지하면서 인도 언어를 위한 막대한 컴퓨팅 자원을 절약하는 토크나이저를 만들었습니다. 이는 영어 구사 능력이나 코드 작성 능력을 희생하지 않으면서 인도 데이터로 AI 를 더 저렴하고 빠르게 학습시킬 수 있는 "드롭인" 업그레이드입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →