← 최신 논문
💬 NLP

Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models

이 논문은 거대 언어 모델의 언어적 불일치, 편향성 및 비효율성 문제를 해결하기 위해 토큰화를 정적인 전처리 단계가 아니라 모델과의 문맥 인지적 공동 설계가 필요한 핵심 모델링 결정으로서 재구상해야 한다고 주장한다.

원저자: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

게시일 2026-01-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin, M Saiful Bari

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 아주 똑똑한 학생(거대 언어 모델)에게 세상을 읽고 이해하는 법을 가르치려 한다고 상상해 보십시오. 학생이 배우기 전에, 당신은 그들이 읽을 책들을 어떻게 나누어야 할지 결정해야 합니다. 텍스트를 전체 단어로 자를까요? 개별 글자로 자를까요? 아니면 음절이나 흔한 글자 조합 같은 작은 덩어리로 자를까요?

이처럼 텍스트를 조각으로 나누는 과정을 **토큰화(tokenization)**라고 합니다.

이 논문에 따르면, 현재 우리가 이 작업을 수행하는 방식은 "설정하고 잊어버리는" 습관과 같습니다. 우리는 보통 표준적인 가위(BPE라고 불리는 미리 만들어진 도구)를 집어 들고 그냥 자르기 시작하며, 그것이 모두에게 잘 작동할 것이라고 가정합니다. 저자들은 이것이 실수라고 주장합니다. 그들은 토큰화가 단순히 지루한 준비 단계가 아니라, AI를 구축할 때 내리는 가장 중요한 설계 결정 중 하나라고 말합니다.

다음은 이 논문의 논지를 쉬운 비유로 풀어낸 내용입니다.

1. 문제점: "하나의 크기로 통용되는" 가위

현재 대부분의 AI 모델은 동일한 표준 토큰화 방식을 사용합니다. 이 논문은 이 방식을 섬세한 실크 스카프, 두꺼운 울 스웨터, 그리고 금속 판을 자를 때도 하나의 가위만 사용하는 것에 비유합니다.

  • 문제점: 이 표준 방식은 종종 이상한 곳에서 끊어버립니다. 예를 들어, 비영어권 언어의 복잡한 단어를 의미 없는 작은 파편들로 쪼개거나, 코드 명령어를 AI를 혼란스럽게 만드는 방식으로 분리할 수 있습니다.
  • 결과: AI는 텍스트를 이해하기 위해 더 많이 노력해야 하며, 효율성이 떨어지고, 특정 언어나 단어 유형에 유리한 "절단 방식" 때문에 편향성을 학습할 수도 있습니다.

2. 변화: "준비 작업"에서 "핵심 설계"로

저자들은 토큰화를 요리하기 전 설거지를 하는 것처럼 취급하지 말라고 요구합니다. 대신, 그것이 레시피 자체의 일부가 되어야 한다고 말합니다.

  • 비유: 집을 짓는다고 상상해 보십시오. 당신은 아무 벽돌이나 가져다 놓고 그것들이 딱 맞기를 바라지는 않을 것입니다. 당신은 기후와 설계에 따라 기초, 벽, 지붕에 적합한 벽돌을 구체적으로 선택할 것입니다.
  • 주장: 토큰화는 AI가 무엇을 하기로 했는지(예: 코드 작성, 의료 진단, 다국어 구사 등)와 누구에게 말하는지에 따라 신중하게 선택되어야 합니다.

3. 해결책: "문맥 인식형" 도구 상자

논문은 **문맥 인식 프레임워크(context-aware framework)**라는 새로운 사고방식을 제안합니다. 이는 단순히 도구를 고르는 것이 아니라, 특정 작업을 위해 도구를 설계하는 것을 의미합니다.

  • 공동 설계(Co-Design): 토큰을 정한 뒤 AI를 훈련시키는 대신, 둘을 함께 설계해야 합니다. 만약 AI가 의학 저널을 읽도록 학습한다면, 토큰화 도구는 "immunohistochemistry(면역조직화학)"를 무작위 글자들의 나열이 아닌 하나의 중요한 단위로 인식하도록 의학 텍스트를 바탕으로 훈련되어야 합니다.
  • 적응(Adaptation): 특정 언어(예: 아랍어)나 특정 분야(예: 법률)를 위한 AI를 사용한다면, 일반적인 영어 뉴스보다 다르게 자를 수 있도록 "가위"를 조정해야 할 수도 있습니다.

4. 숨겨진 위험: 편향성과 보안

논문은 잘못된 토큰화가 단순히 효율성의 문제가 아니라, 불공정하거나 위험할 수 있다고 경고합니다.

  • "침묵의 실패": 어떤 단어나 문자는 너무 형편없이 잘려서 AI가 그 의미를 제대로 학습하지 못할 수 있습니다. 논문은 이를 "미학습 토큰(undertrained tokens)"이라고 부릅니다. 이는 학생에게 단어의 절반이 번져 있는 교과서를 주는 것과 같습니다. 학생은 추측은 하겠지만, 실제로 이해하지는 못할 것입니다.
  • 편향: 토큰화가 특정 문화나 언어의 단어는 잘게 쪼개면서 영어 단어는 온전하게 유지한다면, AI는 자연스럽게 영어를 더 잘 이해하고 다른 언어에는 어려움을 겪게 됩니다. 이는 특정 집단에 불공정한 이점을 만듭니다.
  • 보안: 해커들은 때때의 AI가 텍스트를 자르는 기이한 방식을 악용하여 AI가 해서는 안 될 행동을 하도록 속일 수 있습니다.

5. 해결책: 새로운 체크리스트

저자들은 AI를 구축하는 모든 이들을 위해 구조화된 프로세스를 제안합니다.

  1. 재사용하지 마십시오: 유명한 모델(예: LLaMA)의 토크나이저가 자신의 필요에 맞는지 확인하지 않고 자동으로 가져다 쓰지 마십시오.
  2. 절단 방식을 감사하십시오: 토크나이저가 다양한 언어에 대해 공정하게 자르고 있는지, 그리고 쓸모없는 조각들을 만들어내고 있지는 않은지 확인하십시오.
  3. 중요한 것을 측정하십시오: 단순히 텍스트가 몇 조각으로 나뉘는지 세는 데 그치지 마십시오. 대신, 이러한 절단 방식이 AI의 실제 의미 이해를 개선했는지 측정하십시오.

결론

논문은 토큰화가 AI 이해의 토대라고 결론짓습니다. 만약 일반적이고 제대로 설계되지 않은 도구로 그 토대를 만든다면, 그 집(AI)은 흔들리고, 비효und 효율적이며, 불공정할 것입니다. 토큰화를 핵심적인 설계 선택 사항으로 취급하여 특정 언어, 작업, 대상에 맞게 커스터마이징함으로써, 우리는 더 똑똑하고, 빠르며, 모두에게 공정한 AI를 구축할 수 있습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →