← 최신 논문
💬 NLP

Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion

이 논문은 비영어권 언어의 토큰 과분할 문제를 해결하기 위해 기존 빈도 기반 방법을 넘어선 해석 가능성 기반 어휘 확장 기법을 제안하고, 이를 통해 서브워드 병합 현상을 분석한 'FragMend'를 개발하여 모델 효율성을 크게 향상시켰음을 보여줍니다.

원저자: Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

게시일 2026-04-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

🗣️ 언어 모델의 '단어 조각' 문제 해결하기: FragMend의 이야기

이 논문은 현대 인공지능 (LLM) 이 여러 언어를 다룰 때 겪는 불공정한 비용 문제를 해결하는 새로운 방법을 제안합니다. 마치 "영어는 1 달러에 10 개의 쿠키를 사는데, 다른 언어는 1 달러에 1 개의 쿠키만 사는" 상황과 비슷하죠.

이 복잡한 내용을 일상적인 비유로 쉽게 설명해 드릴게요.


1. 문제: "조각난 빵"의 비극 (Token Over-fragmentation)

인공지능은 문장을 이해할 때, 문장을 잘게 쪼개서 **토큰 (Token)**이라는 작은 조각으로 만듭니다.

  • 영어: "Hello"라는 단어 하나면 딱 1 개의 조각으로 처리됩니다.
  • 한국어, 힌디어, 미얀마어 등: 같은 의미의 문장이라도 조각이 너무 많게 나뉩니다. 예를 들어 "안녕하세요"가 10 개의 조각으로 쪼개져서 처리될 수도 있죠.

왜 문제가 될까요?

  • 비용: AI 는 조각 (토큰) 수만큼 돈을 받습니다. 영어 사용자는 100 원이면 되는데, 다른 언어 사용자는 1,000 원이나 내야 합니다.
  • 속도: 조각이 많으면 처리하는 데 시간이 더 걸려 답이 늦게 나옵니다.

이 현상을 **"빵이 너무 잘게 쪼개진 상태 (Token Over-fragmentation)"**라고 부릅니다.


2. 기존 방법의 한계: "자주 나오는 빵 조각만 모으기"

기존에는 "자주 나오는 빵 조각 (단어) 을 찾아서 추가하자"는 방식을 썼습니다.

  • 비유: "사람들이 '빵'이라는 단어를 자주 쓰니까 '빵'이라는 조각을 추가하자"는 식입니다.
  • 문제: 하지만 자주 쓰이는 단어들만 추가해도, 여전히 잘게 쪼개진 조각들이 너무 많아서 비용이 줄어들지 않았습니다. 마치 "자주 나오는 '빵' 조각만 추가한다고 해서, '빵'이라는 단어가 여전히 '빵' + '조각' + '조각'으로 나뉘어 있다면 소용없는 것"과 같습니다.

3. 새로운 접근법: "AI 의 뇌를 읽는 해부학" (Interpretability)

이 논문은 **"AI 가 실제로 어떻게 단어를 이해하는지 뇌를 들여다보자"**고 제안합니다.

  • 발견: AI 는 비록 사전에 없는 단어를 입력받아도, 그 단어를 구성하는 작은 조각들을 층층이 쌓아 올리며 마치 하나의 온전한 단어처럼 이해한다는 사실을 발견했습니다.
  • 비유: AI 의 뇌속에는 우리가 모르는 **은밀한 어휘장 (Inner Lexicon)**이 있습니다. "안녕하세요"라는 단어가 10 개의 조각으로 입력되더라도, AI 의 뇌 깊은 곳에서는 이 조각들이 합쳐져서 "안녕하세요"라는 온전한 의미로 작동하고 있었던 것입니다.

이 현상을 **"조각 해체 (Detokenization)"**라고 부릅니다.


4. 해결책: FragMend (조각 수리공)

저자들은 이 '조각 해체' 현상을 이용해 FragMend라는 새로운 방법을 만들었습니다.

🛠️ FragMend 의 두 가지 핵심 전략

  1. 단어뿐만 아니라 '조각'까지 추가하기:

    • 기존 방법 (Tokens2Words) 은 온전한 '단어'만 찾았습니다.
    • FragMend는 "아니, AI 가 '안녕'이나 '하세요' 같은 부분 조각들도 이미 이해하고 있잖아?"라고 생각했습니다. 그래서 온전한 단어뿐만 아니라, 자주 쓰이는 부분 조각 (접두사, 접미사 등) 까지 사전에 추가했습니다.
    • 비유: 빵을 통째로 사지 않고, '빵'이라는 단어의 핵심이 되는 '빵' 조각과 '식빵' 조각까지 미리 준비해 둔 것입니다.
  2. 올바른 초기화 (Embedding Initialization):

    • 새로운 조각을 추가할 때, 무작위로 값을 주지 않고 AI 가 그 조각을 이해할 때 뇌속에서 어떤 신호 (활성화) 를 보냈는지를 그대로 가져와서 초기값으로 설정합니다.
    • 비유: 새로운 직원을 채용할 때, "이 사람은 '안녕하세요'를 말할 때 뇌속에서 어떤 감정을 느끼는지"를 분석해서, 그 감정을 그대로 새 직원의 ID 카드에 심어주는 것입니다.

5. 결과: 더 저렴하고 빠른 AI

이 방법을 적용한 결과:

  • 비용 절감: 비영어권 언어 (특히 라틴 문자가 아닌 언어) 에서 토큰 수가 최대 3 배까지 줄어듭니다.
  • 성능 유지: 비용을 아끼면서도 AI 의 답변 품질 (정확도) 은 거의 떨어지지 않습니다.
  • 효율: 기존 방법보다 훨씬 적은 데이터 (1,000 개의 문장) 로도 큰 효과를 볼 수 있습니다.

📝 한 줄 요약

"AI 가 이미 알고 있는 '조각'들을 찾아내어, 불필요하게 잘게 쪼개진 빵을 통으로 다시 합쳐주니, 비영어권 사용자들도 영어 사용자처럼 저렴하고 빠르게 AI 를 쓸 수 있게 되었습니다."

이 연구는 AI 의 기술적 한계를 '해부학'적으로 분석하여, 더 공정하고 효율적인 AI 시대를 여는 중요한 발걸음이 될 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →