← 최신 논문
💬 NLP

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty

본 논문은 25 개 유럽 언어에 걸쳐 '토크나이저 세금'을 정량화하여, 사전 학습 데이터에서의 과소 표현으로 인해 비영어권 언어, 특히 우크라이나어와 복잡한 형태론을 가진 언어들이 단어 대비 토큰 비율이 현저히 높음을 밝히고, 이러한 생식력 순위가 도메인 간에 일관되게 유지되며 퓨샷 효과가 언어 의존적이 아닌 모델 고유의 것임을 입증합니다.

원저자: Volodymyr Ovcharov

게시일 2026-05-26
📖 4 분 읽기☕ 가벼운 읽기

원저자: Volodymyr Ovcharov

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

택시 요금을 지불한다고 상상해 보세요. 영어에서는 택시가 "단어" (stop) 단위로 요금을 청구하지만, 우크라이나어에서는 택시 기사가 "절편" (step, 단어의 아주 작은 조각) 단위로 요금을 청구하려 고집합니다. 우크라이나어 단어는 종종 더 길고 복잡하기 때문에, 기사는 같은 목적지에 도달하기 위해 훨씬 더 많은 걸음을 내딛어야 합니다. 거리는 변하지 않았음에도 불구하고, 당신은 정확히 같은 이동에 대해 두 배나 더 많은 요금을 치르게 됩니다.

볼로디미르 오브차로프가 쓴 이 논문은 AI 를 사용할 때 비영어권 언어에 부과되는 그런 숨겨진 "세금"에 관한 것입니다. 여기 간단한 비유를 통해 그들이 발견한 내용을 정리해 보겠습니다.

1. "절편" 세금 (토크나이저 비옥도)

AI 모델은 인간처럼 전체 단어를 읽지 않습니다. 대신 텍스트를 토큰이라고 불리는 작은 조각으로 잘라냅니다.

  • 비유: 단어를 빵 한 덩어리라고 생각하세요.
    • 영어: AI 는 빵을 크고 두툼한 조각으로 잘라냅니다. 한 단어를 표현하는 데 1.2 조각만 필요합니다.
    • 우크라이나어: AI 는 둔한 칼을 사용하여 같은 빵을 작고 부서지기 쉬운 조각으로 잘라냅니다. 한 단어를 표현하는 데 2.7 조각이 필요합니다.
  • 비용: AI 회사들이 "조각" (토큰) 당 요금을 청구하기 때문에, 동일한 양의 텍스트에 대해 우크라이나어로 말하는 것은 영어로 말하는 것보다 약 2.2 배 더 비쌉니다.
  • 계층: 이 논문은 25 개 유럽 언어를 측정했습니다.
    • 저렴한 그룹: 영어, 스페인어, 프랑스어 (단어당 1.2~1.7 조각).
    • 중간 그룹: 독일어, 네덜란드어 (1.7~1.9 조각).
    • 비싼 그룹: 폴란드어, 체코어 같은 슬라브어군 (2.2~2.5 조각).
    • 가장 비싼 그룹: 우크라이나어, 그리스어, 몰타어 (약 3.1 조각).

2. "우크라이나어 페널티"

연구자들은 우크라이나어에 대해 놀라운 사실을 발견했습니다. 우크라이나어, 폴란드어, 체코어는 모두 유사한 단어 구조를 가진 슬라브어족의 친척들이지만, 우크라이나어는 처리하는 데 훨씬 더 비쌉니다.

  • 비유: 두 개의 동일한 공장을 상상해 보세요. 한 공장 (폴란드어) 은 오랫동안 건설해 왔기 때문에 미리 잘려진 벽돌이 잘 구비되어 있습니다. 다른 공장 (우크라이나어) 은 과거에 무시받았기 때문에 모든 벽돌을 원석에서 직접 잘라내야 합니다.
  • 원인: 이 논문은 AI 의 "도서관"에서 우크라이나어의 학습 데이터가 폴란드어나 체코어에 비해 2~6 배 적다고 보여줍니다. AI 가 우크라이나어 단어를 덜 접했기 때문에, 이를 효율적으로 그룹화하는 방법을 모릅니다. 그래서 계속 비효율적인 작은 조각으로 잘라냅니다.

3. "일률적" 칼

이 논문은 이 "세금"이 주제 (예: 법적 계약서 vs 뉴스 vs 위키백과) 에 따라 달라지는지 테스트했습니다.

  • 발견: 중요하지 않습니다. 어떤 AI 가 "저렴"하고 어떤 AI 가 "비싼지"에 대한 순위는 축구, 법률, 역사를 논하는지 여부와 관계없이 정확히 동일하게 유지됩니다.
  • 교훈: 한 가지 유형의 텍스트로 AI 를 테스트하면, 다른 모든 유형의 텍스트에 대해 비용이 얼마나 들지 정확히 알 수 있습니다. 매번 다시 테스트할 필요가 없습니다.

4. "마법" (퓨샷 학습)

AI 는 때로 몇 가지 예시만 보여줌으로써 (예: 샘플 질문과 답변을 보여줌) 새로운 작업을 학습할 수 있습니다. 연구자들은 이 "마법"이 언어마다 다르게 작동하는지 테스트했습니다.

  • 발견: 이 마법은 언어에 관한 것이 아니라 AI 의 성격 (설계) 에 관한 것입니다.
    • 일부 AI(예: "Nemotron") 는 텍스트가 우크라이나어, 폴란드어, 러시아어인지와 상관없이 예시를 보여줄 때 더 똑똑해집니다.
    • 다른 AI(예: "Maverick") 는 예시를 보여줄 때 오히려 바보가 되며, 이 역시 언어와 무관합니다.
  • 교훈: AI 의 혼란을 언어 탓으로 돌리지 마세요. AI 의 설계 탓입니다. 만약 AI 가 영어 예시로 실패한다면, 우크라이나어 예시에서도 실패할 가능성이 높습니다.

5. 왜 일부 AI 는 더 잘 자르는가

연구자들은 서로 다른 AI 가 단어를 어떻게 자르는지 내부 구조를 살펴봤습니다.

  • 잘 자르는 AI: 일부 AI(예: Gemma 2) 는 우크라이나어 단어를 자연스러운 "형태소" 경계 (어근과 어미와 같은 단어의 의미 있는 부분) 에서 잘라냅니다. 이는 효율적입니다.
  • 잘못 자르는 AI: 다른 AI(예: Qwen3) 는 무작위 지점에서 단어를 잘라내며, 때로는 하나의 의미 있는 부분을 반으로 나누기도 합니다. 마치 빵 사이가 아니라 피클 한가운데를 잘라 샌드위치를 자르는 것과 같습니다.
  • 놀라운 사실: 더 큰 사전 (어휘) 을 가지고 있다고 해서 더 잘 자른다는 보장은 없습니다. 일부 AI 는 학습 데이터에 올바른 자르기 방법을 배울 만큼 충분한 우크라이나어 예시가 부족했기 때문에, 거대한 사전에도 불구하고 우크라이나어 단자를 작고 비효율적인 조각으로 잘라냈습니다.

권장 사항 요약

이 논문은 우크라이나어나 유사한 언어를 사용하는 AI 사용자를 위한 세 가지 간단한 규칙을 제안합니다:

  1. 세금을 예상하세요: 우크라이나어가 영어보다 약 두 배 더 비쌀 것이라는 사실을 예산에 반영하세요.
  2. 한 번만 테스트하세요: "세금"을 한 번만 측정하면 되며, 이는 모든 주제에 적용됩니다.
  3. 예시에 주의하세요: AI 에게 예시를 보여주는 것이 도움이 될 것이라고 가정하지 마세요. 일부 모델의 경우 오히려 성능을 저하시킬 수 있으며, 이는 모든 언어에서 발생합니다.

결론: 현재 AI 세계는 영어 편향으로 구축되어 있습니다. 학습 데이터의 "도서관"이 균형을 이루기 전까지는 우크라이나어와 같은 언어들이 이해받기 위해 숨겨진 "절편 세금"을 지불해야 할 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →