← 최신 논문
💬 NLP

Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems

이 논문은 현대 AI 시스템에서 우크라이나어를 비롯한 기타 키릴 문자 언어들이 영어에 비해 직면하는 상당한 토큰화 오버헤드를 정량화하며, 이러한 격차가 학습 데이터 할당에서 기인하지만 추론 시 압축 기술이나 균형 잡힌 바이트 수준 BPE 토크나이저 학습을 통해 효과적으로 완화될 수 있음을 입증한다.

원저자: Ivan Dobrovolskyi

게시일 2026-08-25
📖 4 분 읽기☕ 가벼운 읽기

원저자: Ivan Dobrovolskyi

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

컴퓨터가 문장을 읽을 때, 인간처럼 단어를 보는 것이 아닙니다. 대신, 컴퓨터는 텍스트를 '토큰'이라고 불리는 작은 조각들로 나눕니다. 토큰은 기계가 의미를 이해하고 비용을 계산하는 데 사용하는 기본 단위입니다. 영어와 같이 라틴 알파벳으로 쓰인 언어의 경우, 글자 자체가 컴퓨터 메모리에서 차지하는 공간이 매우 적기 때문에 이러한 조각들이 효율적인 경우가 많습니다. 하지만 우크라이나어와 같이 키릴 문자로 쓰인 언어의 경우는 상황이 다릅니다. 이 스크립트에 사용되는 문자들은 디지털 저장 공간을 더 많이 필요로 하며, 인공지능 학습에 사용된 데이터 대부분이 영어이기 때문에, 컴퓨터는 영어 텍스트를 매우 효율적으로 처리하도록 학습된 반면 키릴 문자는 처리하는 데 어려움을 겪습니다. 이는 숨겨진 세금(hidden tax)을 만들어냅니다. 즉, 동일한 양의 정보를 처리하기 위해 컴퓨터는 영어보다 거의 두 배 더 많은 조각으로 문장을 나누어야 할 수도 있으며, 이는 과정을 더 느리고 비싸게 만듭니다.

독립 연구자 이반 도브로볼스키(Ivan Dobrovolskyi)의 최근 연구는 우크라이나어에 초점을 맞추면서도, 키릴 스크립트를 사용하는 다른 많은 언어에도 적용될 수 있는 결론을 도출하며 이러한 격차를 조사합니다. 이 연구는 단순하지만 매우 중요한 질문을 던집니다. 왜 컴퓨터는 이 언어들을 처리하는 데 그토록 어려움을 겪으며, 기술의 전면적인 개편을 기다리지 않고 이를 해결할 수 있는가? 연구는 문제가 단순히 글자의 모양이나 글자가 차지하는 공간의 문제가 아니라, 컴퓨터가 그 글자들을 어떻게 읽도록 배웠느냐에 관한 것임을 시사합니다. 다양한 현대적 시스템들이 텍스트를 어떻게 나누는지 분석함으로써, 연구자는 이 불균형이 학습 데이터 자체에서 비롯된다는 것을 발견했습니다. 컴퓨터는 우크라이나어보다 훨씬 더 많은 영어 텍스트를 보았기 때문에, 우크라이나어에 대한 지름길(shortcuts)을 덜 학습한 것입니다.

문제의 규모를 측정하기 위해, 연구자는 주요 기술 기업들이 사용하는 9가지 서로 다른 상용 시스템을 테스트했습니다. 연구진은 이 시스템들에 수백만 단어의 우크라나어 텍스트를 입력하고, 각 시스템이 생성한 조각의 수를 영어 텍스트를 위해 생성된 조각의 수와 비교했습니다. 결과는 상당한 격차를 보여주었습니다. 가장 현대적인 시스템에서 우크라이나어 텍스트는 영어 텍스트보다 68%에서 121% 더 많은 조각을 필요로 했습니다. 오래된 시스템에서는 그 격차가 더 벌어져 220% 더 많은 조각이 필요했습니다. 이는 영어 텍스트를 처리하는 데 1달러가 들 때마다, 사용자는 컴퓨터가 단어를 나누기 위해 더 많은 작업을 수행해야 하기 때문에 동일한 양의 우크라이나어 텍스트를 처리하는 데 거의 두 배의 비용을 지불할 수도 있다는 것을 의미합니다.

연구는 또한 로마자 표기법(romanization)으로 알려진, 라틴 알파벳으로 전환하는 것이 문제를 해결할 수 있는지 살펴보았습니다. 일부에서는 우크라이나어를 라틴 문자로 쓰면 컴퓨터가 읽기에 더 저렴하고 빨라질 것이라고 제안해 왔습니다. 그러나 연구 결과, 현대적인 시스템에서는 오히려 그 반대임이 밝혀졌습니다. 이러한 시스템들은 이미 우크라이나 웹에 존재하는 고유한 키릴 문자를 효율적으로 처리하는 방법을 학습했기 때문에, 텍스트를 라틴 문자로 강제 변환하면 오히려 컴퓨터를 혼란스럽게 만들었습니다. 이로 인해 텍스트가 더 많은 조각으로 나뉘게 되었고, 일부 시스템에서는 비용이 최대 19%까지 증가했습니다. 컴퓨터는 자신의 학습 데이터에서 가장 자주 본 스크립트로 작동할 때 가장 잘 작동하며, 우크라이나어의 경우 그것은 고유한 키릴 스크립트입니다.

문제를 근본적으로 해결할 수 있는지 이해하기 위해, 연구자는 영어와 우크라이나어를 동등하게 취급하도록 설계된 새로운 맞춤형 시스템을 만들었습니다. 컴퓨터가 영어 중심의 방대한 인터넷으로부터 학습하게 두는 대신, 이 새로운 시스템은 영어와 우크라이나어 텍스트가 완벽하게 균형을 이룬 혼합물로 학습되었습니다. 결과는 놀라웠습니다. 이 균형 잡힌 시스템을 사용했을 때, 효율성의 격차는 극적으로 줄어들었습니다. 우크라이나어 텍스트는 더 이상 두 배의 조각을 필요로 하지 않았습니다. 대신, 영어보다 약 30% 더 많은 조각만을 필요로 했습니다. 이는 높은 비용이 글자 자체의 피할 수 없는 물리적 한계가 아니라, 컴퓨터가 어떻게 학습되었는가의 결과임을 입증합니다. 학습 데이터가 균형을 이루면, 컴퓨터는 두 언어 모두에 대해 효율적으로 학습합니다.

또한 연구는 컴퓨터의 학습을 바꾸지 않고도 비용을 줄이는 방법을 탐구했습니다. 텍스트를 컴퓨터가 읽기 전에 불필요한 단어를 지능적으로 제거하는 기술을 사용하여, 연구진은 우크라이나어 텍스트의 양을 거의 절반으로 줄일 수 있었습니다. 결정적으로, 이러한 압축은 수천 개의 실제 제품과 고객 질문이 포함된 테스트에서 컴퓨터가 정답을 찾는 능력을 해치지 않았습니다. 시스템은 압축되지 않은 전체 텍스트를 사용했을 때와 마찬가지로 정확하게 가격, 등급, 세부 정보를 찾아냈습니다. 이는 학습 불균형이 뿌리 깊은 문제이긴 하지만, 기술이 따라잡는 동안 현재 사용할 수 있는 실질적인 비용 절감 방법이 존재함을 시사합니다.

궁극적으로, 이 연구는 키릴 언어의 비효율성이 스크립트 자체의 내재적 결함이 아니라 데이터 할당의 해결 가능한 문제임을 밝혀냅니다. 컴퓨터는 고장 난 것이 아니라, 단지 자신이 가장 많이 본 데이터에 편향되어 있을 뿐입니다. 학습 데이터에 이러한 과소 대표된 언어들을 더 많이 포함시키거나 스마트한 압축 도구를 사용함으로써, 비용과 속도의 디지털 격차를 좁힐 수 있습니다. 이 연구 결과는 인공지능을 더욱 공평하게 만들기 위한 명확한 경로를 제시하며, 이 강력한 도구들의 혜택이 가장 흔한 스크립트로 글을 쓰는 사람들에게만 국한되지 않도록 보장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →