← 최신 논문
💬 NLP

SuTRA : Structurally-Unified Tokenization with Root Awareness

이 논문은 기존 방식의 "형태론적 파편화(Morphological Shattering)"를 극복하기 위해 어근-접사 구조와 악샤라(akshara)의 불가분성을 보존하도록 설계된 인도 언어용 형태론 인지 토큰화 알고리즘인 SuTRA를 소개하며, 이는 형태론적 정렬, 의미론적 회복력, 그리고 기계 번역 성능의 유의미한 향상을 결과로 가져온다.

원저자: Vaibhav Rathore, Siddhant Gole, Dadhichi Telwadkar, Rooshil Bhatia, Maulik Ruparel, Siddharth Surekha, Neha Bhargava

게시일 2026-08-20
📖 4 분 읽기☕ 가벼운 읽기

원저자: Vaibhav Rathore, Siddhant Gole, Dadhichi Telwadkar, Rooshil Bhatia, Maulik Ruparel, Siddharth Surekha, Neha Bhargava

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인간의 언어를 이해하는 현대의 컴퓨터는 우리와 같은 방식으로 단어를 읽지 않는다. 그들은 문장을 흐르는 의미의 줄기로 보는 대신, 작고 분절된 조각들의 긴 목록으로 본다. 이를 작동시키기 위해 엔지니어들은 먼저 모든 문장을 이러한 아주 작은 파편들로 나누어야 하며, 이 과정을 토큰화(tokenization)라고 부른다. 수십 년 동안 이 작업을 수행하는 표준적인 방법은 순수하게 통계적이었다. 컴퓨터는 방대한 텍스트 라이브러리를 살펴보고 특정 글자 조합이 얼마나 자주 함께 나타나는지를 계산한다. 만약 두 글자나 작은 글자 집단이 매우 빈번하게 함께 나타나면, 컴퓨터는 그것들을 하나의 단위로 묶기로 결정한다. 이 방식은 데이터를 압축하는 데 탁월하여 컴퓨터가 방대한 양의 텍스트를 빠르게 처리할 수 있게 해준다. 그러나 이는 언어를 의미의 구조적인 체계라기보다 무작위 글자들의 주머니처럼 취급한다. 접두사나 접미사를 붙일 때 어근이 어떻게 변하는지와 같은 언어의 깊은 규칙을 무시하는 것이다. 이러한 사각지대는 구조적 규칙이 풍부한 언어들, 특히 표준적인 컴퓨터 방식이 흔히 존중하지 못하는 방식으로 복잡한 음절과 문법적 표식들을 결 조합하여 단어를 형성하는 인도의 많은 언어들에게 큰 문제가 된다.

모티랄 오스왈 금융 서비스(Motilal Oswal Financial Services)와 인도 공과대학교 봄베이(IIT Bombay)의 연구진은 이 문제를 해결하기 위해 SuTRA라고 불리는 새로운 접근 방식을 개발했다. 그들은 표준적인 통계적 방법이 종종 단어를 의미를 파괴하는 방식으로 쪼개버린다는 점에 주목했다. 그들은 이 파괴적인 현상을 "형태소 분쇄(morphological shattering)"라고 명명했다. 핵심 의미와 문법적 어미로 구성된 단어를 상상해 보라. 표준적인 컴퓨터는 핵심 의미의 중간을 가로질러 단어를 분리함으로써 시작 부분이나 끝 부분을 핵심 의미로부터 분리하거나, 혹은 접두사를 어근에 결합하여 그들의 뚜렷한 역할을 모호하게 만들 수도 있다. 이는 특히 인도의 언어들에게 치명적인데, 이 언어들은 자음과 의존 모음이 하나의 결합된 시각적 단위인 '악샤라(akshara)'를 형성하는 스크립트를 사용하기 때문이다. 표준적인 토크나이저는 이러한 단위를 분리하여 모음을 속한 자음으로부터 떼어놓기도 하며, 단어의 어근과 문법적 부착물 사이의 경계를 무시하기도 한다. 그 결과, 컴퓨터가 단어의 진정한 의미적 핵심을 이해하는 데 어려움을 겪게 만드는 파편화된 표현이 발생하며, 이는 기계가 효과적으로 학습하거나 번역하는 것을 어렵게 만든다.

이를 해결하기 위해 연구팀은 언어의 자연스러운 구조를 존중하는 새로운 알고리즘을 만들었다. 단순히 글자가 얼마나 자주 함께 나타나는지에 따라 컴퓨터가 단어를 나누도록 내버려 두는 대신, 그들은 시스템이 언어의 구성 요소를 먼저 인식하도록 가르쳤다. 그들은 힌디어, 마라티어, 구자라트어를 위한 새롭고 검증된 데이터셋을 만드는 것부터 시작했다. 이것은 단순한 단어 목록이 아니었다. 그것은 단어의 어근이 어디서 시작하고 끝나는지, 그리고 문법적 표식이 어디에 붙는지 보여주는 상세한 지도였다. 기존의 자원들이 불완전하거나 불완전한 규칙에 의존했기 때문에, 연구진은 대규모 언어 모델을 사용하여 분할을 검증하고 수정함으로써 모든 단어가 실제 언어적 어근에 따라 정확히 나누어지도록 보장했다. 이 골드 스탠다드 데이터셋은 새로운 토크나이저를 훈련시키는 토대가 되었다.

새로운 방식인 SuTRA는 두 단계로 작동한다. 첫째, 텍젝트를 살펴보고 글자들을 자연스럽고 분리할 수 없는 음절 단위로 그룹화하여, 모음이 수식하는 자음으로부터 결코 분리되지 않도록 보장한다. 또한 검증된 데이터셋을 바탕으로 어근이 끝나고 문법적 접미사가 시작되는 경계를 표시한다. 둘째 단계에서, 시스템은 이 단위들을 결합하여 어휘를 구축하지만, 결정적인 차이점이 있다. 바로 방금 식별한 경계를 가로질러 병합하는 것이 금지된다는 점이다. 만약 컴퓨터가 언어적 구조를 위반하는 방식으로 접두사를 어근에 붙이려고 시도하면, 시스템은 그 움직임에 벌점을 부여한다. 이는 컴퓨터가 유효한 어근을 먼저 학습하도록 강제하며, 다른 부분들과 결합하기 전에 어근을 견고하고 깨뜨릴 수 없는 블록으로 취급하게 한다. 이를 통해 컴퓨터가 언어를 이해하는 데 사용하는 최종 조각들이 항상 완전하고 의미 있는 어근을 포함하도록 보장한다.

이러한 구조적 접근 방식의 결과는 상당했다. 표준적인 방법들과 비교했을 때, 새로운 토크나이저는 단어를 온전하게 유지하는 능력이 훨씬 뛰어났다. 힌디어에서, 이 방식은 컴퓨터의 단어 조각들과 실제 언어적 어근 사이의 정렬을 거의 15% 개선했다. 마라티어에서는 그 개선 정도가 더욱 두드러져, 컴퓨터가 파편으로부터 원래의 의미를 회복하는 능력 측면에서 34% 이상에 달했다. 이러한 구조적 명확성은 실질적인 작업 성능으로 직결되었다. 연구진이 새로운 토크나이저를 사용하여 힌디어와 마라티어 간의 기계 번역 시스템을 훈련시켰을 때, 번역의 품질이 눈에 띄게 향상되었다. 이 시스템은 기존의 순수 통계적 방법을 사용하는 시스템보다 오류가 적었고 언어의 뉘앙스를 더 정확하게 포착했다. 또한, 새로운 토크나이저는 더 견고하다는 것이 증명되었다. 입력 텍스트에 작은 오타나 미세한 철자 변형이 포함되어 있을 때, 새 시스템은 단어의 어근에 대한 무결성을 유지한 반면, 기존 시스템은 종종 오타를 단어를 완전히 재분할하라는 신호로 취급하며 무너졌다.

연구진은 또한 이 접근 방식이 효율성을 희생하지 않는다는 것을 입증했다. 새로운 방식은 언어적으로 정확성을 보장하기 위해 일부 단어에 대해 약간 더 많은 조각을 생성했지만, 컴퓨터의 속도를 늦출 정도로 과도한 수의 파편을 만들지는 않았다. 시스템은 언어의 구조에 대한 훨씬 깊은 이해를 달면서도 관리 가능한 수준의 어휘 크기를 유지했다. 단순한 빈도수 계산보다 언어의 자연스러운 경계를 우선시함으로써, 연구진은 인공지능에게 인간의 언어 논을 존중하도록 안내하는 것이 가능하다는 것을 보여주었다. 이 연구는 복잡한 구조를 가진 언어의 경우, 더 나은 인공지능으로 가는 길은 단순히 컴퓨터에 더 많은 데이터를 먹이는 것이 아니라, 언어를 단순한 글자의 혼란스러운 흐름이 아닌 어근과 부착물의 일관된 체계로서 보는 법을 가르치는 데 있다는 것을 시사한다. 이 발견은 기계가 세계의 가장 언어적으로 다양한 언어들을 다루는 방식을 개선하기 위한 실질적인 청사진을 제공하며, 기술이 언어의 구조를 파괴하는 것이 아니라 언어의 구조를 따르도록 보장한다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →