What Tokens are Learned when Tokenization is Optimized Jointly with Language Modeling?
이 논문은 토큰화를 언어 모델링과 함께 공동 최적화하는 것이 토큰 구조를 근본적으로 변화시킨다는 것을 입증하며, 바이트 수준의 효율성을 우선시하는 H-Net과 달리, 토큰이 없는 접근 방식인 SSLM이 퍼플렉시티를 낮추고 다양한 언어에 걸쳐 경쟁력 있는 다운스트림 성능을 달성하는 형태론적으로 정렬되고 문맥적으로 효율적인 토큰을 학습한다는 점을 밝히고 있다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
인공지능의 세계에서 컴퓨터는 인간처럼 텍스트를 읽지 않습니다. 컴퓨터는 문장을 흐르는 의미의 줄기로 보지 못하고, 이산적인 단위들의 연속으로 봅니다. 언어를 이해하기 위해 이 시스템들은 먼저 단어를 더 작은 조각들로 나누어야 하며, 이 과정을 토큰화(tokenization)라고 부릅니다. 책이 어떻게 쓰였는지에 따라 책 전체가 아니라 개별 장이나 심지어 문단 단위로 도서관을 정리해야 하는 사서라고 상상해 보십시오. 만약 사서가 엉뚱한 곳에서 책을 자른다면, 이야지를 따라가기가 어려워질 것입니다. 수십 년 동안 연구자들은 어디에서 이러한 절단을 할지 결정하기 위해 고정된 규칙을 사용해 왔으며, 이는 종종 특정 철자 조합이 얼마나 자주 함께 나타나는지에 대한 단순한 통계에 의존했습니다. 이러한 규칙들은 충분히 잘 작동하지만, 정적입니다. 일단 설정되면, 컴퓨터가 새로운 언어나 복잡한 방언을 배우더라도 결코 변하지 않습니다. 이는 근본적인 질문을 던집니다. 만약 우리가 이러한 고정된 규칙을 사용하는 것을 멈추고, 대신 컴퓨터가 언어 자체를 배우는 동안 단어를 어떻게 자를지도 스스로 배우게 한다면 어떤 일이 벌어질까요?
IIIT 하이데라바드의 한 연구팀은 언어를 배우면서 토큰화하는 법도 함께 배우는 언어 모델을 구축함으로써 이 질문에 답하고자 했습니다. 그들은 영어와 스웨덴어부터 타밀어, 힌디어, 히브리어에 이르기까지 18가지의 서로 다른 언어를 대상으로 이 '토크나이저 프리(tokenizer-free)' 시스템들을 테스트했습니다. 이 언어들은 단순하고 짧은 단어부터, 조각이 추가될 때마다 의미가 변하는 길고 복잡한 소리의 사슬에 이르기까지 단어가 구성되는 방식의 다양한 범위를 나타내도록 선택되었습니다. 연구진은 이 새로운 학습형 시스템들을 전통적인 고정 방식과 비교했습니다. 그들은 컴퓨터가 스스로 만들어낸 단어 조각들이 어떤 형태인지, 그 조각들이 언어학적으로 의미가 있는지, 그리고 그것이 컴퓨터의 언어 이해를 돕는지 확인하고자 했습니다.
결과에 따르면, 컴퓨터가 단어를 나누는 자신만의 방식을 배울 수 있게 되면 사용된 아키텍처에 따라 매우 다른 두 가지 전략을 개발한다는 것이 밝혀졌습니다. 서브워드 분절 언어 모델(subword segmental language model)로 알려진 한 가지 접근 방식은 언어의 자연스러운 구성 요소와 밀접하게 일치하는 방식으로 단어를 자르는 법을 배웠습니다. 단어가 흔히 어근에 특정 어미를 붙여 형성되는 힌디어와 같은 언어에서, 이 시스템은 어근과 어미를 빠르게 식별하여 명확하게 분리했습니다. 의미가 단어의 끝에 단순히 추가되는 것이 아니라 내부 구조 속에 엮여 있는 히브리어의 경우, 시스템은 이러한 내부 패턴을 인식하는 법을 배웠습니다. 이 방식은 인간이 언어의 문법과 구조를 이해하는 방식과 잘 부합하는, 언어학적으로 의미 있는 토큰을 생성했습니다.
반면, H-Nets라고 불리는 다른 접근 방식은 훨씬 더 실용적인 경로를 택했습니다. 언어적 구성 요소를 찾으려 노력하는 대신, 이 시스템은 전적으로 효율성에 집중했습니다. 이 시스템은 데이터 처리에 필요한 단계 수를 최소화하기 위해 때로는 전체 구절에 달하는 매우 긴 텍ant 덩어리를 만드는 법을 배웠습니다. 이러한 덩어리들은 실제 단어의 문법이나 의미와는 거의 관련이 없었습니다. 예를 들어, 복잡한 문자를 사용하는 언어에서 이 시스템은 다른 어떤 방식보다도 현저히 긴 토큰을 생성했는데, 이는 단어 구조의 명확성보다 처리 속도를 우선시했기 때문입니다. 이는 시스템을 계산적으로 효율적으로 만들었지만, 결과적으로 인간이나 전통적인 알고리즘이 단어를 나누는 표준적인 방식과는 전혀 닮지 않은 어휘를 만들어냈습니다.
연구는 또한 이러한 시스템이 학습하는 방식이 처리하는 언어의 유형에 따라 달라진다는 것을 보여주었습니다. 단어가 많은 작은 부분들을 엮어서 만들어지는 언어의 경우, 학습 과정은 더 역동적이고 변동이 심했습니다. 시스템은 단어를 자르는 다양한 방식을 시도하며, 때로는 완벽한 분할 지점을 찾았다가 다시 그곳에서 벗어난 뒤, 최종적으로 효율성과 의미 사이의 균형을 맞춘 해결책에 안착했습니다. 더 단순한 언어의 경우, 시스템은 단어를 자르는 안정적인 방법을 매우 빠르게 찾아내어 그것을 고수했습니다. 이는 언어 자체의 복잡성이 컴퓨터가 토큰화를 학습하는 방식을 형성한다는 것을 시사합니다.
연구진이 이러한 새로운 토큰화 방법들을 문장의 감정을 식별하거나 사람 및 장소의 이름을 찾는 것과 같은 실제 작업에서 테스트했을 때, 결과는 고무적이었습니다. 비록 컴퓨터가 표준 모델에서 사용하는 것과는 완전히 다른 어휘를 학습했음에도 불구하고, 시스템은 이러한 작업에서 대등하거나 어떤 경우에는 더 나은 성능을 보였습니다. 언어의 자연스러운 구조와 일치하도록 학습한 시스템은 문장에서 다음 단어를 예측할 때 컴퓨터가 느끼는 혼란을 지속적으로 줄여주었습니다. 이는 컴퓨터가 자신만의 토큰화 전략을 배우게 하는 것이 고정된 규칙이 놓칠 수 있는 의미 있는 패턴을 발견할 수 있게 해준다는 것을 나타냅니다.
궁극적으로, 이 연구는 컴퓨터를 위한 단어 분할에 있어 단 하나의 '최선'의 방법은 존재하지 않는다는 것을 보여줍니다. 최적의 방법은 시스템이 무엇을 달성하려고 하는지에 달려 있습니다. 만약 목표가 언어의 깊은 구조를 이해하는 것이라면, 모델이 스스로 분절 방식을 배우게 함으로써 인간의 언어적 직관을 반영하는 토큰을 얻을 수 있습니다. 만약 목표가 가공되지 않은 처리 속도라면, 모델은 언어적 명확성을 희생하면서 효율성을 위해 완전히 다른 더 긴 덩어리들을 만들어낼 수도 있습니다. 이러한 공동 학습 접근 방식이 인간이 설계한 규칙 없이도 효과적이고 의미 있는 어휘를 생성할 수 있음을 보여줌으로써, 이 연구는 인간 언어의 다양한 다양성을 다룰 수 있는 더 적응력 있고 언어적으로 인지 능력이 뛰어난 인공지능 시스템으로 가는 문을 열어줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.