← 최신 논문
💬 NLP

FLEXITOKENS: Flexible Tokenization for Evolving Language Models

이 논문은 고정된 토크나이저의 경직성을 극복하기 위해 학습 가능한 경계 예측기를 단순화된 학습 목적 함수와 함께 활용하는 바이트 수준 언어 모델을 위한 유연한 토크나이징 방법인 FLEXITOKENS 를 소개하며, 이를 통해 과도한 분할을 줄이고 다양한 언어와 작업에서 최대 10% 의 성능 향상을 달성합니다.

원저자: Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

게시일 2026-05-14
📖 3 분 읽기☕ 가벼운 읽기

원저자: Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 세상을 읽고 이해하도록 가르친다고 상상해 보세요. 이를 위해 로봇은 문장을 "토큰"이라고 불리는 더 작고 관리 가능한 조각들로 분해해야 합니다. 토큰은 벽을 쌓는 건축가가 사용하는 벽돌과 같습니다.

오랫동안 로봇은 매우 경직된 벽돌 세트를 사용해 왔습니다. 이러한 벽돌은 고정된 규칙서에 기반하여 "un-", "do", "able"과 같은 특정 형태로 미리 잘려 있었습니다. 이는 로봇이 원래 훈련받은 언어와 주제에는 매우 잘 작동했습니다. 하지만 로봇이 의학 저널, 코딩 매뉴얼, 또는 전혀 본 적 없는 언어와 같은 새로운 내용을 읽으려 시도하는 순간, 이러한 경직된 규칙서는 문제를 일으킵니다.

문제: "일률적"인 벽돌

이 논문은 이 문제를 **과도한 분할 (over-fragmentation)**이라고 부릅니다.

긴 연속적인 텍스트 리본으로 벽을 쌓으려 한다고 상상해 보세요. 만약 규칙서가 "하이픈이 보일 때마다 리본을 자르라"고 말한다면, "hypertrophic"(의학적 용어) 과 같은 단일 단어가 "hyper", "tro", "phic"과 같이 작고 쓸모없는 조각들로 잘려버릴 수 있습니다.

  • 결과: 로봇은 벽을 쌓기 위해 너무 많은 작은 벽돌을 운반해야 합니다. 이는 시공을 느리게 만들고 (컴퓨팅 파워 측면에서) 비용이 많이 들며 혼란을 야기합니다. 로봇은 잘게 부숴진 작은 조각들을 보느라 바빠서 전체 단어의 의미를 잃어버립니다.
  • 구식 방식: 전통적인 방법 (예: BPE) 은 로봇이 시공을 시작하기 전에 모든 벽돌을 미리 잘라내는 공장과 같습니다. 일단 벽돌이 잘리면, 나중에 로봇이 다른 종류의 집을 짓더라도 그 벽돌은 변경할 수 없습니다.

해결책: FLEXITOKENS

이 논문의 저자인 FLEXITOKENS는 더 지능적인 방식을 제안합니다. 미리 잘린 벽돌을 사용하는 대신, 로봇이 시공 하는 동안 리본을 자르는 방법을 학습하는 지능적이고 유연한 절단기를 제공합니다.

간단한 비유를 들어 그들이 어떻게 했는지 살펴보겠습니다.

  1. 구식 규칙 ("고정 압축"의 함정):
    로봇이 스스로 벽돌을 자르게 하려는 이전 시도들은 엄격한 규칙을 사용했습니다: "텍스트 10 인치당 정확히 3 개의 벽돌이 나오도록 리본을 자르라."

    • 결함: 만약 텍스트가 터키어와 같이 단어가 본질적으로 긴 언어라면, 3 개 벽돌 규칙을 강요하면 하나의 단어가 작고 무의미한 조각들로 잘릴 수 있습니다. 반면, 중국어와 같이 단어가 짧은 언어라면 동일한 규칙이 서로 다른 두 단어를 하나의 혼란스러운 덩어리로 붙여버릴 수 있습니다. 이 규칙은 텍스트의 특정 "형태"에 적응하기에는 너무 경직되어 있었습니다.
  2. 신규 규칙 (FLEXITOKENS):
    FLEXITOKENS 는 규칙을 유연한 범위로 변경합니다. "정확히 3 개의 벽돌을 가져야 한다"고 말하는 대신, "이 특정 문장에 무엇이 적합한지에 따라 2 개에서 4 개 사이의 벽돌을 가질 수 있다"고 말합니다.

    • "힌지 (Hinge)" 손실: 이 논문은 안전 지대 역할을 하는 특별한 학습 방법 ("힌지형 손실") 을 도입합니다. 로봇이 텍스트를 안전 범위 내의 조각 수로 잘랐다면, 로봇은 "면제"를 받아 페널티를 받지 않습니다. 이는 로봇이 유연하게 행동할 수 있게 합니다. 로봇은 긴 의학 용어를 하나의 크고 의미 있는 벽돌로 남기거나, 짧은 문장을 이해하는 데 도움이 되는 한 많은 작은 벽돌로 잘라낼 수 있습니다.

시도했을 때 어떤 일이 일어났나요?

연구자들은 이 새로운 유연한 절단기를 영어, 스페인어, 러시아어, 힌디어, 텔루구어 등 다양한 언어와 의학 및 코딩과 같은 다양한 주제에 대해 테스트했습니다.

  • 덜 messy 해짐: 로봇은 불필요하게 단어를 잘라내는 것을 멈췄습니다. 예를 들어, 의학 텍스트에서 "hypertrophic"을 쓰레기 조각으로 분해하는 대신 하나의 일관된 단위로 유지하도록 학습했습니다.
  • 더 빠르고 똑똑해짐: 로봇이 작고 부서진 벽돌을 덜 운반해야 했기 때문에 정보를 더 빠르게 처리하고 컴퓨터 메모리를 덜 사용했습니다.
  • 더 나은 성능: 번역 및 문장 이해와 같은 작업에서 유연한 절단기를 가진 로봇은 구식 경직된 방법을 사용하는 로봇보다 더 잘 수행했습니다. 우르두어와 같이 본 적 없는 언어조차도 작고 혼란스러운 조각으로 분해하지 않고 훨씬 더 잘 처리했습니다.

핵심 요약

FLEXITOKENS를 생각해보세요. 이는 로봇을 미리 잘린 플라스틱 장난감 벽돌 세트에서 사용하는 것에서, 그 순간 무엇을 짓고 있든 완벽한 크기와 모양의 벽돌을 인쇄할 수 있는 지능형 3D 프린터를 사용하는 것으로 업그레이드하는 것과 같습니다.

고정된 규칙을 강요하는 대신 로봇이 문맥에 기반하여 단어를 어떻게 분해할지 결정하게 함으로써, 이 논문은 언어 모델이 더 효율적이 되고, 새로운 언어를 더 잘 처리하며, "과도하게 잘린" 텍스트에 혼란을 느끼지 않고 의학 같은 복잡한 주제를 이해할 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →