← 최신 논문
💬 NLP

Tokenisation via Convex Relaxations

본 논문은 어휘 구성을 볼록 최적화를 통해 해결 가능한 선형 계획 문제로 공식화하여 내재적 지표와 언어 모델 효율성 측면에서 기존 탐욕적 방법보다 우수한 성능을 발휘하면서도 최적성 근접성에 대한 검증된 경계를 제공하는 새로운 토큰화 알고리즘인 ConvexTok을 소개합니다.

원저자: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

게시일 2026-05-22
📖 4 분 읽기☕ 가벼운 읽기

원저자: Jan Tempus, Philip Whittington, Craig W. Schmidt, Dennis Komm, Tiago Pimentel

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

"Convex Relaxations 를 통한 토큰화"라는 논문에 대한 설명을 쉬운 언어와 창의적인 비유로 제시합니다.

큰 그림: 여행 가방에 짐 싸기

친구에게 보내기 위해 거대한 도서관의 책들을 컴퓨터 메모리라는 단일 여행 가방에 넣으려 한다고 상상해 보세요. 이를 효율적으로 하기 위해서는 **토크나이저 (tokeniser)**가 필요합니다.

인공지능 세계에서는 토크나이저가 일종의 맞춤형 도장 세트와 같습니다. 모든 책의 모든 글자를 하나씩 보내는 것 (느리고 부피가 큼) 대신, 토크나이저는 글자들을 "조각"이나 "토큰"(전체 단어나 일반적인 구절과 같은) 으로 그룹화하여 대신 보냅니다. 목표는 도착했을 때 책들을 완벽하게 재구성할 수 있으면서도, 여행 가방을 가능한 한 작게 만드는 것 (높은 압축률) 입니다.

문제: "탐욕스러운" 짐 싸기

현재 대부분의 AI 모델은 **BPE(바이트 페어 인코딩)**라는 방법을 사용합니다. BPE 는 탐욕스러운 짐 싸기꾼과 같습니다.

  • 작동 방식: 짐 싸기꾼은 책들을 살펴보고, 서로 인접해 나타나는 가장 흔한 두 글자 (예: "t"와 "h") 를 찾아내어 새로운 도장 ("th") 으로 붙이고, 이 과정을 반복합니다.
  • 결함: 짐 싸기꾼은 오직 즉각적인 다음 단계 (지역적으로 최적) 만 보기 때문에, 당장은 도움이 있어 보이는 두 글자를 붙였다가 나중에 여행 가방에 잘 맞지 않는 기이하고 비효율적인 모양을 만들어내는 결과를 초래할 수 있습니다. 그들은 나쁜 전체 결과를 초래하는 일련의 작고 좋은 결정들을 내립니다. 그들은 "큰 그림"을 보기 위해 한 발짝 물러서지 않습니다.

해결책: "건축가" 접근법 (ConvexTok)

이 논문의 저자들인 Jan Tempus 와 동료들은 탐욕스러운 짐 싸기꾼을 사용하는 것을 멈추기로 결정했습니다. 대신 그들은 건축가를 구축했습니다.

그들은 여행 가방을 완벽하게 포장하는 방법을 찾는 것이 컴퓨터가 보통 포기할 정도로 어려운 수학 문제 (NP-hard) 라는 것을 깨달았습니다. 하지만 그들은 **Convex Relaxation(볼록 완화)**이라는 교묘한 트릭을 발견했습니다.

  • 비유: 집을 짓기 위해 산맥에서 가장 낮은 지점을 찾으려 한다고 상상해 보세요. 탐욕스러운 짐 싸기꾼은 작은 계곡에 도달할 때까지 내리막길을 걷다가 그곳이 바닥이라고 생각하며 멈춥니다.
  • 건축가의 트릭: 저자들은 날카로운 산들을 완벽한 매끄러운 그릇 모양 ("볼록"한 형태) 으로 부드럽게 만들었습니다. 이 매끄러운 그릇 안에서는 절대적인 최저점을 찾는 것이 수학적으로 쉽습니다.
  • 결과: 그들은 **선형 계획법 (Linear Program, LP)**이라는 도구를 사용하여 이 부드럽고 쉬운 문제의 버전을 해결했습니다. 이는 완벽한 포장에 대한 "청사진"을 제공했습니다.

함정: 청사진에서 현실로

매끄러운 그릇에서 얻은 청사진에는 문제가 있었습니다. "반 도장"을 사용하라고 제안했다는 것입니다. 예를 들어, "0.7 개의 'th' 도장과 0.3 개의 'ing' 도장을 사용하라"고 말할 수 있습니다. 실제로 반 도장을 찍을 수는 없습니다.

이를 해결하기 위해 그들은 이 숫자들을 전체 도장으로 반올림하는 세 가지 방법을 고안했습니다 (0.7 을 1 로 반올림하는 것처럼):

  1. 결정론적 (Det): 가장 높은 점수를 가진 상위 KK개의 도장만 선택합니다.
  2. 편향된 (Bias): 점수가 약간 낮더라도 짧고 효율적인 도장을 선택합니다.
  3. 정수형 (Int): 청사진이 99% 확신하는 도장만 선택합니다.

그들이 발견한 것 (결과)

팀은 새로운 ConvexTok 방법을 표준적인 탐욕스러운 BPE 방법과 비교하여 테스트했습니다. 다음과 같은 일이 발생했습니다:

  1. 더 나은 포장: ConvexTok 여행 가방들은 BPE 여행 가방들보다 일관되게 더 작았습니다 (더 나은 압축률). 이는 AI 모델들이 더 적은 "토큰"으로 동일한 양의 텍스트를 읽을 수 있음을 의미합니다.
  2. "거의 완벽함" 보장: 그들의 수학에서 가장 멋진 점 중 하나는 "하한 (lower bound)"을 제공한다는 것입니다. 이는 "우리는 완벽한 여행 가방 크기가 적어도 이만큼 작다는 것을 안다"는 증명서와 같습니다. 그들은 ConvexTok 여행 가방들이 그 완벽한 이론적 크기 내에서 1% 이내에 있음을 발견했습니다. 즉, 수학적으로 가능한 것과 거의 같습니다.
  3. AI 성능: 이 새로운 여행 가방들을 사용하여 AI 모델을 훈련시켰을 때:
    • 모델들은 텍스트 이해 능력 (비트 당 바이트로 측정) 에서 약간 더 좋았습니다.
    • 복잡한 추론 작업 (논리 퍼즐 답변 등) 에서는 결과가 엇갈렸습니다. 때로는 ConvexTok 이 더 좋았고, 때로는 BPE 가 더 좋았지만, ConvexTok 은 결코 현저히 나쁘지는 않았습니다.
  4. 안정성: 탐욕스러운 BPE 방법은 매우 안정적입니다. 약간 다른 책들을 주더라도 동일한 도장을 만듭니다. 새로운 ConvexTok 방법은 본인이 보는 특정 책들에 조금 더 민감하여, 훈련 데이터를 변경하면 도장이 약간 변할 수 있습니다.

요약

이 논문은 우리가 너무 오랫동안 AI 에게 읽는 법을 가르치기 위해 "탐욕스러운" 방법을 사용해 왔다고 주장합니다. **볼록 최적화 (convex optimization)**라는 고급 수학을 사용하여 전체 문제를 한 번에 바라봄으로써, 그들은 ConvexTok이라는 새로운 토크나이저를 만들었습니다.

가장 흔한 글자들을 맹목적으로 붙이는 사람에서, 여행 가방의 전체 레이아웃을 한 번에 설계하는 건축가로 전환하는 것과 같습니다. 그 결과는 텍스트를 더 효율적으로 압축하는 방법을 제공하여, 우리가 이러한 AI "여행 가방"을 얼마나 작게 만들 수 있는지에 대한 이론적 한계에 더 가까워지게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →