Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
원저자: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
원저자: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. ✨ 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
기술 요약: 토큰화 다중성으로 인한 LLM-as-a-service의 임의적 가격 변동
1. 문제 정의
본 논문은 서비스형 대규모 언어 모델(LLM-as-a-service)의 경제학에서 매우 중요하지만 간과되어 온 문제를 다룬다. 현재 제공업체들은 주로 사용자가 생성된 토큰당 고정된 가격을 지불하는 토큰당 과금 모델을 채택하고 있다. 표준적인 가정은 동일한 입력 프롬프트가 동일한 출력 문자열을 생성한다면 동일한 비용이 발생해야 한다는 것이다.
그러나 저자들은 **토큰화 다중성(tokenization multiplicity)**으로 인해 이러한 가정이 결함이 있음을 입증한다. LLM이 (문자 단위로 동일한) 정확히 같은 출력 문자열을 생성하더라도, 그 기저에 있는 토큰 시퀀스는 다를 수 있다. 가격 책정이 문자 수가 아닌 토큰 수에 기반하기 때문에, 이러한 서로 다른 토큰화는 동일한 출력에 대해 임의적인 가격 변동을 초래한다. 이 현상은 비영어권 언어에서 특히 빈번하게 나타나며, 독점 모델과 오픈 웨이트 모델 모두에서 영향을 미친다.
2. 방법론
실증적 조사
저자들은 세 가지 자연어 작업인 번역, 철자 검사, **재구문(rephrasing)**에 대해 광범위한 실증 연구를 수행했다.
- 설정: 저자들은 짧은 위키피디아 텍스트를 사용하여 각 작업당 100개의 입력 프롬프트를 구성했다. 번역의 경우 영어-5개 대상 언어 쌍을 테스트했으며, 철자 검사와 재구문의 경우 6개 언어를 테스트했다.
- 실행: 동일한 작업을 요청하는 서로 다른 사용자를 시뮬레이션하기 위해, 각 프롬프트를 동일한 파라미터와 서로 다른 랜덤 시드를 사용하여 LLM에 100번씩 입력했다.
- 모델: 연구에는 독점 모델(GPT-4o-mini, GPT-4.1, GPT-5-mini, Gemini, Claude)과 오픈 웨이트 모델(Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct)이 포함되었다.
- 측정: 저자들은 디코딩된 문자열은 동일하지만 토큰 길이가 다른 출력 쌍을 식별했다. 이 현상의 발생 확률과 그로 인한 가격 변동의 크기를 측정했다.
이론적 분석
논문은 **정준 토큰화(canonical tokenization)**를 LLM의 훈련 과정 중(인코더에 의해 결정됨) 해당 문자열이 받는 유일한 토큰화로 정의한다. 저자들은 비정준(non-recovering) 토크나이저에 관한 핵심적인 이론적 결과를 증명한다:
- 정리: BPE, Unigram, Wordpiece 토크나이저의 경우, 부분 토큰 시퀀스가 비정준(non-canonical)이라면, 해당 시퀀스의 모든 확장(더 많은 토큰을 추가하는 것) 또한 비정준이 된다.
- 시사점: 모델이 정준 출력을 생성하려면 매 단계마다 정준 부분 시퀀스를 생성해야 한다. 이 속성은 제약된 생성 전략을 가능하게 한다.
제안된 해결책: 정준 생성(Canonical Generation)
가격 변동을 제거하기 위해, 저자들은 LLM이 어떤 출력 문자열에 대해서도 오직 정준 토큰화만을 생성하도록 제한하는 제약 생성 방법인 정준 생성을 도입한다.
- 알고리즘: 저자들은 Gumbel-Max 트릭에 기반한 효율적인 샘플링 알고리즘을 제안한다.
- 모든 어휘 토큰의 정준 여부를 확인하기 위해 새로운 확률 분포를 명시적으로 계산하는 대신, 알고리즘은 각 토큰에 대해 Gumbel 노이즈를 샘플링한다.
- 섭동(perturbed)된 로그 확률에 따라 토큰의 순위를 매긴다.
- 순위가 매겨진 토큰들을 반복하며, 현재 시퀀스에 추가했을 때 정준 시퀀스를 결과하는 첫 번째 토큰을 선택한다.
- 이 접근 방식은 비정준 토큰의 확률 질량을 남은 정준 토큰들로 효과적으로 재분배하며, 값비싼 정규화 과정을 거치지 않는다.
3. 주요 결과
토큰화 다중성
- 보편성: 토큰화 다중성은 테스트된 모든 모델과 작업에서 관찰되었다. 오픈 웨이트 모델(Llama, Qwen)의 경우 세 가지 작업 모두에서 규칙적으로 나타났다. 독점 모델 또한 이 문제를 보였으나 빈도는 다양했다.
- 언어 의존성: 이 현상은 영어에 비해 소수 언어(예: 터키어, 스와힐리어)에서 훨씬 더 빈번하게 나타난다. 예를 들어, 번역 작업에서 터키어와 스와힐리어 프록시의 경우 최대 7%의 프롬프트가 동일한 문자열임에도 불구하고 서로 다른 토큰 길이를 가졌다.
- 가격 변동: 다중성이 발생할 때 가격 차이는 상당할 수 있다. 저자들은 동일한 출력 문자열에 대해 가장 짧은 토큰화와 가장 긴 토큰화 사이의 상대적 가격 차이가 최대 **15%**에 달함을 관찰했다.
- 긴 출력: 긴 텍스트에서는 토큰화 오류가 전파되는 경향이 있다. 단어가 비정준 토큰화로 생성되면, 이후 해당 단어의 출현 역시 동일한 비정준 패턴을 따르는 경우가 많아 가격 차이를 심화시킨다.
정준 생성 성능
- 이론적 보장: 저자들은 정준 생성을 통해 생성된 토큰 시퀀스의 분포가 표준 생성보다 훈련 중에 관찰된 시퀀스의 실제 분포에 (KL-divergence 측면에서) 증명 가능한 수준으로 더 가깝다고 증명한다.
- 실증적 성능: 번역, 철자 검사, 재구문 및 MGSM(다국어 수학) 벤치마크 실험 결과, 정준 생성은 다음 측면에서 표준 생성과 유사한 수준임을 보여주었다:
- 품질: 번역 품질 점수, 편집 거리(edit distance), 코사인 유사도 등의 지표에서 무시할 만한 차이(종종 오차 범위 내)를 보였다.
- 실행 시간: 토큰당 소요 시간이 미미하게 증가했을 뿐이다(예: 0.019초에서 0.020초로). 이는 Gumbel-Max 기반 샘플링 알고리즘의 효율성을 입증한다.
- 비정준 비율: 표준 생성은 모델과 작업에 따라 6%에서 29% 사이의 사례에서 비정준 출력을 생성했으나, 정준 생성은 설계에 따라 이 비율을 0%로 줄였다.
4. 의의 및 주장
본 논문은 토큰화 다중성이 LLM-as-a-service에서 임의적이고 바람직하지 않은 가격 변동을 초래한다는 최초의 실증적 근거를 제공한다고 주장한다(제공업체가 "충실"하더라도, 즉 의도적으로 토큰 수를 조작하지 않더라도 발생하는 문제임).
- 경제적 영향: 이 연구 결과는 페이-퍼-토큰(pay-per-token) 모델의 공정성에 의문을 제기하며, 사용자가 확률적 토큰화 변동으로 인해 동일한 가치(텍스트)에 대해 서로 다른 금액을 청구받을 수 있음을 보여준다.
- 기술적 기여: 정준 생성의 도입은 모델 성능이나 지연 시간을 크게 희생하지 않으면서 이러한 가격 변동을 제거하는 실질적인 해결책을 제공한다.
- 이론적 통찰: BPE, Unigram, Wordpiece가 비정준(non-recovering)이라는 증명은 왜 비정준 시퀀스가 발생하는지, 그리고 이를 단계별 제약을 통해 어떻게 방지할 수 있는지에 대한 기초적인 이해를 제공한다.
저자들은 정준 생성이 샘플링 공간을 약간 제한할 수는 있지만(특정 제약 시나리오에서 성능이 미세하게 낮아질 가능성), 높은 품질의 출력을 유지하면서도 임의적인 가격 책정 문제를 효과적으로 해결한다고 결론짓는다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.
매주 최고의 NLP 논문을 받아보세요.
스탠포드, 케임브리지, 프랑스 과학 아카데미 연구자들이 신뢰합니다.
받은편지함에서 구독을 확인해주세요.
문제가 발생했습니다. 다시 시도하시겠어요?
스팸 없음, 언제든 구독 취소 가능.