Tokenization Multiplicity Leads to Arbitrary Price Variation in LLM-as-a-service
मूल लेखक: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
मूल लेखक: Ivi Chatzi, Nina Corvelo Benz, Stratis Tsirtsis, Manuel Gomez-Rodriguez
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: टोकनाइज़ेशन मल्टीप्लिसिटी (Tokenization Multiplicity) के कारण LLM-as-a-service में मनमाना मूल्य परिवर्तन
1. समस्या विवरण (Problem Statement)
यह शोध पत्र 'लार्ज लैंग्वेज मॉडल्स' (LLMs) को सेवा के रूप में (LLM-as-a-service) प्रदान करने के अर्थशास्त्र में एक महत्वपूर्ण, फिर भी अनदेखी की गई समस्या को संबोधित करता है। वर्तमान में, प्रदाता मुख्य रूप से पे-पर-टोकन (pay-per-token) मूल्य निर्धारण मॉडल का उपयोग करते हैं, जहाँ उपयोगकर्ताओं से उत्पन्न प्रत्येक टोकन के लिए एक निश्चित शुल्क लिया जाता है। मानक धारणा यह है कि समान इनपुट प्रॉम्प्ट से प्राप्त समान आउटपुट स्ट्रिंग्स (output strings) की लागत भी समान होनी चाहिए।
हालाँकि, लेखक यह प्रदर्शित करते हैं कि यह धारणा त्रुटिपूर्ण है क्योंकि इसमें टोकनाइज़ेशन मल्टीप्लिसिटी (tokenization multiplicity) का मुद्दा है। भले ही एक LLM एक ही इनपुट प्रॉम्प्ट से बिल्कुल समान आउटपुट स्ट्रिंग (कैरेक्टर-दर-कैरेक्टर) उत्पन्न करता है, लेकिन उसके अंतर्निहित टोकन अनुक्रम (sequence of tokens) भिन्न हो सकते हैं। चूंकि मूल्य निर्धारण वर्ण गणना (character count) के बजाय टोकन गणना पर आधारित है, इसलिए ये विभिन्न टोकनाइज़ेशन एक ही आउटपुट के लिए मनमाने मूल्य परिवर्तन (arbitrary price variations) का कारण बनते हैं। यह घटना गैर-अंग्रेजी भाषाओं में विशेष रूप से प्रचलित है और यह प्रोप्राइटरी (proprietary) और ओपन-वेट्स (open-weights) दोनों प्रकार के मॉडलों को प्रभावित करती है।
2. कार्यप्रणाली (Methodology)
अनुभवजन्य जांच (Empirical Investigation)
लेखकों ने तीन प्राकृतिक भाषा कार्यों पर व्यापक अनुभवजन्य अध्ययन किए: अनुवाद (translation), वर्तनी सुधार (spell checking), और पुनर्गठन (rephrasing)।
- सेटअप: उन्होंने प्रत्येक कार्य के लिए विकिपीडिया के लघु पाठों का उपयोग करके 100 इनपुट प्रॉम्प्ट तैयार किए। अनुवाद के लिए, उन्होंने अंग्रेजी-से-5-लक्ष्य-भाषा युग्मों का परीक्षण किया; वर्तनी सुधार और पुनर्गठन के लिए, उन्होंने 6 भाषाओं का परीक्षण किया।
- निष्पादन: प्रत्येक प्रॉम्प्ट को समान मापदंडों के साथ लेकिन अलग-अलग रैंडम सीड्स (random seeds) के साथ 100 बार LLM में डाला गया ताकि एक ही कार्य के लिए अलग-अलग उपयोगकर्ताओं द्वारा अनुरोध किए जाने का अनुकरण किया जा सके।
- मॉडल: इस अध्ययन में प्रोप्राइटरी मॉडल (GPT-4o-mini, GPT-4.1, GPT-5-mini, Gemini, Claude) और ओपन-वेट्स मॉडल (Llama-3.1-8B-Instruct, Qwen2.5-7B-Instruct) शामिल थे।
- मापन: उन्होंने उन आउटपुट युग्मों की पहचान की जहाँ डिकोडेड स्ट्रिंग्स समान थीं लेकिन टोकनाइज़ेशन लंबाई भिन्न थी। उन्होंने इस घटना की संभावना और इसके परिणामस्वरूप होने वाले मूल्य परिवर्तन की मात्रा को मापा।
सैद्धांतिक विश्लेषण (Theoretical Analysis)
यह शोध पत्र कैनोनिकल टोकनाइज़ेशन (canonical tokenization) को परिभाषित करता है, जो एक स्ट्रिंग को प्राप्त होने वाला अद्वितीय टोकनाइज़ेशन है (जो एनकोडर द्वारा निर्धारित होता है)। लेखक नॉन-रिकवरिंग टोकनाइज़र (non-recovering tokenizers) के संबंध में एक प्रमुख सैद्धांतिक परिणाम सिद्ध करते हैं:
- प्रमेय (Theorem): BPE, Unigram, और Wordpiece टोकनाइज़र के लिए, यदि एक आंशिक टोकन अनुक्रम (partial token sequence) नॉन-कैनोनिकल है, तो उस अनुक्रम का कोई भी विस्तार (आगे टोकन जोड़ना) भी नॉन-कैनोनिकल होगा।
- निहितार्थ: एक कैनोनिकल आउटपुट अनुक्रम उत्पन्न करने के लिए, मॉडल को हर चरण में कैनोनिकल आंशिक अनुक्रम उत्पन्न करने होंगे। यह गुण 'कन्स्ट्रेंड जनरेशन' (constrained generation) रणनीतियों की अनुमति देता है।
प्रस्तावित समाधान: कैनोनिकल जनरेशन (Canonical Generation)
मूल्य भिन्नता को समाप्त करने के लिए, लेखक कैनोनिकल जनरेशन पेश करते हैं, जो एक कन्स्ट्रेंड जनरेशन विधि है जो LLM को किसी भी आउटपुट स्ट्रिंग के केवल कैनोनिकल टोकनाइज़ेशन को उत्पन्न करने तक सीमित रखती है।
- एल्गोरिदम: वे गम्बल-मैक्स ट्रिक (Gumbel-Max trick) पर आधारित एक कुशल सैंपलिंग एल्गोरिदम का प्रस्ताव करते हैं।
- सभी वोकैबुलरी टोकन की कैनोनिसिटी (canonicity) की जाँच करने के लिए एक नया संभाव्यता वितरण (probability distribution) स्पष्ट रूप से गणना करने के बजाय, यह एल्गोरिदम प्रत्येक टोकन के लिए गम्बल नॉइज़ (Gumbel noise) को सैंपल करता है।
- यह टोकन को उनके विचलित लॉग-संभाव्यता (perturbed log-probabilities) के आधार पर रैंक करता है।
- यह रैंक किए गए टोकनों के माध्यम से पुनरावृत्ति करता है और पहले ऐसे टोकन का चयन करता है जो वर्तमान अनुक्रम के साथ जोड़ने पर एक कैनोनिकल अनुक्रम बनाता है।
- यह दृष्टिकोण महंगे नॉर्मलाइजेशन के बिना नॉन-कैनोनिकल टोकनों के संभाव्यता द्रव्यमान (probability mass) को शेष कैनोनिकल टोकनों में प्रभावी ढंग से पुनर्वितरित करता है।
3. मुख्य परिणाम (Key Results)
टोकनाइज़ेशन मल्टीप्लिसिटी (Tokenization Multiplicity)
- व्यापकता: टोकनाइज़ेशन मल्टीप्लिसिटी सभी परीक्षण किए गए मॉडलों और कार्यों में देखी गई। ओपन-वेट्स मॉडलों (Llama, Qwen) के लिए, यह तीनों कार्यों में नियमित रूप से हुई। प्रोप्राइटरी मॉडल भी इस समस्या को प्रदर्शित करते हैं, हालांकि उनकी आवृत्ति भिन्न थी।
- भाषा निर्भरता: यह घटना अंग्रेजी की तुलना में अल्पसंख्यक भाषाओं (जैसे तुर्की, स्वाहिली) में काफी अधिक प्रचलित है। उदाहरण के लिए, अनुवाद कार्यों में, तुर्की और स्वाहिली के लिए 7% तक प्रॉम्प्ट्स ऐसे थे जहाँ समान स्ट्रिंग्स के साथ अलग-अलग टोकनाइज़ेशन लंबाई प्राप्त हुई।
- मूल्य भिन्नता: जब मल्टीप्लिसिटी होती है, तो मूल्य अंतर काफी बड़ा हो सकता है। लेखकों ने एक ही आउटपुट स्ट्रिंग के लिए सबसे छोटे और सबसे लंबे टोकनाइज़ेशन के बीच 15% तक के सापेक्ष मूल्य अंतर देखे।
- लंबे आउटपुट: लंबे टेक्स्ट में, टोकनाइज़ेशन त्रुटियाँ प्रसारित (propagate) होती हैं; यदि एक शब्द को नॉन-कैनोनिकल टोकनाइज़ेशन के साथ उत्पन्न किया जाता है, तो उस शब्द के बाद के उदाहरण अक्सर उसी नॉन-कैनोनिकल पैटर्न का पालन करते हैं, जिससे मूल्य अंतर बढ़ जाता है।
कैनोनिकल जनरेशन प्रदर्शन (Canonical Generation Performance)
- सैद्धांतिक गारंटी: लेखक सिद्ध करते हैं कि कैनोनिकल जनरेशन के माध्यम से उत्पन्न टोकन अनुक्रमों का वितरण, मानक जनरेशन की तुलना में प्रशिक्षण के दौरान देखे गए अनुक्रमों के वास्तविक वितरण के (KL-divergence के संदर्भ में) अधिक निकट है।
- अनुभवजन्य प्रदर्शन: अनुवाद, वर्तनी सुधार, पुनर्गठन और MGSM (बहुभाषी गणित) बेंचमार्क पर प्रयोगों से पता चलता है कि कैनोनिकल जनरेशन गुणवत्ता के मामले में मानक जनरेशन के समान (comparable) है:
- गुणवत्ता: अनुवाद गुणवत्ता स्कोर, एडिट डिस्टेंस (edit distance) और कोसाइन सिमिलरिटी (cosine similarity) जैसे मेट्रिक्स में नगण्य अंतर देखा गया (अक्सर त्रुटि मार्जिन के भीतर)।
- रनटाइम: प्रति टोकन समय केवल मामूली रूप से बढ़ा (जैसे, 0.019s से 0.020s तक), जो गम्बल-मैक्स आधारित सैंपलिंग एल्गोरिदम की दक्षता को दर्शाता है।
- नॉन-कैनोनिसिटी दर: मॉडल और कार्य के आधार पर मानक जनरेशन ने 6% से 29% मामलों में नॉन-कैनोनिकल आउटपुट दिए, जबकि कैन적인 जनरेशन ने इसे डिज़ाइन द्वारा 0% तक कम कर दिया।
4. महत्व और दावे (Significance and Claims)
यह शोध पत्र यह दावा करता है कि यह टोकनाइज़ेशन मल्टीप्लिसिटी के कारण LLM-as-a-service में मनमाने और अवांछनीय मूल्य परिवर्तन का पहला अनुभवजन्य प्रमाण प्रदान करता है, भले ही प्रदाता "वफादार" (faithful) हों (अर्थात, जानबूझकर टोकन संख्या में हेरफेर नहीं कर रहे हों)।
- आर्थिक प्रभाव: निष्कर्ष पे-पर-टोकन मॉडल की निष्पक्षता को चुनौती देते हैं, यह दिखाते हुए कि उपयोगकर्ता समान मूल्य (टेक्स्ट) के लिए टोकनाइज़ेशन के स्टोकेस्टिक बदलावों के कारण काफी भिन्न राशि का भुगतान कर सकते हैं।
- तकनीकी योगदान: कैनोनिकल जनरेशन का परिचय एक व्यावहारिक समाधान प्रदान करता है जो मॉडल के प्रदर्शन या लेटेंसी (latency) को प्रभावित किए बिना इस मूल्य भिन्नता को समाप्त करता है।
- सैद्धांतिक अंतर्दृष्टि: यह प्रमाण कि BPE, Unigram, और Wordpiece 'नॉन-रिकवरिंग' हैं, यह समझने के लिए एक आधार प्रदान करता है कि नॉन-कैनोनिकल अनुक्रम क्यों उत्पन्न होते हैं और उन्हें स्टेप-बाय-स्टेप बाधाओं के माध्यम से कैसे रोका जा सकता है।
लेखक निष्कर्ष निकालते हैं कि हालांकि कैनोनिकल जनरेशन सैंपलिंग स्पेस को थोड़ा सीमित करता है (जिससे विशिष्ट बाधित परिदृश्यों में प्रदर्शन में मामूली कमी आ सकती है), यह उच्च-गुणवत्ता वाले आउटपुट जनरेशन को बनाए रखते हुए मनमाने मूल्य निर्धारण की समस्या को प्रभावी ढंग से हल करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते NLP के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।