← नवीनतम पेपर
💬 NLP

The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty

यह शोध पत्र 25 यूरोपीय भाषाओं में एक "टोकेनाइज़र टैक्स" (tokenizer tax) को परिमाणित करता है, जो यह प्रकट करता है कि गैर-अंग्रेजी भाषाएं, विशेष रूप से यूक्रेनी और जटिल रूपविज्ञान वाली भाषाएं, प्री-ट्रेनिंग डेटा में कम प्रतिनिधित्व के कारण काफी उच्च टोकन-टू-वर्ड अनुपात से ग्रस्त हैं, जबकि यह भी दर्शाता है कि ये फर्टिलिटी रैंकिंग विभिन्न डोमेन में सुसंगत बनी रहती हैं और फ्यू-शॉट प्रभाव भाषा-निर्भर होने के बजाय मॉडल-अंतर्निहित हैं।

मूल लेखक: Volodymyr Ovcharov

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Volodymyr Ovcharov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप टैक्सी की सवारी के लिए भुगतान कर रहे हैं। अंग्रेजी में, टैक्सी आपसे प्रति "स्टॉप" (एक शब्द) के हिसाब से शुल्क लेती है। लेकिन यूक्रेनी में, टैक्सी ड्राइवर आपसे प्रति "स्टेप" (एक शब्द का एक छोटा सा हिस्सा) के हिसाब से शुल्क लेने पर जोर देता है। क्योंकि यूक्रेनी शब्द अक्सर लंबे और अधिक जटिल होते हैं, इसलिए ड्राइवर को उसी गंतव्य तक पहुँचने के लिए बहुत अधिक 'स्टेप्स' लेने पड़ते हैं। अंततः, आप बिल्कुल उसी यात्रा के लिए दोगुना भुगतान करते हैं, भले ही दूरी नहीं बदली हो।

वलोडिमिर ओवचारोव द्वारा लिखा गया यह शोध पत्र इस बारे में है कि कैसे AI का उपयोग करते समय गैर-अंग्रेजी भाषाओं पर एक छिपा हुआ "टैक्स" लगता है। यहाँ उनके निष्कर्षों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. "स्टेप" टैक्स (टोकेनाइज़र फर्टिलिटी)

AI मॉडल मनुष्यों की तरह पूरे शब्दों को नहीं पढ़ते। वे टेक्स्ट को छोटे-छोटे टुकड़ों में काट देते हैं जिन्हें टोकन कहा जाता है।

  • उपमा: एक शब्द को ब्रेड के एक लोफ (loaf) के रूप में सोचें।
    • अंग्रेजी: AI उस लोफ को बड़े, मोटे स्लाइस में काटता है। एक शब्द को दर्शाने के लिए आपको केवल 1.2 स्लाइस की आवश्यकता होती है।
    • यूक्रेनी: AI एक कुंद चाकू का उपयोग करता है और उसी लोफ को छोटे, भुरभुरे टुकड़ों में काट देता है। एक शब्द को दर्शाने के लिए इसे 2.7 स्लाइस की आवश्यकता होती है।
  • लागत: चूंकि AI कंपनियाँ आपसे प्रति "स्लाइस" (टोकन) के हिसाब से शुल्क लेती हैं, इसलिए यूक्रेनी बोलने की लागत समान मात्रा में टेक्स्ट के लिए अंग्रेजी बोलने की तुलना में लगभग 2.2 गुना अधिक है।
  • पदानुक्रम (Hierarchy): शोध पत्र ने 25 यूरोपीय भाषाओं को मापा।
    • सस्ता समूह: अंग्रेजी, स्पेनिश और फ्रेंच (प्रति शब्द 1.2 से 1.7 स्लाइस)।
    • मध्यम समूह: जर्मन और डच (1.7 से 1.9 स्लाइस)।
    • महंगा समूह: पोलिश और चेक जैसी स्लाविक भाषाएँ (2.2 से 2.5 स्लाइस)।
    • सबसे महंगा: यूक्रेनी, ग्रीक और माल्टीज़ (लगभग 3.1 स्लाइस)।

2. "यूक्रेनी पेनल्टी"

शोधकर्ताओं ने यूक्रेनी के बारे में एक आश्चर्यजनक बात पाई। भले ही यूक्रेनी, पोलिश और चेक सभी समान शब्द संरचनाओं वाली स्लाविक बहनें हैं, फिर भी यूक्रेनी को प्रोसेस करना काफी अधिक महंगा है।

  • उपमा: दो समान कारखानों की कल्पना करें। एक (पोलिश) के पास पहले से कटे हुए ईंटों की अच्छी आपूर्ति है क्योंकि वह लंबे समय से निर्माण कर रहा है। दूसरे (यूक्रेनी) को हर ईंट को कच्चे पत्थर से काटना पड़ता है क्योंकि अतीत में इसे नजरअंदाज किया गया था।
  • कारण: शोध पत्र दिखाता है कि AI के "लाइब्रेरी" में पोलिश या चेक की तुलना में यूक्रेनी के पास 2 से 6 गुना कम प्रशिक्षण डेटा है। क्योंकि AI ने यूक्रेनी शब्दों को उतनी बार नहीं देखा है, इसलिए वह उन्हें कुशलतापूर्वक समूहित करना नहीं जानता। वह उन्हें छोटे, अक्षम टुकड़ों में काटता रहता है।

3. "वन-साइज़-फिट्स-ऑल" चाकू

शोध पत्र ने परीक्षण किया कि क्या यह "टैक्स" इस बात पर बदल जाता है कि आप किस बारे में बात कर रहे हैं (जैसे कानूनी अनुबंध बनाम समाचार बनाम विकिपीडिया)।

  • निष्कर्ष: इससे कोई फर्क नहीं पड़ता। कौन सा AI "सस्ता" है और कौन सा "महंगा", इसकी रैंकिंग बिल्कुल वैसी ही रहती है चाहे आप फुटबॉल, कानून या इतिहास के बारे में बात कर रहे हों।
  • सीख: यदि आप एक प्रकार के टेक्स्ट पर किसी AI का परीक्षण करते हैं, तो आप जानते हैं कि किसी भी अन्य प्रकार के टेक्स्ट के लिए इसकी लागत कितनी होगी। आपको हर बार पुन: परीक्षण करने की आवश्यकता नहीं है।

4. "मैजिक ट्रिक" (फ्यू-शॉट लर्निंग)

AI कभी-कभी कुछ उदाहरण देखकर एक नया कार्य सीख सकता है (जैसे उसे एक नमूना प्रश्न और उत्तर दिखाना)। शोधकर्ताओं ने परीक्षण किया कि क्या यह "जादुई ट्रिक" विभिन्न भाषाओं के लिए अलग तरह से काम करती है।

  • निष्कर्ष: यह ट्रिक भाषा के बारे में नहीं है; यह AI के व्यक्तित्व (इसके डिज़ाइन) के बारे में है।
    • कुछ AI (जैसे "Nemotron") उदाहरण दिखाए जाने पर स्मार्ट हो जाते हैं, चाहे टेक्स्ट यूक्रेनी, पोलिश या रूसी हो।
    • अन्य AI (जैसे "Maverick") उदाहरण दिखाए जाने पर वास्तव में और भी "बेवकूफ" हो जाते हैं, फिर भी भाषा कोई भी हो।
  • सबक: AI की उलझन के लिए भाषा को दोष न दें। AI के डिज़ाइन को दोष दें। यदि कोई AI उदाहरणों के साथ अंग्रेजी में विफल होता है, तो संभावना है कि वह उदाहरणों के साथ यूक्रेनी में भी विफल होगा।

5. कुछ AI शब्दों को काटने में बेहतर क्यों हैं

शोधकर्ताओं ने यह देखने के लिए कि विभिन्न AI शब्दों को कैसे काटते हैं, इसके पीछे की प्रक्रिया की जांच की।

  • अच्छे काटने वाले (Good Choppers): कुछ AI (जैसे Gemma 2) यूक्रेनी शब्दों को प्राकृतिक "मॉर्फिम" सीमाओं (शब्द के सार्थक भाग, जैसे मूल और अंत) पर काटते हैं। यह कुशल है।
  • बुरे काटने वाले (Bad Choppers): अन्य AI (जैसे Qwen3) शब्दों को यादृच्छिक स्थानों पर काटते हैं, कभी-कभी एक सार्थक हिस्से को ही बीच से विभाजित कर देते हैं। यह ब्रेड के स्लाइस के बीच में काटने के बजाय सैंडविच को सीधे अचार के बीच से काटने जैसा है।
  • आश्चर्य: बड़ा शब्दकोश (vocabulary) बेहतर कटाई की गारंटी नहीं देता है। बड़े शब्दकोश वाले कुछ AI भी यूक्रेनी शब्दों को छोटे, अक्षम टुकड़ों में काटते थे क्योंकि उनके पास सही कट सीखने के लिए पर्याप्त यूक्रेनी उदाहरण नहीं थे।

सिफारिशों का सारांश

शोध पत्र उन लोगों के लिए जो यूक्रेनी या समान भाषाओं के साथ AI का उपयोग कर रहे हैं, तीन सरल नियम सुझाता है:

  1. टैक्स की अपेक्षा करें: इस तथ्य के लिए बजट बनाएं कि यूक्रेनी की लागत अंग्रेजी की तुलना में लगभग दोगुनी होगी।
  2. एक बार परीक्षण करें: आपको "टैक्स" को केवल एक बार मापने की आवश्यकता है; यह सभी विषयों पर लागू होता है।
  3. उदाहरणों के साथ सावधान रहें: यह मान न लें कि AI को उदाहरण दिखाने से मदद मिलेगी। कुछ मॉडलों के लिए, यह प्रदर्शन को वास्तव में नुकसान पहुँचा सकता है, और यह हर भाषा में होता है।

मुख्य बात: वर्तमान में AI की दुनिया अंग्रेजी के पक्षपात (bias) के साथ बनी है। जब तक प्रशिक्षण डेटा की "लाइब्रेरी" संतुलित नहीं हो जाती, तब तक यूक्रेनी जैसी भाषाओं को समझे जाने के लिए एक छिपा हुआ "स्टेप टैक्स" चुकाना पड़ेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →