Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models
यह शोध पत्र 11 दक्षिण-पूर्व एशियाई भाषाओं में न्यायसंगत टोकनाइज़र का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह प्रदर्शित करता है कि 'पैरिटी-अवेयर बीपीई' (Parity-aware BPE) और 'मॉर्फोलॉजी-ड्रिवन बाइट एनकोडिंग' (Morphology-Driven Byte Encoding), बहुभाषी लार्ज लैंग्वेज मॉडल्स के लिए संपीड़न दक्षता, अर्थपूर्ण तर्क और क्रॉस-लिंगुअल निष्पक्षता को संतुलित करने में विशिष्ट लाभ प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप 11 अलग-अलग दक्षिण-पूर्व एशियाई भाषाओं के लिए एक सार्वभौमिक अनुवादक (universal translator) बनाने की कोशिश कर रहे हैं। इसे करने के लिए, आपको एक "शब्दकोश" (dictionary) की आवश्यकता है जो वाक्यों को छोटे, प्रबंधनीय टुकड़ों (जिन्हें टोकन कहा जाता है) में तोड़ सके ताकि कंप्यूटर उन्हें समझ सके।
लंबे समय से, बड़े AI मॉडल द्वारा उपयोग किए जाने वाले मानक शब्दकोश पक्षपाती रहे हैं। इसे मुख्य रूप से अंग्रेजी और लैटिन वर्णमाला (जैसे स्पेनिश या फ्रेंच) का उपयोग करने वाली भाषाओं के लिए बनाया गया था। जब यह शब्दकोश अन्य भाषाओं—जैसे बर्मी, खमेर या थाई—को संभालने की कोशिश करता है, तो यह बहुत अनाड़ी हो जाता है। यह इन भाषाओं को बहुत छोटे, अक्षम टुकड़ों में काट देता है—जिससे कंप्यूटर को समान जानकारी को प्रोसेस करने के लिए बहुत अधिक मेहनत करनी पड़ती है और अधिक पैसा खर्च होता है।
यह शोध पत्र एक उपभोक्ता रिपोर्ट की तरह है जो तीन नए, अधिक निष्पक्ष शब्दकोशों का परीक्षण करता है कि कौन सा इन कम प्रतिनिधित्व वाले भाषाओं के लिए सबसे अच्छा काम करता है। शोधकर्ताओं ने केवल शब्दकोशों को नहीं देखा; उन्होंने वास्तव में प्रत्येक शब्दकोश का उपयोग करके छोटे AI मस्तिष्क (1.5 बिलियन पैरामीटर) बनाए ताकि यह देखा जा सके कि AI कितनी अच्छी तरह सोच और अनुवाद कर सकता है।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
समस्या: "एक ही आकार के लिए सभी" वाला सूट (The "One-Size-Fits-All" Suit)
मानक तरीका (जिसे Byte-level BPE कहा जाता है) एक ऐसे दर्जी की तरह है जो केवल लंबे, चौड़े कंधों वाले लोगों (अंग्रेजी बोलने वालों) के लिए सूट बनाना जानता है। जब एक अलग शरीर के प्रकार वाला व्यक्ति (एक दक्षिण-पूर्व एशियाई भाषा बोलने वाला) पहनने की कोशिश करता है, तो उस दर्जी को कपड़े को सैकड़ों छोटे, अजीब टुकड़ों में काटना पड़ता है ताकि वह फिट हो सके।
- परिणाम: AI को अंग्रेजी की तुलना में बर्मी या लाओ के लिए बहुत अधिक "कतरन के टुकड़ों" को प्रोसेस करना पड़ता है। यह AI को धीमा, चलाने में महंगा और उन बोलने वालों के लिए कम सटीक बनाता है।
दावेदार: तीन नए दृष्टिकोण
शोधकर्ताओं ने तीन नए "दर्जी" तरीकों का परीक्षण किया:
पैरिटी-अवेयर BPE (The "Fairness-First" Tailor - "निष्पक्षता-प्रथम" दर्जी)
- यह कैसे काम करता है: यह तरीका अंग्रेजी सूट और बर्मी सूट को अगल-बगल देखता है। यदि बर्मी सूट के बहुत अधिक टुकड़े हो रहे हैं, तो यह दर्जी उन टुकड़ों को संतुलित करने के लिए काटने की प्रक्रिया को मजबूर करता है। यह सुनिश्चित करने के लिए कि सभी को लगभग एक ही आकार का सूट मिले, यह थोड़ी सी समग्र गति का त्याग करता है।
- निर्णय: यह Pareto Frontier का विजेता है। यह "परफेक्ट बैलेंस लाइन" पर स्थित है। यह बिना बहुत अधिक दक्षता खोए सबसे अच्छी निष्पक्षता (सभी के लिए लगभग समान लागत) प्रदान करता है। यह निष्पक्ष AI बनाने के लिए अनुशंसित "डिफ़ॉल्ट" विकल्प है।
मॉर्फोलॉजी-ड्रिवन बाइट एनकोडिंग / MYTE (The "Linguist" Tailor - "भाषाविद्" दर्जी)
- यह कैसे काम करता है: यह केवल अक्षरों या ध्वनियों के आधार पर नहीं काटता, बल्कि शब्दों के व्याकरण और मूल (morphology) का अध्ययन करता है। यह भाषा के प्राकृतिक जोड़ों (seams) के साथ कपड़े को काटता है।
- निर्णय: इसने सबसे स्मार्ट AI बनाया। क्योंकि यह शब्दों के "जोड़ों" को समझता है, इसलिए AI जटिल विचारों को बेहतर ढंग से तर्क देने और अनुवाद करने में सक्षम था। हालांकि, सूट भारी थे और उन्हें बनाने में अधिक समय लगा (उच्च कम्प्यूटेशनल लागत)। यदि आपको उच्च गुणवत्ता वाले अनुवाद की आवश्यकता है और आपके पास बड़ा बजट है, तो यह सबसे अच्छा विकल्प है।
बाइट लेटेंट ट्रांसफार्मर / BLT (The "No-Dictionary" Tailor - "बिना-शब्दकोश वाला" दर्जी)
- यह कैसे काम करता है: यह तरीका शब्दकोश को पूरी तरह से छोड़ने की कोशिश करता है। पहले से परिभाषित आकारों में कपड़े को काटने के बजाय, यह कच्चे कपड़े के पैच को देखता है और मौके पर ही अनुमान लगाने की कोशिश करता है कि उनका क्या अर्थ है।
- निर्णय: यह एक कम प्रदर्शन करने वाला रहा। हालांकि यह अभिनव लग रहा था, लेकिन AI संघर्ष करता रहा। शोधकर्ताओं को संदेह है कि क्योंकि यह तरीका पैटर्न का "अनुमान" लगाने पर निर्भर करता है, इसलिए यह कम संसाधन वाली भाषाओं के लिए उपलब्ध सीमित डेटा से भ्रमित हो गया। इसने सड़क के नियमों को सीखने के लिए पर्याप्त अभ्यास नहीं किया था।
मुख्य निष्कर्ष
- निष्पक्षता और दक्षता दुश्मन नहीं हैं: आपको एक तेज़ AI और एक निष्पक्ष AI के बीच में से किसी एक को चुनने की आवश्यकता नहीं है। "निष्पक्षता-प्रथम" दर्जी (Parity-aware BPE) ने साबित कर दिया कि आप दोनों पा सकते हैं।
- "लिपि" (Script) उतना महत्वपूर्ण नहीं है जितना कि "उपकरण": शोधकर्ताओं ने पाया कि चाहे कोई भाषा लैटिन लिपि का उपयोग करती हो या थाई या बर्मी जैसी जटिल लिपि का, इससे लागत निर्धारित नहीं होती थी। शब्दकोश का चुनाव ही एकमात्र चीज़ थी जो मायने रखती थी। एक बुरा शब्दकोश सबको अधिक भुगतान कराता है; एक अच्छा शब्दकोश लागत को समान बनाता है।
- संदर्भ ही सर्वोपरि है (Context is King): गहरा अर्थ समझने के लिए "भाषाविद्" दर्जी (MYTE) सबसे अच्छा था, लेकिन "निष्पक्षता-प्रथम" दर्जी सबसे व्यावहारिक ऑल-राउंडर था।
निष्कर्ष
यदि आप दक्षिण-पूर्व एशिया के लिए AI बना रहे हैं, तो केवल मानक अंग्रेजी-पक्षपाती शब्दकोश का उपयोग न करें।
- यदि आप एक संतुलित, निष्पक्ष और कुशल प्रणाली चाहते हैं, तो Parity-aware BPE का उपयोग करें।
- यदि आपको सर्वोत्तम अनुवाद और तर्क कौशल की आवश्यकता है और आप अतिरिक्त कंप्यूटिंग शक्ति वहन कर सकते हैं, तो MYTE का उपयोग करें।
- फिलहाल BLT से बचें, क्योंकि यह इस अध्ययन में इन भाषाओं की विशिष्ट बाधाओं के कारण संघर्ष कर रहा था।
अंततः, यह शोध पत्र दिखाता है कि केवल टेक्स्ट को काटने के तरीके को बदलकर, हम AI को सैकड़ों लाखों लोगों के लिए काफी सस्ता और निष्पक्ष बना सकते हैं जिन्हें वर्तमान प्रणाली द्वारा पीछे छोड़ दिया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।