← नवीनतम पेपर
💬 NLP

FLEXITOKENS: Flexible Tokenization for Evolving Language Models

यह शोध पत्र FLEXITOKENS को प्रस्तुत करता है, जो बाइट-लेवल लैंग्वेज मॉडल्स के लिए एक लचीली टोकेनाइजेशन विधि है, जो फिक्स्ड टोकेनाइजर्स की कठोरता को दूर करने के लिए एक सरलीकृत प्रशिक्षण उद्देश्य के साथ एक सीखने योग्य बाउंड्री प्रेडिक्टर का उपयोग करती है, जिससे ओवर-फ्रैगमेंटेशन कम होता है और विविध भाषाओं एवं कार्यों में 10% तक प्रदर्शन सुधार प्राप्त होता है।

मूल लेखक: Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abraham Toluwase Owodunni, Orevaoghene Ahia, Sachin Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पढ़ना और दुनिया को समझना सिखाने की कोशिश कर रहे हैं। इसे करने के लिए, रोबोट को वाक्यों को छोटे, प्रबंधनीय टुकड़ों में तोड़ने की आवश्यकता है जिन्हें "टोकन" कहा जाता है। टोकन को ऐसे समझें जैसे एक निर्माता दीवार बनाने के लिए ईंटों का उपयोग करता है।

लंबे समय से, रोबोटों ने बहुत ही कठोर सेट का उपयोग किया है। ये ईंटें एक निश्चित नियम पुस्तिका के आधार पर विशिष्ट आकारों (जैसे "un-", "do", "able") में पहले से ही कटी हुई थीं। यह उन भाषाओं और विषयों के लिए बहुत अच्छा काम करता है जिनके लिए रोबोट को मूल रूप से प्रशिक्षित किया गया था। लेकिन, जैसे ही रोबोट कुछ नया पढ़ने की कोशिश करता है—जैसे कि कोई मेडिकल जर्नल, कोडिंग मैनुअल, या कोई ऐसी भाषा जिसे उसने पहले कभी नहीं देखा—यह कठोर नियम पुस्तिका समस्या पैदा करती है।

समस्या: "एक ही आकार सबके लिए" वाली ईंट

यह पेपर इस समस्या को ओवर-फ्रैगमेंटेशन (अत्यधिक विखंडन) कहता है।

कल्पना कीजिए कि आप टेक्स्ट के एक लंबे, निरंतर रिबन से एक दीवार बनाने की कोशिश कर रहे हैं। यदि आपका नियम कहता है, "जब भी आपको हाइफ़न दिखे, रिबन को काट दें," तो आप "hypertrophic" (एक चिकित्सा शब्द) जैसे एकल शब्द को छोटे, बेकार टुकड़ों में काट सकते हैं: "hyper", "tro", "phic"।

  • परिणाम: रोबोट को दीवार बनाने के लिए बहुत अधिक छोटे-छोटे ईंटों को ढोना पड़ता है। इससे निर्माण धीमा, महंगा (कंप्यूटर पावर के मामले में) और भ्रमित करने वाला हो जाता है। रोबोट पूरे शब्द का अर्थ खो देता है क्योंकि वह बहुत छोटे, टूटे हुए टुकड़ों को देखने में व्यस्त रहता है।
  • पुराना तरीका: पारंपरिक तरीके (जैसे BPE) एक कारखाने की तरह हैं जो रोबोट के शुरू करने से पहले ही सभी ईंटों को पहले से काट देता है। एक बार जब ईंटें कट जाती हैं, तो उन्हें बदला नहीं जा सकता, भले ही रोबोट बाद में एक अलग तरह का घर बना रहा हो।

समाधान: FLEXITOKENS

इस पेपर के लेखक, FLEXITOKENS, एक स्मार्ट तरीका प्रस्तावित करते हैं। पहले से कटे हुए ईंटों का उपयोग करने के बजाय, वे रोबोट को एक स्मार्ट, लचीला कटर (cutter) देते हैं जो निर्माण करते समय ही रिबन को काटने का तरीका सीखता है।

इसे करने के लिए, यहाँ उन्होंने एक सरल उपमा का उपयोग किया है:

  1. पुराना नियम (The "Fixed Compression" Trap):
    रोबोटों द्वारा अपने स्वयं के ईंट काटने के पिछले प्रयासों में एक सख्त नियम का उपयोग किया गया था: "आपको रिबन को इस तरह काटना होगा कि आपके पास हर 10 इंच के टेक्स्ट के लिए ठीक 3 ईंटें हों।"
  • दोष: यदि टेक्स्ट ऐसी भाषा में है जहाँ शब्द स्वाभाविक रूप से लंबे होते हैं (जैसे तुर्की), तो 3-ईंट का नियम लागू करने से एक एकल शब्द को छोटे, अर्थहीन टुकड़ों में तोड़ दिया जाएगा। यदि टेक्स्ट ऐसी भाषा में है जहाँ शब्द छोटे होते हैं (जैसे चीनी), तो वही नियम दो अलग-अलग शब्दों को एक भ्रमित करने वाले ढेर में जोड़ सकता है। नियम इस विशिष्ट "आकार" के अनुकूल होने के लिए बहुत कठोर था।
  1. नया नियम (FLEXITOKENS):
    FLEXITOKENS नियम को एक लचीली रेंज (flexible range) में बदल देता है। यह कहने के बजाय कि, "आपके पास ठीक 3 ईंटें होनी चाहिए," यह कहता है, "आपके पास इस विशिष्ट वाक्य के लिए जो सबसे उपयुक्त हो, उसके आधार पर 2 से 4 के बीच कहीं भी ईंटें हो सकती हैं।"
  • "हिंज" लॉस (The "Hinge" Loss): यह पेपर एक विशेष प्रशिक्षण पद्धति (एक "हिंज-लाइक लॉस") पेश करता है जो एक सुरक्षा क्षेत्र की तरह कार्य करती है। यदि रोबोट टेक्स्ट को टुकड़ों की संख्या के भीतर काटता है जो सुरक्षित रेंज में आता है, तो रोबोट को "पास" मिल जाता है—कोई दंड नहीं। यह रोबोट को लचीला होने की अनुमति देता है। यह एक लंबे मेडिकल शब्द को एक बड़े, अर्थपूर्ण ईंट में काट सकता है, या एक छोटे वाक्य को कई छोटी ईंटों में काट सकता है, जो भी इसे अर्थ समझने में सबसे अधिक मदद करे।

जब उन्होंने इसे आज़माया तो क्या हुआ?

शोधकर्ताओं ने इस नए लचीले कटर का परीक्षण कई अलग-अलग भाषाओं (अंग्रेजी, स्पेनिश, रूसी, हिंदी और तेलुगु सहित) और विभिन्न विषयों (जैसे चिकित्सा और कोडिंग) पर किया।

  • कम गंदगी: रोबोट ने अनावश्यक रूप से शब्दों को काटना बंद कर दिया। उदाहरण के लिए, एक मेडिकल टेक्स्ट में, इसने सीखा कि "hypertrophic" को एक एकल, सुसंगत इकाई के रूप में कैसे रखा जाए, बजाय इसके कि उसे कचरा टुकड़ों में तोड़ दिया जाए।
  • तेज़ और स्मार्ट: क्योंकि रोब secara बहुत सारे छोटे, टूटे हुए ईंटों को नहीं ढोना पड़ा, इसलिए इसने जानकारी को तेज़ी से प्रोसेस किया और कम कंप्यूटर मेमोरी का उपयोग किया।
  • बेहतर प्रदर्शन: अनुवाद और वाक्यों को समझने जैसे कार्यों पर, लचीले कटर वाले रोबोट ने पुराने, कठोर तरीकों का उपयोग करने वाले रोबोट की तुलना में बेहतर प्रदर्शन किया। इसने उन भाषाओं को भी बहुत बेहतर ढंग से संभाला जिन्हें उसने पहले कभी नहीं देखा था (जैसे उर्दू), बिना उन्हें छोटे, भ्रमित करने वाले टुकड़ों में तोड़े।

मुख्य बात (The Bottom Line)

FLEXITOKENS को एक रोबोट के अपग्रेड के रूप में देखें, जो पहले से कटे हुए, प्लास्टिक खिलौने के ईंट सेट के बजाय एक स्मार्ट, 3D प्रिंटर का उपयोग कर रहा है, जो उस समय जो कुछ भी वह बना रहा है उसके लिए एकदम सही आकार और आकार की ईंटें प्रिंट कर सकता है।

रोबोट को संदर्भ (context) के आधार पर शब्दों को तोड़ने का निर्णय लेने देकर (एक निश्चित नियम थोपने के बजाय), यह पेपर दिखाता है कि भाषा मॉडल अधिक कुशल हो सकते हैं, नई भाषाओं को बेहतर ढंग से संभाल सकते हैं, और "अत्यधिक कटे हुए" टेक्स्ट से भ्रमित हुए बिना चिकित्सा जैसे जटिल विषयों को समझ सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →