← नवीनतम पेपर
💬 NLP

Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion

यह शोध पत्र 'FragMend' का प्रस्ताव देकर गैर-लैटिन भाषाओं में टोकन के अत्यधिक विखंडन (over-fragmentation) की समस्या का समाधान करता है, जो एक व्याख्यात्मकता-आधारित (interpretability-based) शब्दावली विस्तार विधि है और जो प्रदर्शन तथा टोकन दक्षता में महत्वपूर्ण सुधार करने के लिए पारंपरिक आवृत्ति-आधारित चयन और इनिशियलाइजेशन तकनीकों से बेहतर प्रदर्शन करती है।

मूल लेखक: Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ज्ञान के एक विशाल, वैश्विक पुस्तकालय (एक लार्ज लैंग्वेज मॉडल, या LLM) का संचालन कर रहे हैं। इस पुस्तकालय को व्यवस्थित करने के लिए, आपको एक कैटलॉग सिस्टम की आवश्यकता है। AI की दुनिया में, इस कैटलॉग को वोकैबुलरी (vocabulary) कहा जाता है, और इसके व्यक्तिगत प्रविष्टियों को टोकन (tokens) कहा जाता है।

यहाँ वह समस्या है जिसे यह शोध पत्र संबोधित करता है: पुस्तकालय पक्षपाती है।

समस्या: "टोकन टैक्स" (The "Token Tax")

कल्पना कीजिए कि आप इस पुस्तकालय से एक किताब उधार लेने जाते हैं।

  • यदि किताब अंग्रेजी में है, तो लाइब्रेरियन आपको एक एकल, साफ-सुथरा इंडेक्स कार्ड थमा देता है।
  • यदि किताब ओडिया (भारत की एक भाषा) या बर्मी (म्यांमार की भाषा) में है, तो लाइब्रेरियन उसी वाक्य का वर्णन करने के लिए आपको दस इंडेक्स कार्डों का एक ढेर थमा देता है।

इसे टोकन ओवर-फ्रैगमेंटेशन (Token Over-fragmentation) कहा जाता है। क्योंकि इस AI को मुख्य रूप से अंग्रेजी और अन्य "लैटिन-लिपि" वाली भाषाओं पर प्रशिक्षित किया गया है, इसलिए इसके पास गैर-लैटिन लिपियों के लिए अच्छे "शब्द" नहीं हैं। इसे उन शब्दों को छोटे, अक्षम टुकड़ों में तोड़ना पड़ता है (जैसे कि किसी शब्द को पूरे शब्द के बजाय हर एक अक्षर को अलग-अलग सूचीबद्ध करके वर्तनी लिखने की कोशिश करना)।

यह क्यों मायने रखता है?

  1. लागत (Cost): हर टोकन की एक कीमत होती है। यदि भारत के एक उपयोगकर्ता को वही कहने के लिए 10 टोकन की आवश्यकता होती है जो एक अमेरिकी को 1 टोकन में चाहिए, तो वे AI का उपयोग करने के लिए 10 गुना अधिक भुगतान कर रहे हैं।
  2. गति (Speed): अधिक टोकन का अर्थ है कि AI को सोचने और उत्तर देने में अधिक समय लगता है।
  3. निष्पक्षता (Fairness): यह गैर-अंग्रेजी बोलने वालों के लिए एक "साइलेंट टैक्स" (मौन कर) है।

पुराना समाधान: "अनुमान और जाँच" ("Guess and Check")

पहले, जब शोधकर्ताओं ने इसे ठीक करने की कोशिश की, तो उन्होंने फ्रीक्वेंसी-बेस्ड ह्यूरिस्टिक्स (Frequency-Based Heuristics) नामक विधि का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप पुस्तकालय के कैटलॉग में नए शब्द जोड़ रहे हैं। पुरानी विधि कहती है, "आइए हम उन शब्दों को जोड़ दें जो एक टेक्स्ट फ़ाइल में सबसे अधिक बार आते हैं।"
  • दोष: यह कैटलॉग में सबसे उपयोगी शब्दों के बजाय सबसे सामान्य अक्षरों को जोड़ने जैसा है। यह थोड़ा मदद तो करता है, लेकिन यह बहुत कुशल नहीं है, और अक्सर कैटलॉग के तर्क को बिगाड़ देता है, जिससे चीजें धीमी या कम सटीक हो जाती हैं।

नया दृष्टिकोण: "मन को पढ़ना" ("Reading the Mind")

लेखक एक स्मार्ट तरीका प्रस्तावित करते हैं जिसे इंटरप्रिटेबिलिटी-बेस्ड एक्सपेंशन (Interpretability-Based Expansion) कहा जाता है। केवल शब्दों को गिनने के बजाय, वे देखते हैं कि AI का मस्तिष्क वास्तव में कैसे काम करता है।

उन्होंने एक घटना की खोज की जिसे "सबवर्ड डिटोकनाइजेशन" (Subword Detokenization) कहा जाता है।

  • उपमा: भले ही AI के आधिकारिक कैटलॉग में "Layla" शब्द नहीं है, लेकिन जब वह "L-ay-la" के टुकड़ों को देखता है, तो वह वास्तव में अपने "मन" (आंतरिक परतों) में पूरे नाम को समझ लेता है। वह बोलने से पहले ही पूरे विचार को पुनर्गठित कर लेता है।
  • शोधकर्ताओं ने महसूस किया: "यदि AI पहले से ही इन टुकड़ों को समझ रहा है, तो हम उन्हें आधिकारिक 'शब्द कार्ड' क्यों नहीं दे देते?"

नवाचार: FragMend

यह शोध पत्र FragMend (FragMent Mend) पेश करता है।

  1. यह क्या करता है: प्रशिक्षण डेटा में पूर्ण शब्दों के आने का इंतजार करने के बजाय, FragMend उन टुकड़ों (पर्फिक्स, सफिक्स और शब्दों के मध्य भाग) को खोजता है जिन्हें AI पहले से ही समझता है।
  2. यह कैसे काम करता है:
    • यह AI की आंतरिक "विचार प्रक्रिया" को स्कैन करता है ताकि यह देखा जा सके कि वह टुकड़ों को एक पूर्ण रूप में सफलतापूर्वक कैसे जोड़ता है।
    • यह उन सफल क्षणों को लेता है और कहता है, "ठीक है, हमें एक पैटर्न मिल गया है। आइए इस पैटर्न को आधिकारिक तौर पर कैटलॉग में जोड़ें।"
    • फिर यह AI की अपनी समझ की नकल करके इन नए शब्दों के लिए एक "स्मार्ट की" (एम्बेडिंग) बनाता है, बजाय इसके कि अनुमान लगाया जाए।

परिणाम: सभी के लिए जीत

शोधकर्ताओं ने 14 अलग-अलग भाषाओं पर इसका परीक्षण किया, जिसमें ओडिया और बर्मी जैसी कम संसाधन वाली भाषाएँ भी शामिल थीं।

  • दक्षता (Efficiency): FragMend ने कुछ भाषाओं के लिए आवश्यक टोकनों की संख्या को 30-40% तक कम कर दिया। इसका मतलब है कि उपयोगकर्ता कम भुगतान करते हैं और तेज़ उत्तर प्राप्त करते हैं।
  • प्रदर्शन (Performance): पुराने तरीकों के विपरीत, जो कभी-कभी नए शब्द जोड़ने पर AI को "कम बुद्धिमान" बना देते थे, FragMend ने AI की बुद्धिमत्ता को बरकरार रखा।
  • लागत (Cost): एक ओडिया वक्ता के लिए, केवल थोड़ी मात्रा में डेटा (1,000 वाक्य) का उपयोग करके और पूरे मॉडल को महंगे पुन: प्रशिक्षण (re-training) के बिना, "टोकन टैक्स" को आधा कर दिया गया।

बड़ी तस्वीर

AI को एक ऐसे शेफ के रूप में सोचें जो केवल विशिष्ट सामग्रियों (अंग्रेजी शब्दों) के साथ खाना पकाने को जानता है। यदि आप उनसे किसी अलग संस्कृति का व्यंजन बनाने के लिए कहते हैं, तो उन्हें इसे काम करने के लिए सब कुछ छोटे, अक्षम टुकड़ों में काटने के लिए मजबूर होना पड़ता है।

यह पेपर शेफ को पूरे व्यंजन को पहचानने में मदद करता है, भले ही वह उनके आधिकारिक मेनू में न हो। यह देखकर कि शेफ सामग्रियों के बारे में पहले से ही कैसे सोचते हैं, वे उन गायब "पूरे व्यंजन" के व्यंजनों को मेनू में जोड़ सकते हैं। परिणाम? शेफ तेज़, सस्ता खाना पकाता है और भोजन का स्वाद भी उतना ही अच्छा होता है।

संक्षेप में: लेखकों ने गैर-अंग्रेजी बोलने वालों के लिए AI को अधिक निष्पक्ष और सस्ता बनाने का एक तरीका खोजा है, जिससे यह सीखा जा सके कि भाषाओं को छोटे, महंगे टुकड़ों में तोड़ने के बजाय उन्हें पूर्ण, सार्थक अवधारणाओं के रूप में कैसे माना जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →