← नवीनतम पेपर
🤖 machine learning

Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families

यह शोध पत्र एक सटीक टोकन-मैपिंग एल्गोरिदम पेश करता है जो ऑन-पॉलिसी डिस्टिलेशन (On-Policy Distillation) को अलग-अलग टोकनाइज़र वाले विभिन्न मॉडल परिवारों में संचालित करने में सक्षम बनाता है, जो पिछली सीमाओं को दूर करता है और मौजूदा क्रॉस-टोकनाइज़र विधियों की तुलना में काफी बेहतर कंप्यूट दक्षता प्रदर्शित करता है।

मूल लेखक: Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Niu, Han Xiao, Dongyi Liu, Zelong Wang, Dihong Gong, Yasheng Wang, Jia Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

बड़ी समस्या: दो विशेषज्ञ जो अलग-अलग भाषाएँ बोलते हैं

कल्पना कीजिए कि आपके पास एक शानदार शिक्षक (एक बड़ा AI मॉडल) है जो गणित की समस्याओं को हल करने में विशेषज्ञ है। आपके पास एक छात्र (एक छोटा AI मॉडल) भी है जो शिक्षक से सीखना चाहता है।

अतीत में, छात्र के लिए शिक्षक से प्रभावी ढंग से सीखने के लिए, उन्हें बिल्कुल एक ही "भाषा" बोलनी पड़ती थी। AI के संदर्भ में, इसका अर्थ है कि उन्हें बिल्कुल एक ही टोकेनाइज़र (Tokenizer) का उपयोग करना पड़ता था।

  • टोकेनाइज़र क्या है? इसे एक शब्दकोश के रूप में समझें जो वाक्यों को छोटे टुकड़ों (टोकन) में तोड़ता है।
    • शिक्षक का शब्दकोश: "running" शब्द को दो टुकड़ों में तोड़ सकता है: run + ning
    • छात्र का शब्दकोश: "running" को एक एकल टुकड़े के रूप में रख सकता है: running

यदि शिक्षक कहता है, "तुमने run वाले हिस्से में बहुत अच्छा किया," तो छात्र (जो केवल running को एक टुकड़े के रूप में देखता है) भ्रमित हो जाता है। उसे यह समझ नहीं आता कि शिक्षक उसके किस एकल टुकड़े की प्रशंसा कर रहा है। इस बेमेल (mismatch) का अर्थ था कि शक्तिशाली "ऑन-पॉलिसी डिस्टिलेशन" (On-Policy Distillation - सिखाने का एक उच्च-तकनीकी तरीका जहाँ छात्र अभ्यास करते समय सीखता है) केवल उन्हीं मॉडलों के बीच हो सकता था जो पहले से ही एक ही परिवार के सदस्य थे और जिनका शब्दकोश समान था।

समाधान: एक स्मार्ट अनुवादक (Smart Translator)

यह शोध पत्र क्रॉस-टोकेनाइज़र ऑन-पॉलिसी डिस्टिलेशन (Cross-Tokenizer On-Policy Distillation) नामक एक नई विधि पेश करता है। लेखकों ने एक "स्मार्ट अनुवादक" बनाया है जो शिक्षक और छात्र को एक-दूसरे से सीखने की अनुमति देता है, भले ही वे पूरी तरह से अलग शब्दकोशों का उपयोग करते हों।

यहाँ बताया गया है कि उनका सिस्टम चरण-दर-चरण कैसे काम करता है:

1. "डुअल-पॉइंटर" नृत्य (मिलान ढूँढना)

कल्पना कीजिए कि शिक्षक और छात्र दोनों एक ही कहानी पढ़ रहे हैं, लेकिन शिक्षक इसे छोटे वाक्यांशों में पढ़ता है, जबकि छात्र इसे लंबे वाक्यों में पढ़ता है।

  • लेखकों ने एक एल्गोरिदम बनाया (जिसे डुअल-पॉइंटर चंक अलाइनमेंट कहा जाता है) जो साथ-साथ चलने वाले दो व्यक्तियों की तरह कार्य करता है।
  • एक व्यक्ति शिक्षक के टुकड़ों (chunks) की ओर इशारा करता है, दूसरा छात्र के टुकड़ों की ओर।
  • वे अपने हाथों को आगे बढ़ाते हैं जब तक कि वे उस बिंदु तक नहीं पहुँच जाते जहाँ पाठ का अर्थ पूरी तरह से मेल खाता है, भले ही शब्दों की संख्या अलग हो।
  • परिणाम: वे "सिंक्रोनाइज्ड चंक्स" (Synchronized Chunks) की पहचान करते हैं। उदाहरण के लिए, वे महसूस करते हैं कि शिक्षक के तीन छोटे शब्द (1, 2, 0) वास्तव में छात्र के एक बड़े शब्द (120) के बिल्कुल समान हैं।

2. "क्रेडिट असाइनमेंट" (प्रशंसा साझा करना)

एक बार जब वे एक मिलान करने वाला टुकड़ा पा लेते हैं, तो उन्हें यह तय करने की आवश्यकता होती है कि शिक्षक की प्रतिक्रिया (feedback) को कैसे साझा किया जाए।

  • समस्या: शिक्षक ने तीन छोटे शब्दों के लिए एक स्कोर दिया। छात्र के पास केवल एक बड़ा शब्द है। हम उस स्कोर को कैसे विभाजित करें?
  • समाधान: शोध पत्र एक "सिमेंटिक प्रायोर" (Semantic Prior - एक फैंसी तरीका जिसका अर्थ है "छात्र ने पहले से क्या सोचा था") का उपयोग करता है।
    • यदि छात्र 120 शब्द के बारे में पहले से ही काफी आश्वस्त था, तो उसे शिक्षक की प्रशंसा का एक छोटा हिस्सा मिलता है।
    • यदि छात्र 120 को लेकर भ्रमित या हैरान था, तो उसे तेजी से सीखने में मदद करने के लिए प्रशंसा का एक बड़ा हिस्सा मिलता है।
  • यह सुनिश्चित करता है कि छात्र अपने सोचने के अनूठे तरीके को खोए बिना सही सबक सीखे।

यह एक बड़ी बात क्यों है (परिणाम)

लेखकों ने एक "Llama" मॉडल (छात्र) को "Qwen" मॉडल (शिक्षक) का उपयोग करके सिखाकर इसका परीक्षण किया। ये दो बहुत अलग परिवारों के AI हैं जिनके शब्दकोश अलग हैं।

  1. यह बेहतर काम करता है: छात्र ने गणित और कोडिंग में बहुत तेज़ी से सीखा और अधिक बुद्धिमान बन गया, बजाय इसके कि वह केवल शिक्षक के उत्तरों को रटने की कोशिश करता (पुराना तरीका)।
  2. यह भारी ऊर्जा बचाता है: यह सबसे आश्चर्यजनक हिस्सा है।
    • पुराना तरीका (SFT): समान स्तर की बुद्धिमत्ता प्राप्त करने के लिए, छात्र को 480,000 अतिरिक्त उदाहरण पढ़ने की आवश्यकता होती।
    • नया तरीका (OPD): छात्र को उसी स्तर तक पहुँचने के लिए केवल 20,000 उदाहरणों की आवश्यकता थी।
    • उपमा: यह एक भाषा सीखने के लिए शब्दकोश को 10 बार पढ़ने बनाम एक मूल वक्ता (native speaker) के साथ बातचीत करने के बीच के अंतर जैसा है जो आपकी गलतियों को वास्तविक समय में सुधारता है। बातचीत (OPD) बहुत अधिक कुशल है।

निष्कर्ष (The Bottom Line)

यह शोध पत्र उस "दीवार" को तोड़ देता है जिसने AI मॉडलों को अलग-थलग रखा था। पहले, आप केवल तभी एक छात्र को सिखा सकते थे यदि वे शिक्षक की तरह ही एक ही "टोकेन भाषा" बोलते थे। अब, इस नए "स्मार्ट अनुवादक" की मदद से, हम किसी भी शक्तिशाली AI को किसी भी छोटे AI के साथ जोड़ सकते हैं, चाहे वे शब्दों को किसी भी तरह से तोड़ते हों, और ज्ञान को कुशलतापूर्वक स्थानांतरित कर सकते हैं।

लेखकों ने पाया कि यह विधि न केवल संभव है, बल्कि पिछले तरीकों की तुलना में काफी सस्ती और तेज़ भी है, जिससे विभिन्न प्रकार के AI मॉडलों के एक-दूसरे से सीखने का मार्ग प्रशस्त होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →