← नवीनतम पेपर
💬 NLP

SRA: Span Representation Alignment for Large Language Model Distillation

यह शोध पत्र SRA को प्रस्तुत करता है, जो एक नवीन क्रॉस-टोकनाइज़र नॉलेज डिस्टिलेशन फ्रेमवर्क है जो व्यक्तिगत टोकन के बजाय रोबस्ट, अटेंशन-वेटेड स्पैन रिप्रेजेंटेशन्स को संरेखित करने के लिए मल्टी-पार्टिकल डायनेमिकल सिस्टम्स परिप्रेक्ष्य का लाभ उठाता है, जो चुनौतीपूर्ण क्रॉस-आर्किटेक्चर परिदृश्यों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van, Nguyen Thi Ngoc Diep, Trung Le

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van, Nguyen Thi Ngoc Diep, Trung Le

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "SRA: Span Representation Alignment for Large Language Model Distillation" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके किया गया स्पष्टीकरण है।

बड़ी समस्या: अलग-अलग भाषाएँ बोलना

कल्पना कीजिए कि आपके पास एक अत्यंत बुद्धिमान, विशाल प्रोफेसर (Teacher Model) है जो सब कुछ जानता है। आप एक छोटे, तेज़ छात्र (Student Model) को वह सब कुछ सिखाना चाहते हैं जो प्रोफेसर जानता है, ताकि छात्र एक सुपरकंप्यूटर के बजाय एक सामान्य लैपटॉप पर भी काम कर सके।

आमतौर पर, यह तब बहुत अच्छा काम करता है जब प्रोफेसर और छात्र बिल्कुल एक ही भाषा और एक ही शब्दकोश (dictionary) का उपयोग करते हैं। लेकिन AI की दुनिया में, वे अक्सर अलग-अलग "टोकनाइज़र" (tokenizers) का उपयोग करते हैं।

  • टोकनाइज़र की समस्या: टोकनाइज़र को वाक्यों को पहेली के टुकड़ों में तोड़ने के तरीके के रूप में सोचें। प्रोफेसर "unbelievable" शब्द को तीन टुकड़ों में तोड़ सकता है: un, believ, able। छात्र इसे दो टुकड़ों में तोड़ सकता है: un, believable
  • पुराना तरीका: पिछले तरीकों ने प्रोफेसर के तीन टुकड़ों को छात्र के दो टुकड़ों के साथ पूरी तरह से मिलाने की कोशिश की। यह एक 3-टुकड़ों वाली पहेली को 2-टुकड़ों वाली पहेली से मिलाने जैसा है। यह नाजुक है, भ्रमित करने वाला है, और अक्सर गलतियों का कारण बनता है क्योंकि टुकड़े आपस में फिट नहीं बैठते।

नया समाधान: SRA (Span Representation Alignment)

इस पेपर के लेखक कहते हैं, "छोटे पहेली के टुकड़ों को मिलाने की कोशिश करना बंद करें। आइए इसके बजाय पूरी तस्वीर को मिलाते हैं।"

वे SRA नामक एक फ्रेमवर्क पेश करते हैं। व्यक्तिगत शब्दों या अंशों (tokens) पर ध्यान केंद्रित करने के बजाय, वे स्पैन (Spans) पर ध्यान केंद्रित करते हैं—पाठ के ऐसे हिस्से जो एक साथ अर्थपूर्ण होते हैं, जैसे कि एक पूरा वाक्यांश या वाक्य।

SRA कैसे काम करता है, इसे भौतिकी (physics) की एक उपमा से समझते हैं:

1. "द्रव्यमान केंद्र" (Center of Mass) की उपमा

कल्पना कीजिए कि मधुमक्खियों का एक झुंड एक साथ उड़ रहा है।

  • पुराना तरीका: आप व्यक्तिगत रूप से हर एक मधुमक्खी को ट्रैक करने की कोशिश करते हैं। यदि शिक्षक का झुंड छात्र के झुकर से अलग तरह से विभाजित होता है, तो आप नियंत्रण खो देते हैं।
  • SRA तरीका: आप व्यक्तिगत मधुमक्खियों को ट्रैक नहीं करते। आप पूरे झुंड के द्रव्यमान केंद्र (Center of Mass) को देखते हैं।
    • भौतिकी में, "द्रव्यमान केंद्र" वस्तुओं के एक समूह की औसत स्थिति होती है, जो इस आधार पर तय होती है कि वे कितनी भारी (या महत्वपूर्ण) हैं।
    • SRA में, एक "स्पैन" (पाठ का एक हिस्सा) वह झुंड है। "मधुमक्खियाँ" व्यक्तिगत टोकन हैं।
    • सिस्टम पाठ के टुकड़े का एक द्रव्यमान केंद्र की गणना करता है। यह "भारी" मधुमक्खियों (सबसे महत्वपूर्ण शब्दों, जैसे "not" या "crucial") पर अधिक ध्यान देता है और "हल्की" मधुमक्खियों (जैसे "the" या "a") पर कम ध्यान देता है।
    • यह उस टुकड़े के अर्थ का प्रतिनिधित्व करने वाला एक एकल, स्थिर और मजबूत बिंदु बनाता है, चाहे शिक्षक या छात्र ने शब्दों को किसी भी तरह से विभाजित किया हो।

2. "लॉन्गेस्ट कॉमन सब्सक्वेंस" (LCS) ब्रिज

यदि उनके शब्द विभाजन अलग-अलग हैं, तो उन्हें कैसे पता चलता है कि प्रोफेसर के पाठ का कौन सा हिस्सा छात्र के पाठ के किस हिस्से से मेल खाता है?

  • वे LCS नामक एक विधि का उपयोग करते हैं। कल्पना कीजिए कि आपके पास अलग-अलग लिखावट में लिखे गए दो वाक्य हैं। आप अक्षरों की उस सबसे लंबी स्ट्रिंग को ढूंढते हैं जो दोनों में दिखाई देती है, बीच के स्पेस या ब्रेक को अनदेखा करते हुए।
  • यह SRA को यह कहने की अनुमति देता है कि, "ठीक है, प्रोफेसर के पाठ का यह हिस्सा, छात्र के पाठ के इस हिस्से के अनुरूप है," भले ही प्रोफेसर ने इसे 5 शब्दों में विभाजित किया हो और छात्र ने इसे 3 शब्दों में।

3. आकार बनाए रखना (Geometric Regularizer)

जब आप वस्तुओं के एक समूह को हिलाते हैं, तो आप केवल यह नहीं चाहते कि वे सही जगह पर पहुँचें; आप यह भी चाहते हैं कि वे एक-दूसरे के सापेक्ष अपना आकार बनाए रखें।

  • यदि प्रोफेसर के पाठ के टुकड़े एक विशिष्ट पैटर्न (जैसे एक त्रिकोण) में व्यवस्थित हैं, तो छात्र के टुकड़ों को भी एक त्रिकोण बनाना चाहिए, न कि एक वर्ग।
  • SRA एक विशेष "ज्यामितीय नियम" का उपयोग करता है ताकि यह सुनिश्चित हो सके कि पाठ के टुकड़ों के बीच के संबंध समान रहें। यह उस ज्ञान की संरचना को सुरक्षित रखता है जिसे स्थानांतरित किया जा रहा है।

उन्होंने क्या पाया?

शोधकर्ताओं ने शक्तिशाली, बड़े AI मॉडल (जैसे Qwen और Mistral) को छोटे, कमजोर मॉडल (जैसे GPT-2 और TinyLLAma) को सिखाकर इसका परीक्षण किया, जो पूरी तरह से अलग शब्दकोशों का उपयोग करते हैं।

  • परिणाम: SRA ने लगातार अन्य सभी तरीकों को पछाड़ दिया। यह छात्र को शिक्षक के तर्क को समझने में बेहतर था, भले ही वे अलग-अलग तकनीकी भाषाओं में "बात" कर रहे हों।
  • दक्षता: इसके लिए बहुत अधिक अतिरिक्त कंप्यूटर शक्ति की आवश्यकता नहीं थी। वास्तव में, यह पिछले सर्वोत्तम तरीकों की तुलना में अक्सर प्रशिक्षण में तेज़ था।

सारांश

SRA एक अनुवादक की तरह है जो शब्द-दर-शब्द अनुवाद करने की कोशिश करना बंद कर देता है (जो शब्दकोश अलग होने पर विफल हो जाता है) और इसके बजाय विचारों और वाक्यांशों का अनुवाद करता है। शब्दों के समूहों को एकल, भारित "गुरुत्वाकर्षण केंद्रों" के रूप में मानकर, यह दो AI मॉडलों के बीच एक स्थिर पुल बनाता है जो अलग-अलग तकनीकी भाषाएं बोलते हैं, जिससे छोटा मॉडल बेमेल पहेली के टुकड़ों से भ्रमित हुए बिना प्रभावी ढंग से बड़े मॉडल से सीख पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →