← नवीनतम पेपर
💬 NLP

ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs

ReGATE एक शिक्षक-छात्र (teacher-student) ढांचा है जो गाइडेंस लॉस और कठिनाई अनुमानों का उपयोग करके अनावश्यक टोकन को अनुकूल रूप से हटाकर (adaptively pruning) मल्टीमॉडल लार्ज लैंग्वेज मॉडल प्रशिक्षण को गति प्रदान करता है, जिससे कुल टोकन खपत को काफी कम करते हुए तेज़ अभिसरण (faster convergence) और बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chaoyu Li, Yogesh Kulkarni, Pooyan Fazli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को वीडियो समझना सिखाने की कोशिश कर रहे हैं। अभी, इसे करने का मानक तरीका ऐसा है जैसे रोबोट को फिल्म देखते समय स्क्रिप्ट के हर एक शब्द को, यहाँ तक कि "the," "is," या "and" जैसे उबाऊ शब्दों को भी पूरी तरह से पढ़ने के लिए मजबूर करना। यह अविश्वसनीय रूप से धीमा, महंगा और बहुत अधिक ऊर्जा बर्बाद करने वाला है क्योंकि रोबोट अनावश्यक काम कर रहा है।

यह शोध पत्र एक नई विधि पेश करता है जिसे REGATE (रेफरेंस-गाइडेड एडेप्टिव टोकन इलेशन) कहा जाता है। REGATE को एक अति-कुशल अध्ययन कोच (super-efficient study coach) के रूप में समझें जो रोबोट को यह बताने में मदद करता है कि उसे किन शब्दों पर ध्यान केंद्रित करना चाहिए और किन शब्दों को छोड़ देना चाहिए ताकि वह तेजी से सीख सके।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. समस्या: पूरी स्क्रिप्ट पढ़ना

पुराने तरीके (Standard Training) में, रोबोट वीडियो विवरण के प्रत्येक "टोकन" (पाठ का एक हिस्सा) को प्रोसेस करता है।

  • उपमा: कल्पना कीजिए कि आप एक नई भाषा सीखने के लिए एक ऐसी किताब पढ़ रहे हैं जहाँ हर एक शब्द को चमकीले नियॉन रंग से हाइलाइट किया गया है। आप "the" और "a" जैसे सामान्य शब्दों पर घंटों बिता देते हैं, जो वास्तव में आपको कहानी के बारे में ज्यादा कुछ नहीं सिखाते। आप थक जाते हैं, और आप धीरे सीखते हैं।

2. समाधान: "शिक्षक" और "छात्र"

REGATE एक दो-सदस्यीय टीम का उपयोग करता है:

  • छात्र (The Student): यह मुख्य रोबोट मॉडल है जिसे हम प्रशिक्षित करने की कोशिश कर रहे हैं। यह वीडियो और टेक्स्ट दोनों को देखता है।
  • शिक्षक (The Teacher): यह उसी रोबोट का एक "फ्रीज्ड" (अपरिवर्तित) संस्करण है जो केवल टेक्स्ट को देखता है। यह वीडियो नहीं देख सकता।

वे एक साथ कैसे काम करते हैं:
शिक्षक एक वाक्य को देखता है और पूछता है, "क्या मैं केवल टेक्स्ट को पढ़कर अनुमान लगा सकता हूँ कि इस शब्द का क्या अर्थ है, बिना वीडियो देखे?"

  • यदि शब्द "the" या "is" है, तो शिक्षक कहता है, "आसान! मैं यह जानता हूँ।"
  • यदि शब्द "लाल" (red), "घूमता हुआ" (spinning), या "मिलाना" (mixing) है, तो शिक्षक कहता, "ओह, मैं वीडियो देखे बिना इसका अनुमान नहीं लगा सकता! इस शब्द को वीडियो की आवश्यकता है।"

3. "कठिनाई स्कोर" (The Difficulty Score)

REGATE शिक्षक के अनुमान को छात्र के अपने इतिहास के साथ जोड़ता है।

  • उपमा: कल्पना कीजिए कि छात्र एक अभ्यास परीक्षा (practice test) दे रहा है। REGATE एक लॉग रखता है कि छात्र किन प्रश्नों को बार-बार गलत करता रहता है।
  • यदि शिक्षक कहता है, "आपको इस शब्द के लिए वीडियो की आवश्यकता है," और छात्र पहले भी समान शब्दों के साथ संघर्ष करता रहा है, तो REGATE उस शब्द को "उच्च प्राथमिकता" (High Priority) के रूप में चिह्नित करता है।
  • यदि शिक्षक कहता, "मैं इस शब्द को जानता हूँ," और छात्र इसमें महारत हासिल कर चुका है, तो REGATE इसे "छोड़ें" (Skip) के रूप में चिह्नित करता है।

4. परिणाम: "स्मार्ट स्किप" (The Smart Skip)

प्रशिक्षण के दौरान, REGATE एक मास्क बनाता है। यह रोबोट को बताता है: "इन महत्वपूर्ण शब्दों को पढ़ें, लेकिन उबाऊ शब्दों को छोड़ दें।"

  • उपमा: पूरी किताब को पेज-दर-पेज पढ़ने के बजाय, रोबोट अब केवल उन हाइलाइट किए गए वाक्यों को पढ़ता है जो वास्तव में कहानी को आगे बढ़ाते हैं। यह भरने वाले (filler) शब्दों को अनदेखा कर देता है।
  • लाभ: रोबोट 40% कम काम करता है (कम टोकन प्रोसेस करता है) लेकिन वह उतना ही अच्छा, या उससे भी बेहतर सीखता है, क्योंकि वह उन चीजों पर ऊर्जा बर्बाद नहीं कर रहा है जिन्हें वह पहले से जानता है।

जो पेपर दावा करता है (परिणाम)

लेखकों ने तीन अलग-अलग प्रकार के वीडियो-लर्निंग रोबोट्स पर इसका परीक्षण किया:

  1. VideoChat2
  2. VideoLLaMA2
  3. InternVL3.5

उन्होंने पाया कि:

  • गति (Speed): रोबोट सामान्य से दोगुनी तेजी से अपने शिखर प्रदर्शन तक पहुँच गए।
  • दक्षता (Efficiency): उन्होंने मानक पद्धति की तुलना में केवल 38% टोकन का उपयोग किया।
  • सटीकता (Accuracy): कई मामलों में, REGATE के साथ प्रशिक्षित रोबोट पुराने तरीके से प्रशिक्षित रोबोट की तुलना में वास्तव में अधिक बुद्धिमान बन गए, विशेष रूप से जटिल वीडियो प्रश्नों पर।
  • कोई अतिरिक्त लागत नहीं (No Extra Cost): इस विधि के लिए नया रोबोट बनाने या अतिरिक्त भाग जोड़ने की आवश्यकता नहीं है; यह केवल प्रशिक्षण के दौरान रोबोट के पढ़ने के तरीके को बदल देता है।

सारांश

REGATE AI प्रशिक्षण के लिए एक स्मार्ट फिल्टर की तरह है। AI को स्क्रिप्ट में हर एक शब्द पढ़ने के बजाय, यह एक "केवल-टेक्स्ट" विशेषज्ञ का उपयोग करता है जो उन शब्दों की पहचान करता है जिन्हें वास्तव में समझने के लिए वीडियो संदर्भ की आवश्यकता होती है। आसान, अनावश्यक शब्दों को छोड़कर, AI तेजी से सीखता है, कम बिजली का उपयोग करता है, और अक्सर उस स्तर से अधिक स्मार्ट होता है जितना कि वह सब कुछ पढ़ने के बाद होता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →