← नवीनतम पेपर
💬 NLP

On the Limits of Token Reduction for Efficient Unified Vision Language Training

मूल लेखक: Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके शोध पत्र (paper) का विवरण दिया गया है।

बड़ी तस्वीर: एक मस्तिष्क, दो काम

कल्पना कीजिए कि एक सुपर-स्मार्ट रोबोट मस्तिष्क (जिसे यूनिफाइड विजन-लैंग्वेज मॉडल कहा जाता है) को एक ही समय में दो बहुत अलग काम करने के लिए प्रशिक्षित किया गया है:

  1. जासूस (The Detective): एक तस्वीर को देखना और उसके बारे में सवालों के जवाब देना (विजुअल अंडरस्टैंडिंग)।
  2. चित्रकार (The Painter): एक विवरण को देखना और शून्य से एक चित्र बनाना (विजुअल जनरेशन)।

आमतौर पर, एक रोबोट को ये दोनों काम करने के लिए प्रशिक्षित करना अविश्वसनीय रूप से महंगा और धीमा होता है, जैसे मैराथन दौड़ने के साथ-साथ करतब दिखाना (juggling)। शोधकर्ताओं ने यह देखने की कोशिश की कि क्या वे इस प्रशिक्षण को "प्रूनिंग" (छंटाई) करके तेज़ कर सकते हैं, विशेष रूप से मस्तिष्क के प्रोसेसिंग के अनावश्यक हिस्सों को हटाकर, जिसे इमेज टोकन (तस्वीरों के डिजिटल निर्माण खंड) कहा जाता है।

खोज: दो अलग-अलग लय (Rhythms)

शोधकर्ताओं ने बारीकी से देखा कि यह रोबक मस्तिष्क परत-दर-परत (एक गगनचुंबी इमारत की मंजिलों की तरह) कैसे काम करता है और उन्हें दो कामों के बीच एक आश्चर्यजनक अंतर मिला:

  • जासूस (समझना): जब रोबोट एक तस्वीर का विश्लेषण कर रहा होता है, तो वह शुरुआत में (ग्राउंड फ्लोर पर) तस्वीर को बहुत गहराई से देखता है। लेकिन जैसे-जैसे वह जटिल तर्क (reasoning) करने के लिए गगनचुंबी इमारत की ऊपरी मंजिलों पर जाता है, वह ज्यादातर तस्वीर को देखना बंद कर देता है और पूरी तरह से टेक्स्ट (पाठ) पर ध्यान केंद्रित करता है। ऊपरी मंजिलों में इमेज "रिडंडेंट" (अनावश्यक बोझ) हो जाती है।

    • उपमा: यह एक मानचित्र (map) पढ़ने जैसा है। आप अपनी स्थिति जानने के लिए शुरुआत में मानचित्र को ध्यान से देखते हैं, लेकिन एक बार जब आपको पता चल जाता है कि आप कहाँ हैं, तो आप केवल GPS की आवाज़ सुनते हुए बाकी रास्ता तय कर सकते हैं। आपको पूरी यात्रा के दौरान मानचित्र को घूरने की ज़रूरत नहीं है।
  • चित्रकार (निर्माण करना): जब रोबक एक चित्र बना रहा होता है, तो उसे ग्राउंड फ्लोर से लेकर टॉप फ्लोर तक लगातार इमेज टोकन्स को देखना पड़ता है। हर नया ब्रशस्ट्रोक पिछले स्ट्रोक पर निर्भर करता है। यदि आप इमेज को देखना बंद कर देते हैं, तो चित्र बिगड़ जाएगा।

    • उपमा: यह ताश के पत्तों का घर (house of cards) बनाने जैसा है। आप पहले से रखे गए पत्तों को देखना बंद नहीं कर सकते; यदि आप उन्हें अनदेखा करते हैं, तो अगला पत्ता पूरे ढांचे को गिरा देगा।

प्रयोग: गति बढ़ाने की कोशिश

इस खोज के आधार पर, शोधकर्ताओं ने इमेज डेटा को वहां से हटाकर प्रशिक्षण को तेज़ करने की कोशिश की जहाँ उसकी आवश्यकता नहीं थी:

  1. जासूस के लिए: उन्होंने ऊपरी मंजिलों से इमेज डेटा को हटा दिया।
    • परिणाम: सफलता! रोबोट का प्रशिक्षण 76% तेज़ हो गया, और उसकी सवाल पूछने की क्षमता में बहुत कम गिरावट आई। इसने साबित कर दिया कि ऊपरी परतों में इमेज डेटा वास्तव में अतिरिक्त बोझ था।
  2. चित्रकार के लिए: उन्होंने बीच की परतों में इमेज प्रोसेसिंग को छोड़ने (skip करने) की कोशिश की।
    • परिणाम: सफलता (मुख्यतः)। कुछ विशिष्ट परतों को सावधानीपूर्वक छोड़कर, उन्होंने गणना का समय बचाया, और रोबोट ने वास्तव में बेहतर चित्र बनाए क्योंकि इसने मस्तिष्क को अपने इमेज-प्रोसेसिंग टूल्स को अधिक कुशलता से व्यवस्थित करने के लिए मजबूर किया।

मोड़: "सिनर्जी लॉस" (Synergy Loss)

यहाँ शोध पत्र की सबसे महत्वपूर्ण खोज है। जब शोधकर्ताओं ने इन दोनों स्पीड-अप ट्रिक्स को एक ही रोबोट में मिलाने की कोशिश की जो एक ही समय में दोनों काम करता है, तो सब कुछ बिगड़ गया।

  • समस्या: जासूस को ऊपरी मंजिलों में इमेज को अनदेखा करने की आवश्यकता है, लेकिन चित्रकार को ऊपरी मंजिलों में इमेज को देखना ही होगा
  • उपमा: कल्पना कीजिए कि एक छात्र एक ही समय में गणित और इतिहास की परीक्षा के लिए पढ़ाई करने की कोशिश कर रहा है।
    • गणित के लिए, उसे इतिहास की किताब को अनदेखा करने की आवश्यकता है।
    • इतिहास के लिए, उसे गणित की किताब को अनदेखा करने की आवश्यकता है।
    • यदि आप उसे एक ऐसी "स्पीड-अप" विधि का उपयोग करने के लिए मजबूर करते हैं जो उसे गणित के लिए किताब को अनदेखा करने और इतिहास के लिए भी किताब को अनदेखा करने के लिए कहती है, तो वह दोनों किताबों को ही अनदेखा कर देता है। वह दोनों विषयों को अच्छी तरह से नहीं सीख पाता।

पेपर में, जब उन्होंने दोनों स्पीड-अप विधियों को मिलाया, तो रोबोट का प्रदर्शन दोनों कार्यों पर गिर गया। "सिनर्जी" (वह जादुई उछाल जो आपको आमतौर पर दो कार्यों को एक साथ प्रशिक्षित करने पर मिलता है) गायब हो गई। रोबोट दोनों कामों में उतना ही खराब हो गया जितना कि यदि उसने उन्हें अलग-अलग सीखा होता।

निष्कर्ष: साझा पथ को न काटें

पेपर निष्कर्ष निकालता है कि आप केवल एक काम के लिए काम करने वाले "स्पीड-अप" ट्रिक्स को ले सकते हैं और उन्हें एक मल्टी-टास्क रोबोट के लिए आपस में मिला नहीं सकते।

  • सबक: एक एकीकृत (unified) रोबोट को कुशल बनाने के लिए, आपको "साझा मार्गों" (shared pathways) को खुला रखना होगा। भले ही जासूस को ऊपरी मंजिलों में इमेज की आवश्यकता न हो, लेकिन चित्रकार को इसकी आवश्यकता होती है। यदि आप पैसा बचाने के लिए उस पथ को काट देते हैं, तो आप चित्रकार को नुकसान पहुँचाते हैं, और चूंकि दोनों काम आमतौर पर एक-दूसरे की मदद करते हैं, इसलिए आप जासूस को भी नुकसान पहुँचाते हैं।

संक्षेप में: आप एक रोबोट की गति बढ़ा सकते हैं यदि वह केवल एक चीज़ करता है। लेकिन यदि वह दो चीजें करता है जिन्हें एक ही मस्तिष्क से अलग-अलग चीजों की आवश्यकता होती है, तो आपको उन कनेक्शनों को काटने में बहुत सावधान रहना होगा जो उन्हें एक साथ काम करने में मदद करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →