← नवीनतम पेपर
🤖 AI

Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models

यह शोध पत्र "Reroute" का प्रस्ताव करता है, जो विज़न-लैंग्वेज मॉडल्स के लिए एक ट्रेनिंग-फ्री प्लग-इन है जो अपरिवर्तनीय टोकन हटाने के स्थान पर एक रिकवरेबल रूटिंग मैकेनिज्म को प्रतिस्थापित करता है, जिससे विलंबित (deferred) विज़ुअल टोकन्स को बाद के डिकोडर चरणों में प्रोसेसिंग पूल में पुन: प्रवेश करने की अनुमति मिलती है ताकि दक्षता बनाए रखते हुए ग्राउंडिंग प्रदर्शन में सुधार किया जा सके।

मूल लेखक: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

प्रकाशित 2026-06-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cheng-Yu Yang, Shao-Yuan Lo, Yu-Lun Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दृश्य जानकारी का एक विशाल पुस्तकालय (एक छवि) है जिसे एक स्मार्ट रोबोट (एक विजन-लैंग्वेज मॉडल) को एक प्रश्न का उत्तर देने के लिए पढ़ना आवश्यक है। रोबोट पूरी तस्वीर को एक पूर्ण चित्र के रूप में नहीं पढ़ता है; यह इसे हजारों छोटे "विजुअल टोकन" में तोड़ देता है, जैसे कि पहेली के व्यक्तिगत टुकड़े।

समस्या यह है कि हजारों टुकड़ों को पढ़ने में बहुत अधिक ऊर्जा और मेमोरी लगती है, जिससे रोबोट की गति धीमी हो जाती है।

पुराना तरीका: "रैंक और रिमूव" (Rank and Remove)

पहले, काम को तेज करने के लिए, शोधकर्ताओं ने एक विधि का उपयोग किया था जिसे "रैंक और रिमूव" कहा जाता था।
इसे इस तरह समझें: यह एक सख्त लाइब्रेरियन की तरह है जो आपके पहेली के टुकड़ों को देखता है और कहता है, "ये 100 टुकड़े अभी महत्वपूर्ण लग रहे हैं। इन्हें रखें। बाकी के 900 टुकड़ों को हमेशा के लिए फेंक दें।"

लाइब्रेरियन यह निर्णय इस आधार पर लेता है कि उस ठीक उसी क्षण टुकड़े कैसे दिख रहे हैं। समस्या यह है कि रोबोट का मस्तिष्क परतों में काम करता है, जैसे कि एक बहु-मंजिला इमारत।

  • ग्राउंड फ्लोर पर (शुरुआती परतें): रोबोट भ्रमित है और सब कुछ अस्पष्ट रूप से देख रहा है। वह सोच सकता है कि आकाश का एक टुकड़ा महत्वहीन है।
  • टॉप फ्लोर पर (गहरी परतें): रोबोट अचानक महसूस करता है, "रुको! आकाश का वह टुकड़ा वास्तव में उस व्यक्ति के लिए बैकग्राउंड है जिसे मैं ढूंढ रहा हूँ!"

लेकिन क्योंकि लाइब्रेरियन ने ग्राउंड फ्लोर पर उस टुकड़े को फेंक दिया था, इसलिए रोबोट टॉप फ्लोर पर उसे कभी नहीं देख पाता। टुकड़े को फेंकने का निर्णय अपरिवर्तनीय (irreversible) था। यदि रोबोट को बाद में उस टुकड़े की आवश्यकता होती, तो बहुत देर हो चुकी होती। इस कारण से रोबोट उन कार्यों में विफल हो जाता था जिनमें सटीक स्थान बताने (जैसे कि ठीक कहाँ खड़ा है) की आवश्यकता होती है।

नया तरीका: "रूट, डोंट रिमूव" (Reroute, Don't Remove)

इस पेपर के लेखक एक नया तरीका प्रस्तावित करते हैं जिसे "रूट" (Reroute) कहा जाता है। टुकड़ों को फेंकने के बजाय, वे उन्हें एक "वेटिंग रूम" (प्रतीक्षा कक्ष) में रख देते हैं।

यह इस प्रकार काम करता है:

  1. चेकपॉइंट: इमारत के निचले हिस्से में, लाइब्रेरियन अभी भी टुकड़ों की जांच करता है। वे शीर्ष 10% को चुनते हैं ताकि वे अगले फ्लोर पर विस्तृत कार्य के लिए सीधे जा सकें।
  2. वेटिंग रूम: बाकी 90% को कचरे में नहीं फेंका जाता। उन्हें एक बायपास हॉलवे (एक रेसिडुअल पाथ) के माध्यम से भेजा जाता है जो वर्तमान फ्लोर के भारी काम को छोड़ देता है।
  3. पुनः प्रवेश (Re-Entry): जब रोबोट अगले फ्लोर पर अगले चेकपॉइंट पर पहुँचता है, तो लाइब्रेरियन पूरे संग्रह को फिर से देखता है—जिसमें वे टुकड़े भी शामिल हैं जो हॉलवे में प्रतीक्षा कर रहे थे।
  4. दूसरा मौका: यदि कोई टुकड़ा जिसे पहले de-prioritize किया गया था, दूसरे फ्लोर पर बहुत महत्वपूर्ण दिखने लगता है, तो लाइब्रेरियन उसे वेटिंग रूम से बाहर निकाल सकता है और उसे काम में शामिल कर सकता है।

यह क्यों महत्वपूर्ण है

पेपर दिखाता है कि यह सरल परिवर्तन—टुकड़ों को सिस्टम से हटाने के बजाय उन्हें बनाए रखना—एक बड़ा अंतर पैदा करता है, विशेष रूपकर तब जब रोबोट को बहुत कुशल (टुकड़ों के एक बहुत छोटे अंश को रखते हुए) होने के लिए मजबूर किया जाता है।

  • "हरे रंग की शर्ट वाले आदमी" का उदाहरण: पेपर के उदाहरणों में, जब रोबोट को "हरे रंग की शर्ट वाले आदमी" को खोजना था, तो पुराने तरीके ने शर्ट के टोकन को जल्दी ही फेंक दिया क्योंकि वह अभी महत्वपूर्ण नहीं लग रहा था। रोबोट आदमी को खोजने में विफल रहा। नया तरीका शर्ट के टोकन को वेटिंग रूम में रखता है। जब रोबट अपने तर्क (reasoning) में गहरा गया, तो उसने महसूस किया कि शर्ट महत्वपूर्ण है, उसने उसे वापस खींच लिया, और सफलतापूर्वक आदमी को खोज लिया।
  • कोई अतिरिक्त लागत नहीं: सबसे अच्छी बात यह है कि इसके लिए रोबोट को कुछ भी नया सीखने या अधिक ऊर्जा का उपयोग करने की आवश्यकता नहीं है। "वेटिंग रूम" वाले टुकड़े वर्तमान फ्लोर के भारी काम को छोड़ देते हैं, इसलिए उपयोग की जाने वाली कुल ऊर्जा लगभग उतनी ही रहती है जितनी कि पुराने "फेंकने वाले" तरीके की थी। यह केवल टुकड़ों को प्रबंधित करने का एक स्मार्ट तरीका है।

मुख्य निष्कर्ष (The Bottom Line)

लेखकों का तर्क है कि हमें दृश्य जानकारी को कम करने को एक बार के "डिलीट" बटन के रूप में नहीं देखना चाहिए। इसके बजाय, हमें इसे एक रूटिंग सिस्टम के रूप में देखना चाहिए। सूचना को "विलंबित" (deferred) करने की अनुमति देकर, ताकि वह वापस आ सके और पुन: मूल्यांकन किया जा सके जैसे-जैसे AI अधिक स्मार्ट होता जाता है, हम इन मॉडलों को बहुत तेज़ बना सकते हैं बिना उन्हें उन महत्वपूर्ण विवरणों के प्रति "अंधा" किए जो वे बाद में खोज सकते हैं।

लेखकों ने कई अलग-अलग AI मॉडलों पर इसका परीक्षण किया और पाया कि इसने वस्तुओं को खोजने (grounding) की क्षमता में लगातार सुधार किया, बिना मॉडल की सामान्य प्रश्नों के उत्तर देने की क्षमता को नुकसान पहुँचाए, और यह सब कुशलतापूर्वक कंप्यूटर को चलाकर किया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →