← नवीनतम पेपर
💻 computer science

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

यह शोध पत्र VisCoP को प्रस्तुत करता है, जो एक पैरामीटर-कुशल ढांचा है जो विजन एनकोडर को सीखने योग्य विजुअल प्रोब्स के साथ संवर्धित करके, महत्वपूर्ण वितरण बदलावों वाले नवीन वीडियो डोमेन के अनुकूल बड़े विजन लैंग्वेज मॉडल्स को अनुकूलित करता है, जिससे पूर्व-प्रशिक्षित क्षमताओं को बनाए रखते हुए और कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) को रोके बिना उत्कृष्ट टार्गेट-डोमेन प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "VISCOP: Visual Probing for Video Domain Adaptation of Vision Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: एक नए किचन में "एक्सपर्ट शेफ"

कल्पना कीजिए कि आपके पास एक विश्व स्तरीय शेफ (एक विज़न लैंग्वेज मॉडल या VLM) है जिसने एक विशिष्ट, उच्च-स्तरीय रेस्तरां में वर्षों बिताए हैं। वे जानते हैं कि उस विशिष्ट किचन के लिए सब्जियां कैसे काटनी हैं, मांस को कैसे सीजन करना है और व्यंजन कैसे सजाना है। वे अपने काम में अद्भुत हैं।

अब, कल्पना कीजिए कि आप इस शेफ को पूरी तरह से अलग किचन में ले जाना चाहते हैं। शायद यह एक छोटा फूड ट्रक हो (एक अलग व्यूपॉइंट/दृष्टिकोण), एक ऐसा किचन जो आँखों के बजाय गर्मी देखने के लिए थर्मल कैमरों का उपयोग करता है (अलग मोडैलिटी), या एक ऐसा किचन जहाँ शेफ को अपने हाथों के बजाय एक रोबोटिक आर्म को नियंत्रित करना होगा (अलग टास्क)।

यदि आप बस शेफ से कहते हैं, "जाओ और इस नए किचन में खाना बनाओ," तो दो बुरी चीजें होती हैं:

  1. वे भ्रमित हो जाते हैं: वे अपनी पुरानी तकनीकों का उपयोग करने की कोशिश करते हैं, जो नए वातावरण में काम नहीं करतीं।
  2. वे अपने पुराने कौशल भूल जाते हैं: यदि आप उन्हें नए किचन में फिट होने के लिए सब कुछ फिर से सीखने के लिए मजबूर करते हैं, तो वे उन मूल व्यंजनों को भूल सकते हैं जिनके लिए वे प्रसिद्ध थे। इसे कैटास्ट्रॉफ़िक फॉरगेटिंग (catastrophic forgetting) कहा जाता है।

वर्तमान तरीके आमतौर पर इसे ठीक करने की कोशिश करते हैं:

  • शेफ के हाथों को फ्रीज करके: उन्हें पुराने औजारों का उपयोग करने देते हैं लेकिन उन्हें नए करतब सीखने नहीं देते (वे भ्रमित रहते हैं)।
  • उनके दिमाग को रीवायर (rewire) करके: उन्हें सब कुछ फिर से सीखने के लिए मजबूर करना, जिससे वे अपने मूल व्यंजनों को भूल जाते हैं।

समाधान: VISCOP (द "ट्रैफिक कॉप")

लेखकों ने एक नई विधि पेश की है जिसे VISCOP (विजुअल कॉन्टेक्स्टुअलाइज्ड प्रोबिंग) कहा जाता है।

VISCOP को शेफ और नए किचन के बीच खड़े एक विशेष ट्रैफिक पुलिस (Traffic Cop) या एक अनुवादक (Translator) के रूप में सोचें।

  1. शेफ अपनी जगह पर रहता है: मूल शेफ (विज़न एनकोडर) फ्रीज है। हम उनके दिमाग को नहीं छूते और न ही उन्हें फिर से प्रशिक्षित करते हैं। वे अपने सभी मूल ज्ञान को सुरक्षित रखते हैं।
  2. ट्रैफिक कॉप बीच में आता है: हम विजुअल प्रोब्स (Visual Probes) (ट्रैफिक कॉप) की एक छोटी, स्मार्ट टीम पेश करते हैं। ये छोटे, सीखने योग्य टोकन हैं जो एक पुल (bridge) के रूप में कार्य करते हैं।
  3. यह कैसे काम करता है:
    • शेफ भोजन (वीडियो) को देखता है और अपने सामान्य संकेत भेजता है।
    • ट्रैफिक कॉप (VISCOP) शेफ की विचार प्रक्रिया के विभिन्न चरणों में इन संकेतों को रोकता है (केवल अंत में ही नहीं, बल्कि बीच में भी)।
    • कॉप पूछता है, "हे, इस विशिष्ट किचन में, उस संकेत का कौन सा हिस्सा मायने रखता है?"
    • कॉप उन विशिष्ट सुरागों को चुनना सीख जाता है जिनकी नए किचन के लिए आवश्यकता होती है (जैसे "यह एक डेप्थ मैप है" या "यह एक रोबोटिक आर्म है") बिना शेफ के मूल मस्तिष्क को बदले।
    • कॉप फिर इन नए, विशिष्ट निर्देशों को शेफ के सहायक (लैंग्वेज मॉडल) को फुसफुसाकर बताता है, जो फिर अंतिम उत्तर देता है।

यह बेहतर क्यों है?

पेपर ने तीन कठिन परिदृश्यों में इसका परीक्षण किया:

  • क्रॉस-व्यू (Cross-View): दीवार पर लगे कैमरे (exocentric) से लेकर व्यक्ति के सिर पर लगे कैमरे (egocentric) तक स्विच करना।
  • क्रॉस-मोडैलिटी (Cross-Modality): सामान्य रंगीन वीडियो (RGB) से डेप्थ मैप (दृश्य के 3D कंकाल की तरह) देखने में स्विच करना।
  • क्रॉस-टास्क (Cross-Task): मानव क्रियाओं को समझने से लेकर एक रोबोटिक आर्म को नियंत्रित करने तक स्विच करना।

परिणाम:

  • पुराने तरीके: या तो मॉडल नए कार्य में अच्छा हो जाता था लेकिन पुराना भूल जाता था, या वह पुराने कौशल बनाए रखता था लेकिन नए कार्य में विफल हो जाता था।
  • VISCOP: यह "गोल्डिलॉक्स" (Goldilocks) समाधान था। इसने नए किचन के नियमों को पूरी तरह से सीखा (नए कार्यों पर उच्च स्कोर प्राप्त किया) और इसने शेफ के मूल व्यंजनों को सुरक्षित रखा (पुराने कार्यों पर उच्च स्कोर बनाए रखा)। वास्तव में, कुछ मामलों में, यह पुराने कार्यों में और भी बेहतर हो गया क्योंकि नए प्रशिक्षण ने चीजों को स्पष्ट करने में मदद की।

एक्शन में "ट्रैफिक कॉप" मेटफर

लेखक VISCOP को "ट्रैफिक कॉप" कहते हैं क्योंकि यह सीखने के प्रवाह को निर्देशित करता है।

  • VISCOP के बिना, "ग्रेडिएंट्स" (सीखने के संकेत) सीधे शेफ के मस्तिष्क से टकराते हैं, जिससे एक "क्रैश" (भूलना) होता है।
  • VISCOP के साथ, ट्रैफिक कॉप सीखने के संकेतों को एक साइड लेन (प्रोब्स) में मोड़ देता है। साइड लेन नए नियम सीखती है, जबकि मुख्य हाईवे (शेफ) सुचारू और सुरक्षित रहता है।

मुख्य बातें

  • कोई रीवायरिंग नहीं: आपको AI के विशाल, महंगे हिस्से (विज़न एनकोडर) को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • छोटा और कुशल: "ट्रैफिक कॉप" (प्रोब्स) बहुत छोटा है और इससे कंप्यूटिंग पावर में लगभग कोई अतिरिक्त वृद्धि नहीं होती है।
  • बहुमुखी (Versatile): चाहे आप कैमरा एंगल बदल रहे हों, सेंसर का प्रकार बदल रहे हों, या AI का वास्तविक काम बदल रहे हों, यह हर जगह काम करता है।

संक्षेप में, VISCOP एक स्मार्ट AI को यह सीखने की अनुमति देता है कि वह क्या था और उसने पहले से क्या जाना था, उसे भूले बिना एक नए वातावरण के लिए नए कौशल सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →