← नवीनतम पेपर
💻 computer science

TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition

यह शोध पत्र TACO को प्रस्तुत करता है, जो एक ओपन-वोकेबुलरी वीडियो रिकग्निशन फ्रेमवर्क है, जो आउट-ऑफ-डिस्ट्रीब्यूशन अलाइनमेंट को संरक्षित करने के लिए रिलेटिव स्ट्रक्चर डिस्टिलेशन का उपयोग करके और टास्क-स्पेसिफिक अडैप्टेशन को टेस्ट-टाइम रिप्रेजेंटेशन स्पेस से डीकपल करने के लिए एक स्पेशलाइजेशन प्रोजेक्शन का उपयोग करके ऑब्जेक्टिव इनकंसिस्टेंसी के कारण होने वाले रिप्रेजेंटेशन डेविएशन को कम करता है, जिससे विविध बेंचमार्क पर स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Minghao Zhu, Xiao Lin, Mengxian Hu, Xun Zhou, Liuyi Wang, Xiaoyan Qi, Chengju Liu, Qijun Chen

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minghao Zhu, Xiao Lin, Mengxian Hu, Xun Zhou, Liuyi Wang, Xiaoyan Qi, Chengju Liu, Qijun Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास CLIP नामक एक शानदार, दुनिया घूमने वाला मार्गदर्शक (guide) है। इस मार्गदर्शक ने लाखों किताबें पढ़ी हैं और लाखों तस्वीरें देखी हैं, इसलिए वे केवल एक तस्वीर देखकर या विवरण पढ़कर ही पहचान सकते हैं कि "बिल्ली" क्या है, "सूर्यास्त" क्या है, या "खुश कुत्ता" क्या है। वे बहुत अधिक विविधता देख चुके हैं, इसलिए वे सामान्यीकरण (generalizing) करने में माहिर हैं।

अब, आप इस मार्गदर्शक को वीडियो पहचानना सिखाना चाहते हैं (जो चलते-फिरते हैं और समय के साथ बदलते हैं) और विशेष रूप से, उन्हें ऐसी वीडियो श्रेणियों को पहचानना सिखाना चाहते हैं जिन्हें उन्होंने पहले कभी नहीं देखा है (जैसे "मशालों के साथ करतब दिखाना" या "रोबोट के साथ डांस करना")। यह ओपन-वोकैबुलरी वीडियो रिकग्निशन (Open-Vocabulary Video Recognition) की चुनौती है।

समस्या यह है कि जब आप इस मार्गदर्शक को वीडियो के विशिष्ट उदाहरणों (जैसे 400 सामान्य क्रियाओं के डेटासेट) पर प्रशिक्षित करने का प्रयास करते हैं, तो वे "बहुत अधिक विशिष्ट" (too specialized) हो जाते हैं। वे अपने व्यापक, सामान्य ज्ञान को भूलने लगते हैं और केवल उन विशिष्ट चीजों के विशेषज्ञ बन जाते हैं जिन्हें उन्हें अभी सिखाया गया है। यदि आप फिर उन्हें किसी बिल्कुल नई चीज़ के वीडियो को पहचानने के लिए कहते हैं, तो वे संघर्ष करते हैं क्योंकि वे अपना मूल "मानचित्र" (map) खो चुके होते हैं।

इस शोध पत्र के लेखक, TACO, तर्क देते हैं कि इस मार्गदर्शक को प्रशिक्षित करने का वर्तमान तरीका त्रुटिपूर्ण है। वे मार्गदर्शक को केवल "ज्ञात" क्षेत्र (प्रशिक्षण डेटा) पर प्रशिक्षित कर रहे हैं, लेकिन उनसे बाद में "अज्ञात" क्षेत्र (नई श्रेणियों) में नेविगेट करने की अपेक्षा कर रहे हैं। इसके कारण मार्गदर्शक का आंतरिक मानचित्र विकृत और बिगड़ा हुआ हो जाता है।

यहाँ बताया गया है कि TACO इसे कैसे ठीक करता है, इसके लिए दो मुख्य तरकीबों का उपयोग करके:

1. "जियोमेट्रिक एंकर" की तरकीब (रिलेटिव स्ट्रक्चर डिस्टिलेशन)

कल्पना कीजिए कि मार्गदर्शक का मस्तिष्क एक विशाल 3D मानचित्र है जहाँ प्रत्येक अवधारणा (जैसे "दौड़ना," "तैरना," या "खाना बनाना") स्थान में एक बिंदु है। एक अच्छे मानचित्र में, "दौड़ना" और "चलना" के बीच की दूरी और दिशा सुसंगत रहनी चाहिए, भले ही आप "तेजी से दौड़ना" जैसे नए बिंदु जोड़ दें।

जब आप मार्गदर्शक को नए वीडियो डेटा पर प्रशिक्षित करते हैं, तो मानचित्र सिकुड़ जाता और खिंच जाता है। "दौड़ना" और "चलना" के बिंदु बहुत दूर जा सकते हैं या बहुत करीब आ सकते हैं, जिससे मानचित्र का मूल तर्क टूट जाता है।

TACO का समाधान:
केवल ज्ञात बिंदुओं को देखने के बजाय, TACO मानचित्र के चारों ओर हजारों अदृश्य, यादृच्छिक (random) "बीकन" (जिन्हें जियोमेटमिक एंकर्स कहा जाता है) बिखेर देता है, जिसमें वे खाली स्थान भी शामिल हैं जहाँ मार्गदर्शक अभी तक नहीं गया है।

  • यह कैसे काम करता है: प्रशिक्षण के दौरान, सिस्टम लगातार जाँच करता है: "हे, यदि 'दौड़ना' हिलता है, तो क्या इन यादृच्छिक बीकन्स के साथ इसकी दूरी पहले की तरह बनी रहती है?"
  • परिणाम: यह मार्गदर्शक को अपने आंतरिक मानचित्र के आकार को बरकरार रखने के लिए मजबूर करता है। भले ही ये बीकन्स वास्तविक चीजें नहीं हैं (वे केवल अंतरिक्ष में यादृच्छिक बिंदु हैं), वे एक कठोर ढांचे (scaffold) के रूप में कार्य करते हैं। वे मार्गदर्शक के मस्तिष्क को बहुत अधिक विकृत होने से रोकते हैं, यह सुनिश्चित करते हुए कि जब वे बाद में किसी नई श्रेणी का सामना करें, तो अवधारणाओं के बीच के संबंध अभी भी समझ में आने योग्य हों।

2. "स्पेशलाइजेशन हैट" की तरकीब (डिकपलिंग द स्पेसेस)

कल्पना कीजिए कि मार्गदर्शक दो अलग-अलग टोपियाँ पहने हुए है:

  1. "सोचने वाली" टोपी: यह उनका स्थायी मस्तिष्क है, जिसका उपयोग दुनिया को समझने और नई चीजों को पहचानने के लिए किया जाता है।
  2. "परीक्षा" वाली टोपी: यह एक अस्थायी उपकरण है जिसका उपयोग केवल उन विशिष्ट होमवर्क समस्याओं को हल करने के लिए किया जाता है जिन्हें वे अभी सीख रहे हैं।

मानक प्रशिक्षण में, मार्गदर्शक अपने मस्तिष्क पर सीधे "परीक्षा" वाली टोपी पहन लेता है। जैसे-जैसे वे होमवर्क हल करते हैं, उनका मस्तिष्क विशेष रूप से उस होमवर्क के लिए ढल जाता है, और वे सामान्य रूप से सोचना भूल जाते हैं।

TACO का समाधान:
TACO मार्गदर्शक के मस्तिष्क और परीक्षा के बीच एक हल्का, डिस्पोजेबल लेयर (एक स्पेशलाइजेशन प्रोजेक्शन) रखता है।

  • यह कैसे काम करता है: मार्गदर्शक वीडियो को समझने के लिए अपने स्थायी मस्तिष्क का उपयोग करता है, फिर उस समझ को विशिष्ट प्रशिक्षण कार्य को हल करने के लिए एक अस्थायी "एडेप्टर" के माध्यम से भेजता है। प्रशिक्षण इस एडेप्टर पर होता है, न कि सीधे मस्तिष्क पर।
  • परिणाम: जब वास्तविक परीक्षा (नए वीडियो को पहचानना) का समय आता है, तो मार्गदर्शक अपनी "परीक्षा" वाली टोपी और एडेप्टर को उतार देता है। उनके पास उनका मूल, बिना विकृत हुआ मस्तिष्क बच जाता है, जो अब कार्य के लिए पूरी तरह से अनुकूलित है लेकिन जिसने नई चीजों को पहचानने की अपनी सामान्य क्षमता नहीं खोई है।

निचोड़ (The Bottom Line)

शोध पत्र का दावा है कि इन दो विधियों का उपयोग करके—यादृच्छिक बीकन्स के साथ मानचित्र के आकार को कठोर बनाए रखना और प्रशिक्षण को स्थायी मस्तिष्क से अलग रखना—TACO एक ऐसा वीडियो रिकग्निशन सिस्टम बनाता है जो पिछले तरीकों की तुलना में नई, अनदेखी वीडियो श्रेणियों को पहचानने में बहुत बेहतर है।

उन्होंने कई अलग-अलग वीडियो डेटासेट (जैसे UCF-101, HMDB-51, और Kinetics) पर इसका परीक्षण किया और पाया कि उनकी विधि लगातार 'स्टेट-ऑफ-द-आर्ट' से बेहतर प्रदर्शन करती है, जो यह सिद्ध करता है कि आप मॉडल को नई चीजें सिखा सकते हैं बिना उसकी पुरानी बुद्धिमत्ता को भुलाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →