← नवीनतम पेपर
💻 computer science

Conformal Coverage Guarantees for Any Video Temporal Grounder

यह शोध पत्र COVER प्रस्तुत करता है, जो एक पोस्ट-हॉक, मॉडल-अज्ञेय (model-agnostic) फ्रेमवर्क है जो किसी भी वीडियो टेम्पोरल ग्राउंडर को वास्तविक घटना के क्षण को समाहित करने वाले परिमित-नमूना (finite-sample), वितरण-मुक्त (distribution-free) गारंटियों के साथ टेम्पोरल क्षेत्रों को उत्सर्जित करके एक विश्वसनीय भविष्यवक्ता में बदल देता है, जिससे घटना की सीमाओं की अंतर्निहित अस्पष्टता और वर्तमान प्रणालियों में विश्वसनीयता मेट्रिक्स की कमी को संबोधित किया जाता है।

मूल लेखक: Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

प्रकाशित 2026-08-10
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं और कोई आपसे पूछता है, "नायक अंततः खलनायक को कब पकड़ता है?" आप शायद एक शुरुआत का समय और एक समाप्ति का समय इंगित करेंगे। लेकिन यदि आप अपने दस अलग-अलग दोस्तों से उसी क्लिप पर उन सटीक क्षणों को चिह्नित करने के लिए कहें, तो आपको दस अलग-अलग उत्तर मिल सकते हैं। कुछ कहेंगे कि पीछा एक सेकंड पहले शुरू हुआ था; कुछ कहेंगे कि यह कुछ सेकंड बाद समाप्त हुआ। कंप्यूटर विज़न की दुनिया में, इसे "वीडियो टेम्पोरल ग्राउंडिंग" (video temporal grounding) कहा जाता है। यह कंप्यूटर को वीडियो में विशिष्ट क्षणों को एक टेक्स्ट विवरण के आधार पर खोजने के लिए सिखाने का कार्य है। पेचीदा हिस्सा यह है कि "सत्य" उत्तर टाइमलाइन पर एक एकल, पूर्ण रेखा नहीं है; यह संभावनाओं का एक धुंधला बादल है क्योंकि मानवीय धारणा स्वाभाविक रूप से अस्पष्ट होती है।

वर्तमान में, अधिकांश कंप्यूटर प्रोग्राम ऐसे व्यवहार करते हैं जैसे वे पूरी तरह से आश्वस्त हों। वे टाइमलाइन पर एक एकल बॉक्स खींचते हैं और कहते हैं, "यही है!" लेकिन यदि वह बॉक्स गलत है, तो कंप्यूटर कोई चेतावनी नहीं देता है। यह एक मौसम ऐप की तरह है जो कहता है, "दोपहर 2:00 बजे बारिश होगी," लेकिन यह नहीं बताता कि यह वास्तव में 1:55 पर शुरू हो सकती है या 2:10 पर समाप्त हो सकती है। यदि आप एक रोबोट हैं जो वीडियो संपादित करने की कोशिश कर रहा है या एक सर्च इंजन है जो एक विशिष्ट क्लिप खोजने की कोशिश कर रहा है, तो आपको न केवल यह जानने की आवश्यकता है कि घटना कहाँ है, बल्कि यह भी कि कंप्यूटर कितना निश्चित है। यह शोध पत्र इस समस्या को हल करता है, कंप्यूटर को एक तरीका देकर जिससे वह कह सके, "मैं 90% आश्वस्त हूँ कि घटना इस व्यापक, सुरक्षित क्षेत्र के भीतर कहीं होती है," बिना कंप्यूटर को फिर से प्रशिक्षित किए या उसके मस्तिष्क के अंदर झाँके।

समस्या: "आत्मविश्वासी" गलती

इस पेपर के लेखकों ने, कूर्बन इंटेलिजेंस लैब (Kurban Intelligence Lab) के साथ मिलकर काम करते हुए, देखा कि वीडियो AI के काम करने के तरीके में एक बड़ा अंतर है। जब एक कंप्यूटर वीडियो में एक क्षण खोजने की कोशिश करता है, तो वह आमतौर पर एक एकल अंतराल (एक प्रारंभ समय और एक समाप्ति समय) देता है। समस्या यह है कि "ग्राउंड ट्रुथ" (ground truth)—वास्तविक सही उत्तर—अक्सर एक वितरण (distribution) होता है, जिसका अर्थ है कि अलग-अलग लोग थोड़े अलग समय को चिह्नित करेंगे। क्योंकि कंप्यूटर केवल एक उत्तर देता है, एक गलत भविष्यवाणी बिल्कुल एक सही भविष्यवाणी जैसी ही दिखती है। यदि आप एक ऐसा टूल बना रहे हैं जो इन भविष्यवाणियों पर निर्भर है, तो आपके पास यह जानने का कोई तरीका नहीं है कि कंप्यूटर पर कब भरोसा करना है और कब अपनी खोज को विस्तृत करना है।

कुछ शोधकर्ताओं ने मॉडलों को अपनी अनिश्चितता का अनुमान लगाने के लिए प्रशिक्षित करके, या बस एक निश्चित मात्रा में समय (एक "मार्जिन") जोड़कर इसे ठीक करने की कोशिश की। लेखक तर्क देते हैं कि ये विधियाँ त्रुटिपूर्ण हैं। निश्चित मार्जिन पहनना ऐसा है जैसे सभी के लिए एक ही आकार के जूते पहनना; वे एक बच्चे को पूरी तरह फिट हो सकते हैं लेकिन एक वयस्क या एक विशालकाय व्यक्ति के लिए बहुत बड़े या बहुत छोटे हो सकते हैं। अपने परीक्षणों में, उन्होंने पाया कि केवल एक यादृच्छिक (random) मार्जिन चुनने से कंप्यूटर सही होने की दर वीडियो के आधार पर 10% से 100% तक हो सकती है। अन्य विधियाँ जो शून्य से अनिश्चितता सीखने की कोशिश करती हैं, अक्सर उस विश्वसनीयता को प्रदान करने में विफल रहती हैं जिसका वे वादा करती हैं, कभी-कभी वास्तविक क्षण को चूक जाती हैं भले ही वे 80% आश्वस्त होने का दावा करें।

समाधान: "सेफ्टी रैपर" (कवर)

यहाँ कवर (Cover) आता है, जो इस पेपर में वर्णित एक नया टूल है। कवर को एक नए मस्तिष्क के रूप में नहीं, बल्कि एक स्मार्ट सुरक्षा रैपर (safety wrapper) के रूप में सोचें जिसे आप किसी भी मौजूदा वीडियो-खोजने वाले प्रोग्राम पर लगा सकते हैं, चाहे वह एक जटिल, प्रशिक्षित मॉडल हो या एक ब्लैक-बॉक्स AI जिसके अंदर आप नहीं देख सकते।

यह कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए: कल्पना कीजिए कि आप एक जाल (कंप्यूटर की भविष्यवाणी) में एक फिसलन भरी मछली (सच्ची घटना) को पकड़ने की कोशिश कर रहे हैं। कंप्यूटर एक जाल फेंकता है जो आमतौर पर करीब होता है, लेकिन कभी-कभी पूंछ या सिर को चूक जाता है। कवर कंप्यूटर के फेंकने वाले हाथ को नहीं बदलता है। इसके बजाय, यह ज्ञात वीडियो के एक सेट (एक "कैलिब्रेशन सेट") पर कंप्यूटर का अभ्यास देखता है। यह मापता है कि मछली को हर बार पकड़ने के लिए कंप्यूटर के जाल को वास्तव में कितना खींचने की आवश्यकता है।

एक बार जब यह जान लेता है कि मछली को पकड़ने में, मान लीजिए, 90% आश्वस्त होने के लिए कितना खिंचाव आवश्यक है, तो यह उस खिंचाव को प्रत्येक नई भविष्यवाणी पर लागू करता है। यदि कंप्यूटर कहता है कि घटना 10 सेकंड से 20 सेकंड तक है, तो कवर कह सकता है, "ठीक है, 90% आश्वत होने के लिए, चलिए मान लेते हैं कि यह वास्तव में 8 सेकंड से 22 सेकंड के बीच है।" यह नया, व्यापक क्षेत्र गारंटी के साथ उस संभाव्यता को समाहित करेगा जो आपने मांगी है।

उन्होंने क्या पाया

शोधकर्ताओं ने इस "रैपर" का परीक्षण तीन अलग-अलग वीडियो डेटासेट और पांच अलग-अलग प्रकार के वीडियो-खोजने वाले प्रोग्रामों पर किया। उनके परिणाम काफी स्पष्ट थे:

  1. यह काम करता है: जब उन्होंने 90% गारंटी मांगी, तो सिस्टम ने 90% सफलता दर दी। "रियलाइज्ड कवरेज" (वास्तव में कितनी बार वे सही थे) ने लक्ष्य का लगभग पूरी तरह से पीछा किया।
  2. फिक्स्ड मार्जिन विफल होते हैं: उन्होंने बिना कैलिब्रेशन के केवल एक निश्चित समय जोड़ने (जैसे "10 सेकंड जोड़ें") के पुराने विचार का परीक्षण किया। परिणाम अराजक थे। वीडियो और मॉडल के आधार पर, सफलता दर 0.096 (10% से भी कम!) से लेकर 1.000 (100%) तक बहुत अधिक उतार-चढ़ाव वाली थी। यह साबित करता है कि आप केवल सुरक्षा मार्जिन का अनुमान नहीं लगा सकते; आपको इसे कैलिब्रेट करना ही होगा।
  3. "एविडेंशियल" (Evidential) जाल: उन्होंने विशेष रूप से अपनी अनिश्चितता का अनुमान लगाने के लिए डिज़ाइन किए गए एक विशेष प्रकार के AI का परीक्षण किया। भले ही इस AI ने 80% आश्वस्त होने का दावा किया, लेकिन यह केवल 66% बार ही सही था। हालाँकि, कवर ने उसी AI से ली गई भविष्यवाणियों को एक नए स्तर में लपेटा जिसने वास्तव में वैध 80% गारंटी प्राप्त की। इसने दिखाया कि अनिश्चित होने के लिए बनाए गए मॉडल भी अपनी अनिश्चितता के बारे में गलत हो सकते हैं।
  4. असममिति (Asymmetry) मायने रखती है: उन्होंने पाया कि कुछ मॉडल यह जानने में माहिर हैं कि घटना कब शुरू होती है, लेकिन यह जानने में बहुत खराब हैं कि यह कब समाप्त होती है। इन मॉडलों के लिए, कवर ने पाया कि अंतराल के अंत को खींचने के लिए शुरुआत की तुलना में बहुत अधिक विस्तार की आवश्यकता थी। प्रत्येक तरफ को अलग-अलग खींचने की अनुमति देकर, वे सुरक्षा क्षेत्र को अधिक सटीक और कुशल बना सके।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि वीडियो टेम्पोरल ग्राउंडिंग के लिए, "सही" उत्तर समय का एक बिंदु नहीं है, बल्कि एक विश्वास कथन (confidence statement) के साथ एक क्षेत्र है। कवर उस क्षेत्र को प्राप्त करने का एक तरीका प्रदान करता है जिसके लिए आपको AI को फिर से प्रशिक्षित करने या उसके आंतरिक कोड तक पहुँचने की आवश्यकता नहीं है। यह किसी भी वीडियो-खोजने वाले टूल को एक ऐसे टूल में बदल देता है जो कह सकता है, "मैं 100% आश्वस्त नहीं हूँ, लेकिन मैं 95% आश्वस्त हूँ कि घटना इस बॉक्स के भीतर है," और यह वास्तव में गणित के साथ अपने दावे को पुख्ता करता है।

लेखक इस बात पर जोर देते हैं कि यह गारंटी तब तक बनी रहती है जब तक कि नए वीडियो अभ्यास के लिए उपयोग किए गए वीडियो के समान हों (एक अवधारणा जिसे "एक्सचेंजेबिलिटी" कहा जाता है)। यदि वीडियो अभ्यास सेट से पूरी तरह से अलग हैं, तो गारंटी कमजोर हो सकती है, लेकिन विधि अभी भी उस बदलाव को मापने और समायोजित करने का एक तरीका प्रदान करती है। अंततः, कवर एक अनुमान लगाने वाले खेल को एक विश्वसनीय, कैलिब्रेटेड प्रक्रिया में बदल देता है, यह सुनिश्चित करता है कि जब कंप्यूटर वीडियो के किसी क्षण की ओर इशारा करता है, तो हमें पता होता है कि उस पर कितना भरोसा किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →