← नवीनतम पेपर
💻 computer science

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

यह शोध पत्र OnPoint को पेश करता है, जो एक ऑफलाइन-टू-ऑनलाइन मल्टी-लेवल डिस्टिलेशन फ्रेमवर्क है जो केवल सिंगल टेम्पोरल पॉइंट एनोटेशन का उपयोग करके, एक पॉइंट-सुपरवाइज्ड ऑफलाइन टीचर से ऑनलाइन स्टूडेंट में ज्ञान स्थानांतरित करके, स्ट्रीमिंग वीडियो परिदृश्यों में उच्च प्रदर्शन प्राप्त करके सुदृढ़ पॉइंट-सुपरवाइज्ड ऑनलाइन टेम्पोरल एक्शन लोकलाइजेशन (POTAL) को सक्षम बनाता है।

मूल लेखक: Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह पहचानना सिखाने की कोशिश कर रहे हैं कि वीडियो में कोई व्यक्ति "जगलिंग" (juggling) कर रहा है या "खाना बना" (cooking) रहा है।

पुराना तरीका (समस्या):
आमतौर पर, रोबोट को यह सिखाने के लिए, आपको पहले पूरा वीडियो देखना पड़ता है। आप हर जगलिंग एक्ट के सटीक शुरू और सटीक अंत के चारों ओर एक बॉक्स खींचते हैं। यह रोबोट को फिल्म की पूरी स्क्रिप्ट देने जैसा है।

  • चुनौती: हजारों वीडियो के लिए ऐसा करने में बहुत समय लगता है। साथ ही, वास्तविक दुनिया में (जैसे लाइव स्पोर्ट्स ब्रॉडकास्ट या सुरक्षा कैमरे में), वीडियो स्ट्रीम हो रहा होता है। रोबोट भविष्य नहीं देख सकता; उसे क्रिया (action) होते ही निर्णय लेना होता है, बिना यह जाने कि आगे क्या होने वाला है।

नया विचार (द "पॉइंट" समाधान):
इस पेपर के लेखकों ने, OnPoint, एक स्मार्ट तरीका निकाला है। पूरे स्टार्ट-एंड बॉक्स खींचने के बजाय, वे कहते हैं: "बस स्क्रीन पर एक सिंगल डॉट (बिंदु) पर क्लिक करें जब वह क्रिया हो रही हो।"

  • उपमा: कल्पना कीजिए कि आप एक छात्र को गाना पहचानने के लिए सिखा रहे हैं। गाने के सटीक सेकंड को लिखने के बजाय, आप बस तब मेज थपथपाते हैं जब कोरस आता है। वह सिंगल "टैप" (या पॉइंट) ही शिक्षक के लिए यह जानने के लिए काफी है कि क्या हो रहा है।

चुनौती:
यदि आप केवल एक सिंगल "टैप" देते हैं और इसे रियल-टाइम में काम करने के लिए कहते हैं (भविष्य देखे बिना), तो रोबोट भ्रमित हो जाता है। उसे नहीं पता होता कि क्रिया कितनी देर तक चलेगी या कब रुकनी चाहिए। यह किसी को एक नोट सुनकर गाने की लंबाई का अनुमान लगाने के लिए कहने जैसा है, जबकि गाना अभी भी चल रहा है।

समाधान: "टीचर-स्टूडेंट" सिस्टम
इस समस्या को हल करने के लिए, OnPoint एक चतुर Offline-to-Online Distillation फ्रेमवर्क का उपयोग करता है। इसे एक मास्टर शेफ (शिक्षक) द्वारा सु-शेफ (छात्र) को प्रशिक्षित करने के रूप में समझें।

  1. मास्टर शेफ (Offline Teacher): इस मॉडल को एक बार में पूरा वीडियो देखने का मौका मिलता है। इसके पास पीछे देखने और आगे देखने की सुविधा है। भले ही इसे इंसान से केवल एक सिंगल "टैप" मिले, लेकिन पूरा मूवी देखने के कारण, यह क्रिया के सटीक शुरू और अंत का पता लगा सकता है। यह छात्र के पालन करने के लिए एक "परफेक्ट रेसिपी" (जिसे Pseudo Label कहा जाता है) बनाता है।
  2. सु-शेफ (Online Student): यह वह मॉडल है जो वास्तव में रियल-टाइम में काम करता है। यह केवल वीडियो को स्ट्रीम के रूप में देखता है, फ्रेम दर फ्रेम। यह आगे नहीं देख सकता।

वे एक-दूसरे को कैसे सिखाते हैं (3-स्टेप लेसन):
मास्टर शेफ केवल अंतिम उत्तर नहीं देता; वह छात्र को तीन विशिष्ट कौशल सिखाता है ताकि भविष्य न देख पाने की कमी को पूरा किया जा सके:

  • कौशल 1: "मैप" (Pseudo-Segment Distillation): मास्टर शेफ वीडियो पर पूरे स्टार्ट-एंड लाइन्स खींचता है और कहता है, "देखो, क्रिया यहाँ से यहाँ तक चलती है।" छात्र इन सीमाओं की नकल करना सीखता है, भले ही वह अभी पूरा वीडियो नहीं देख सकता।
  • कौशल 2: "हाइलाइटर" (Class-Activation Distillation): मास्टर शेफ हर फ्रेम को हाइलाइट करता है, यह कहते हुए, "यह फ्रेम निश्चित रूप से खाना बनाना है," या "यह फ्रेम निश्चित रूप से बैकग्राउंड है।" छात्र इन विशिष्ट क्षणों पर ध्यान देना सीखता है, जिससे वह क्रिया को होते ही पहचानने में बेहतर बनता है।
  • कौशल 3: "क्रिस्टल बॉल" (Anticipatory Distillation): यह जादू वाला हिस्सा है। मास्टर शेफ वीडियो के अगले कुछ सेकंड को देखता है और छात्र को बताता है, "तैयार हो जाओ! अगले कुछ फ्रेम में खाना बनाने की क्रिया शुरू होने वाली है।" यह छात्र को भविष्य की सीमाओं की भविष्यवाणी करने में मदद करता है, बिना उन्हें वास्तव में देखे।

अतिरिक्त सुरक्षा जाल (Extra Safety Nets):
यह सुनिश्चित करने के लिए कि यदि मास्टर शेफ कोई गलती करता है तो छात्र भ्रमित न हो, सिस्टम में दो सुरक्षा विशेषताएं जोड़ी गई हैं:

  • "एंकर" चेक: छात्र को वास्तविकता से जोड़े रखने के लिए उसे मूल सिंगल "टैप" (पॉइंट लेबल) की भी याद दिलाई जाती है।
  • "फोकस" फ़िल्टर: सिस्टम छात्र को वीडियो के उबाऊ हिस्सों (जैसे स्थिर किचन काउंटर) को अनदेखा करने और केवल उन हिस्सों पर ज़ूम करने के लिए सिखाता है जहाँ क्रिया होने की संभावना है।

परिणाम:
लेखकों ने पांच अलग-अलग वीडियो डेटासेट्स (जैसे स्पोर्ट्स क्लिप्स और किचन वीडियो) पर इनका परीक्षण किया। उन्होंने पाया कि उनका "स्टूडेंट" मॉडल, जिसे केवल सिंगल "टैप्स" पर प्रशिक्षित किया गया था, लेकिन मास्टर शेफ द्वारा निर्देशित किया गया था, रियल-टाइम में क्रियाओं को पहचानने में अविश्वसनीय रूप से कुशल हो गया। यह पिछले उन तरीकों की तुलना में बहुत बेहतर था जिन्होंने बिना इस टीचर-स्टूडेंट सेटअप के ऐसा करने की कोशिश की थी, और इसने उस मॉडल के लगभग बराबर प्रदर्शन किया जिसके पास पूरा वीडियो देखने और पूर्ण स्टार्ट/एंड लेबल का सुख मिला था।

संक्षेप में:
OnPoint एक ऐसा सिस्टम है जो एक रोबोट को लाइव वीडियो स्ट्रीम में क्रियाओं को पहचानने के लिए सीखने में मदद करता है, जिसमें केवल प्रति क्रिया एक सिंगल "क्लिक" की आवश्यकता होती है, और यह एक सुपर-स्मार्ट, सब-कुछ-देखने वाले शिक्षक के मार्गदर्शन में होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →