← नवीनतम पेपर
🤖 machine learning

Benchmarking Compact VLMs for Clip-Level Surveillance Anomaly Detection Under Weak Supervision

यह शोध पत्र प्रदर्शित करता है कि एक एकीकृत कमजोर रूप से पर्यवेक्षित (weakly supervised) प्रोटोकॉल के तहत मूल्यांकित, पैरामीटर-कुशल रूप से अनुकूलित कॉम्पैक्ट विजन-लैंग्वेज मॉडल, विश्वसनीय सीसीटीवी विसंगति का पता लगाने के लिए प्रतिस्पर्धी प्रति-क्लिप विलंबता और कम प्रॉम्प्ट संवेदनशीलता बनाए रखते हुए स्थापित बेसलाइन के बराबर या उनसे अधिक सटीकता प्राप्त करते हैं।

मूल लेखक: Kirill Borodin, Kirill Kondrashov, Nikita Vasiliev, Ksenia Gladkova, Inna Larina, Mikhail Gorodnichev, Grach Mkrtchian

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kirill Borodin, Kirill Kondrashov, Nikita Vasiliev, Ksenia Gladkova, Inna Larina, Mikhail Gorodnichev, Grach Mkrtchian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल शहर के सुरक्षा प्रमुख हैं। आपके पास हजारों सीसीटीवी कैमरे हैं जो हर सड़क के कोने, सबवे स्टेशन और शॉपिंग मॉल पर नज़र रख रहे हैं। आपका काम है मुसीबत को पहचानना—जैसे कि कोई लड़ाई शुरू होना, कार दुर्घटना, या किसी की चोरी करना—इससे पहले कि स्थिति बिगड़ जाए।

लेकिन यहाँ एक पेंच है: आप हर समय हर स्क्रीन को नहीं देख सकते। आपको एक रोबोटिक सहायक की आवश्यकता है जो फीड्स को देख सके, गड़बड़ी को तुरंत पहचान सके, और आपको बता सके, "हे, यहाँ कुछ गलत है!" बिना पूरे सिस्टम को धीमा किए।

यह पेपर ठीक यही काम करने के लिए एक नए प्रकार के "रोबोटिक सहायक" का परीक्षण करने के बारे में है।

समस्या: "ओवरवर्क्ड इंटर्न" बनाम "विशेषज्ञ जासूस"

लंबे समय से, सुरक्षा प्रणालियाँ दो मुख्य प्रकार के सहायकों का उपयोग करती रही हैं:

  1. "जनरलिस्ट" (ट्रेनिंग-फ्री मॉडल्स): ये उन प्रतिभाशाली इंटर्न की तरह हैं जिन्होंने लाइब्रेरी की हर किताब पढ़ ली है लेकिन सुरक्षा कार्यालय में कभी काम नहीं किया है। वे बुद्धिमान हैं, लेकिन उन्हें आपके भवन के विशिष्ट नियमों का पता नहीं है। वे दोस्तों के बीच एक सामान्य बहस को लड़ाई समझकर भ्रमित हो सकते हैं, या चोरी के सूक्ष्म संकेतों को मिस कर सकते हैं क्योंकि वे गलत चीजों की तलाश कर रहे हैं।
  2. "हेवीवेट" (बड़े मॉडल्स): ये विशाल, अत्यंत बुद्धिमान जासूसों की तरह हैं। वे अविश्वसनीय रूप से स्मार्ट हैं लेकिन सोचने में बहुत समय लेते हैं। यदि आप उनसे एक वीडियो चेक करने को कहते हैं, तो वे उत्तर देने में 15 सेकंड तक ले सकते हैं। वास्तविक आपात स्थिति में, आपको पलक झपकते ही उत्तर चाहिए होता है।

शोधकर्ताओं ने पूछा: "क्या हम एक 'गोल्डिलॉक्स' समाधान ढूंढ सकते हैं? एक ऐसा सहायक जो छोटा और तेज़ हो (एक कॉम्पैक्ट कार की तरह) लेकिन इतना स्मार्ट हो कि मुसीबत को सटीक रूप से पहचान सके?"

समाधान: "क्विक स्टडी" (पैरामीटर-एफिशिएंट फाइन-ट्यूनिंग)

शोधकर्ताओं ने छोटे, तेज़ AI मॉडल्स के एक समूह (जिन्हें कॉम्पैक्ट विजन-लैंग्वेज मॉडल्स कहा जाता है) का परीक्षण किया। इन्हें स्मार्ट, छोटे रोबोट समझें जो देख और पढ़ सकते हैं।

उन्होंने इन मॉडल्स का उपयोग करने के दो तरीके आजमाए:

  1. "बस पूछ लो" विधि (ज़ीरो-शॉट): उन्होंने बस रोबोट से पूछा, "क्या यह वीडियो अजीब है?" बिना उसे कोई विशेष प्रशिक्षण दिए।
    • परिणाम: यह बिना नक्शे के शहर में रास्ता खोजने के लिए एक पर्यटक से पूछने जैसा था। कभी-कभी वे सही अनुमान लगाते थे, लेकिन अक्सर वे भटक जाते थे या घबरा जाते थे। वे इस बात के प्रति बहुत संवेदनशील थे कि आप सवाल कैसे पूछते हैं। यदि आप विनम्रता से पूछते, तो वे काम करते; यदि आप सख्ती से पूछते, तो वे विफल हो जाते।
  2. "क्रैश कोर्स" विधि (LoRA फाइन-ट्यूनिंग): पूरे रोबोट को फिर से प्रशिक्षित करने के बजाय (जिसमें बहुत समय लगता है और बहुत खर्च आता है), उन्होंने रोबोट को एक विशेष "चीट शीट" (एक तकनीक जिसे LoRA कहा जाता है) दी। इस चीट शीट ने रोबोट को विशेष रूप से सीसीटीवी फुटेज में अपराधों को पहचानने का प्रशिक्षण दिया।
    • परिणाम: यही वह जादुई क्षण था। छोटे रोबोट अचानक विशेषज्ञ जासूस बन गए। उन्होंने केवल अनुमान नहीं लगाया; वे संदर्भ को समझ गए। वे एक मजाक में किए गए धक्के और असली लड़ाई के बीच अंतर कर सकते थे।

बड़ी खोजें

इस अध्ययन से जो पता चला, उसका सरल अनुवाद यहाँ दिया गया है:

1. निर्देशों को जटिल न बनाएं (द "ओवरप्रॉम्प्टिंग" ट्रैप)
शोधकर्ताओं ने रोबानों को लंबे, जटिल निर्देश और उदाहरण दिए (जैसे किसी छात्र को परीक्षा से पहले 10 पन्नों की स्टडी गाइड देना)।

  • क्या हुआ: छोटे रोबोट अभिभूत (overwhelmed) हो गए। वे हकलाने लगे, उत्तर देने में अधिक समय लेने लगे, और वास्तव में अपराधों को पहचानने में और भी खराब हो गए।
  • सबक: इन छोटे, तेज़ रोबोटों के लिए, इसे सरल रखें। एक छोटा, स्पष्ट कमांड जैसे "क्या यह अपराध है? हाँ या नहीं" सबसे अच्छा काम करता है।

2. "चीट शीट" छोटे रोबोटों को बड़े रोबोटों से बेहतर बनाती है
छोटे रोबोटों को उनकी विशेष चीट शीट (LoRA) देने के बाद, वे इतने अच्छे हो गए कि उन्होंने गति और सटीकता दोनों में विशाल, धीमे जासूसों को पीछे छोड़ दिया।

  • उपमा: कल्पना करें कि एक छोटी, फुर्तीली रेस कार (ट्यून्ड छोटा रोबोट) बनाम एक विशाल, धीमी चलने वाला टैंक (बड़ा मॉडल)। रेस कार, जो ट्रैक को पूरी तरह से जानती है, टैंक के बगल से तेजी से निकल जाती है और फिनिश लाइन को पहले पहचान लेती है।

3. निरंतरता महत्वपूर्ण है
"चीट शीट" से पहले, रोबोट मूडी (स्वभाव बदलने वाले) थे। एक दिन वे अपराध के लिए "हाँ" कह सकते थे, दूसरे दिन उसी वीडियो के लिए "नहीं" कह सकते थे, यह इस पर निर्भर करता था कि आप सवाल कैसे पूछ रहे हैं।

  • समाधान: ट्यूनिंग के बाद, वे विश्वसनीय हो गए। आप चाहे जैसे भी पूछें, वे सही उत्तर देते थे। सुरक्षा के लिए यह महत्वपूर्ण है; आप ऐसा सिस्टम नहीं चाहते जो हर घंटे अपना मन बदल ले।

निष्कर्ष

यह पेपर साबित करता है कि एक सुरक्षित शहर चलाने के लिए आपको घर के आकार के सुपरकंप्यूटर की आवश्यकता नहीं है।

एक छोटे, तेज़ और किफायती AI मॉडल को लेकर और उसे एक लक्षित, हल्के प्रशिक्षण सत्र (चीट शीट) देकर, आप एक ऐसा सुरक्षा गार्ड बना सकते हैं जो है:

  • तेज़: यह वीडियो को रियल-टाइम में चेक करता है।
  • सटीक: यह शायद ही कभी कोई अपराध मिस करता है या बिना वजह अलार्म बजाता है।
  • स्थिर: यह इस बात से भ्रमित नहीं होता कि आप सवाल कैसे पूछ रहे हैं।

यह एक साधारण कार को लेने, उसे हाई-परफॉर्मेंस ट्यून-अप देने और अचानक उसे लग्जरी लिमोजिन से आगे निकलने योग्य बनाने जैसा है। सुरक्षा निगरानी के भविष्य के लिए, इसका मतलब है कि हम हर जगह स्मार्ट, तेज़ और सस्ते सुरक्षा सिस्टम रख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →