← नवीनतम पेपर
💻 computer science

Text-guided Fine-Grained Video Anomaly Understanding

यह शोध पत्र T-VAU का प्रस्ताव करता है, जो एक टेक्स्ट-गाइडेड फ्रेमवर्क है जो बड़े विजन-लैंग्वेज मॉडल्स को एकीकृत फाइन-ग्रैन्ड वीडियो विसंगति का पता लगाने (वीडियो एनोमली डिटेक्शन), सटीक पिक्सेल-लेवल लोकलाइजेशन और व्याख्यात्मक सिमेंटिक रीजनिंग को सक्षम करने के लिए एक एनोमली हीटमैप डिकोडर और एक रीजन-अवेयर एनोमली एनकोडर का लाभ उठाता है।

मूल लेखक: Jihao Gu, Kun Li, He Wang, Kaan Akşit

प्रकाशित 2026-04-01
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Jihao Gu, Kun Li, He Wang, Kaan Akşit

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर के चौक का लाइव फीड देख रहे एक सुरक्षा गार्ड हैं। आपका काम कुछ भी अजीब होते देखते ही उसे पकड़ना है।

वर्तमान गार्डों के साथ समस्या
मौजूदा कंप्यूटर सिस्टम जो सुरक्षा गार्ड के रूप में काम करते हैं, वे थके हुए इंटर्न की तरह हैं जो केवल "अलार्म!" या "सब ठीक है!" चिल्लाते हैं!

  • यदि वे कुछ थोड़ा सा भी अलग देखते हैं, तो वे शायद सिर्फ यह कह देंगे कि "यहाँ कुछ गलत है," बिना आपको यह बताए कि क्या गलत है, कहाँ गलत है, या वह क्यों अजीब है।
  • वे बड़ी, स्पष्ट चीजों (जैसे कार का टकराना) को पहचानने में माहिर हैं, लेकिन सूक्ष्म चीजों (जैसे किसी व्यक्ति का गलत दिशा में दौड़ना या बैग छोड़ देना) को मिस कर देते हैं।
  • दूसरी ओर, नए "स्मार्ट" AI सिस्टम (Large Vision-Language Models) बातूनी जासूसों की तरह हैं। वे आपको एक कहानी सुना सकते हैं: "लाल टोपी वाला एक आदमी संदिग्ध व्यवहार कर रहा है।" लेकिन वे उंगली दिखाने में बहुत खराब हैं। वे कह सकते हैं "वहाँ देखो!" जबकि उनकी उंगली एक पेड़ की ओर हो सकती है, क्योंकि वे पिक्सेल के सूक्ष्म विवरणों को वास्तव में नहीं देख पाते।

समाधान: T-VAU (द "सुपर-गार्ड")
यह पेपर एक नया सिस्टम पेश करता है जिसे T-VAU (Text-guided Fine-Grained Video Anomaly Understanding) कहा जाता है। T-VAU को एक सुपर-गार्ड के रूप में समझें जो एक स्नाइपर की पैनी नज़र और एक उपन्यासकार के कहानी कहने के कौशल को जोड़ता है।

यह दो विशेष उपकरणों का उपयोग करके ऐसा करता है:

1. "एक्स-रे चश्मा" (Anomaly Heatmap Decoder)

कल्पना कीजिए कि सुरक्षा कैमरा फीड एक पेंटिंग है। पुराने सिस्टम पूरी पेंटिंग को देखते हैं और अनुमान लगाते हैं कि क्या यह "खराब" है।
T-VAU एक्स-रे चश्मा पहनता है जो हाइलाइट करता है कि ठीक कहाँ अजीबोगरीब घटना हो रही है।

  • यह वीडियो को स्कैन करता है और उस विशिष्ट स्थान पर एक चमकता हुआ, लाल "हीट मैप" बनाता है जहाँ कुछ गलत है।
  • यदि कोई व्यक्ति गलत दिशा में दौड़ रहा है, तो चश्मा भीड़ की परवाह किए बिना उस विशिष्ट व्यक्ति के चारों ओर चमकीला लाल हो जाएगा।
  • यह "बातूनी जासूस" वाली समस्या को हल करता है जो गलत चीज़ की ओर इशारा करता है। अब, सिस्टम जानता है कि ठीक कहाँ देखना है।

2. "जासूस की नोटबुक" (Region-aware Anomaly Encoder)

एक बार जब एक्स-रे चश्मा अजीब जगह को ढूंढ लेता है, तो T-VAU उसे केवल वहीं नहीं छोड़ देता। यह उस चमकते लाल धब्बे को लेता है और उसे AI जासूस के लिए एक व्यवस्थित नोट में बदल देता है।

  • केवल "लाल धब्बे को देखो" कहने के बजाय, यह विजुअल डेटा को इस तरह के प्रॉम्प्ट में अनुवादित करता है: "बाईं से दाईं ओर तेजी से चलने वाले लाल शर्ट वाले व्यक्ति पर ध्यान केंद्रित करें।"
  • यह नोट AI के मस्तिष्क में डाला जाता है, जो उसे उस विशिष्ट साक्ष्य पर ध्यान केंद्रित करने के लिए मजबूर करता है जिसे एक्स-रे चश्मे ने पाया था।
  • यह AI को जटिल प्रश्नों के उत्तर देने में सक्षम बनाता है जैसे: "वह कौन है?" "वह कैसा दिखता है?" और "उसने कैसे حرکت (मूवमेंट) किया?"

प्रशिक्षण का मैदान (The Dataset)

इस सुपर-गार्ड को सिखाने के लिए, शोधकर्ताओं ने केवल उसे वीडियो नहीं दिखाए; उन्होंने एक विशेष प्रशिक्षण स्कूल बनाया।

  • उन्होंने मौजूदा वीडियो डेटासेट लिए और उनमें विस्तृत विवरण (annotations) जोड़े।
  • वीडियो को केवल "असामान्य" लेबल करने के बजाय, उन्होंने इसे लेबल किया: "एक बैकपैक वाला साइकिल चालक दाईं ओर से आया, तेजी से मुड़ा, और बाहर निकल गया।"
  • इसने AI को विजुअल डॉट्स (हीट मैप) को कहानी (टेक्स्ट) के साथ जोड़ने के लिए प्रशिक्षित किया, ताकि वह सटीक और वर्णनात्मक दोनों बन सके।

यह क्यों महत्वपूर्ण है

वास्तविक दुनिया में, यह जानना पर्याप्त नहीं है कि कोई दुर्घटना हुई है। आपको यह जानने की आवश्यकता है:

  • यह कहाँ हुआ? (एक्स-रे चश्मा)
  • इसमें कौन शामिल था? (जासूस की नोटबुक)
  • उन्होंने वास्तव में क्या किया? (कहानी कहना)

परिणाम:
T-VAU एक ऐसा सुरक्षा सिस्टम है जो केवल "आग!" चिल्लाता नहीं है बल्कि कहता है: "रसोई में आग लगी है, विशेष रूप से चूल्हे के पास। यह 10 सेकंड पहले शुरू हुई थी, और धुआं गलियारे की ओर बढ़ रहा है।"

यह देखने (पिक्सेल) और समझने (शब्दों) के बीच के अंतर को पाटता है, जिससे AI सुरक्षा, सुरक्षा और औद्योगिक निरीक्षण के लिए बहुत अधिक विश्वसनीय हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →