← नवीनतम पेपर
💻 computer science

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2 एक तैनात किया गया फ्रेमवर्क है जो ओपन-एंडेड चेन-ऑफ-थॉट रीजनिंग को कंप्रेस्ड सिंगल-स्टेप रूल प्रेडिक्शन्स और सिम्बोलिक पॉलिसी ऑप्टिमाइज़ेशन से बदलकर बड़े विजन-लैंग्वेज मॉडल्स को एक रियल-टाइम, डिटर्मिनिस्टिक सेफ्टी मॉनिटरिंग सिस्टम में परिवर्तित करता है, जिससे एक परिचालन भूमिगत खनन सुविधा में 19.45 गुना गति वृद्धि और काफी उच्च उल्लंघन पहचान दर प्राप्त होती है।

मूल लेखक: Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

प्रकाशित 2026-08-04
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, शोर-शराबे वाले कारखाने में खड़े हैं जहाँ मशीनें गरज रही हैं और कर्मचारी भाग-दौड़ कर रहे हैं। आपका काम एक साथ सौ वीडियो स्क्रीन पर नज़र रखना है, यह देखने के लिए कि कोई सुरक्षा नियम तो नहीं तोड़ रहा—जैसे बिना हार्नेस के सीढ़ी पर चढ़ना या भारी मशीनरी के पास फोन का उपयोग करना। यह कंप्यूटर विज़न (computer vision) की दुनिया है, जो विज्ञान की एक ऐसी शाखा है जहाँ हम कंप्यूटर को छवियों को "देखने" और समझने के लिए प्रशिक्षित करते हैं। लंबे समय तक, सबसे स्मार्ट कंप्यूटरों ने चेन-ऑफ-थॉट (CoT) नामक एक विधि का उपयोग किया। इसे एक छात्र से गणित की समस्या हल करने के लिए कहने जैसा समझें, जिसमें उसे उत्तर देने से पहले अपने सोचने के हर चरण को एक लंबे निबंध के रूप में लिखने के लिए कहा जाता है। हालाँकि यह जटिल पहेलियों के लिए बहुत अच्छा है, लेकिन एक व्यस्त कारखाने के फर्श के लिए यह बहुत बुरा है। यदि कंप्यूटर को हर एक वीडियो फ्रेम के लिए एक लंबा निबंध लिखना पड़ता है, तो यह वास्तविक समय (real-time) में खतरों को पकड़ने के लिए बहुत धीमा हो जाता है, और यदि उसे एक साथ दस स्क्रीन देखनी हों, तो वह अभिभूत (overwhelmed) हो जाता है। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: क्या हम इन सुपर-स्मार्ट कंप्यूटरों को हर बार एक उपन्यास लिखने के बजाय तेज़, सुरक्षित और सटीक निर्णय लेने के योग्य बना सकते हैं?

यहाँ MonitorVLM-v2 आता है, जो एक नया सिस्टम है जिसे औद्योगिक स्थलों के लिए परम सुरक्षा गार्ड के रूप में डिज़ाइन किया गया है। शोधकर्ताओं ने, जिनका नेतृत्व जियांग वू और उनके सहयोगियों ने किया, महसूस किया कि एक कारखाने में, आपको यह समझाने की आवश्यकता नहीं है कि नियम क्यों टूटा गया या इसके लिए एक लंबे, काव्यमय पैराग्राफ की आवश्यकता नहीं है; आपको बस इसे जितनी जल्दी हो सके चिल्लाकर कहना है, "नियम #14 टूटा!" उन्होंने एक ऐसा ढांचा बनाया जो कंप्यूटर की "सोच" को एक त्वरित, एकल-विकल्प खेल में बदल देता है। एक लंबी, परिवर्तनशील-लंबाई वाली कहानी बनाने के बजाय, यह सिस्टम अपनी पूरी तर्क प्रक्रिया को एक एकल "टोकन" में संकुचित कर देता है—यानी, 35 संभावित सुरक्षा नियमों की सूची में से एक विशिष्ट 'रूल आईडी' (Rule ID) को चुनना।

इसे सफल बनाने के लिए, उन्होंने रूल-टोकन शफ़लिंग (Rule-Token Shuffling) नामक एक चतुर प्रशिक्षण तकनीक का आविष्कार किया। कल्पना कीजिए कि आप एक नई भाषा सीख रहे हैं जहाँ "सेब" के लिए शब्द हर दिन बदल जाता है। यदि आप केवल यह याद रखते हैं कि "सेब" हमेशा "लाल" शब्द है, तो आप भ्रमित हो जाएंगे जब नियम बदलेंगे। लेकिन यदि आपको यह सीखने के लिए मजबूर किया जाता है कि "सेब" उस फल की एक अवधारणा (concept) है, चाहे आज उसके लिए जो भी शब्द इस्तेमाल किया जाए, तो आप बहुत अधिक स्मार्ट बन जाते हैं। MonitorVLM-v2 ऐसा ही करता है; यह प्रशिक्षण के दौरान लगातार इस बात को शफल (shuffle) करता है कि कौन सी "रूल आईडी" किस सुरक्षा नियम के अनुरूप है। यह AI को वास्तव में वीडियो को देखने और खतरे को समझने के लिए मजबूर करता है, न कि केवल एक स्थिर लेबल के आधार पर अनुमान लगाने के लिए।

एक बार जब AI ने सही नियम चुनना सीख लिया, तो शोधकर्ताओं को यह सुनिश्चित करने की आवश्यकता थी कि जब चीजें पेचीदा हों, जैसे कि कोई कार्यकर्ता आंशिक रूप से छिपा हुआ हो या रोशनी खराब हो, तो वह भ्रमित न हो जाए। उन्होंने सिंबोलिक पॉलिसी ऑप्टिमिज़ेशन (SymPO) नामक एक नई विधि का उपयोग किया। इसे एक सख्त कोच के रूप में समझें जो छात्र को केवल यह नहीं कहता, "अच्छा काम किया, तुमने सही उत्तर दिया!" बल्कि, कोच कहता है, "तुमने सही उत्तर दिया, लेकिन तुमने गलत उत्तर को भी 90% संभावना दी। यह खतरनाक है! इस गलत अनुमान को दंडित करो ताकि तुम इसे फिर कभी न चुनो।" यह कंप्यूटर की निर्णय सीमाओं को तेज करता है, जिससे वह अपने विकल्पों में बहुत अधिक आत्मविश्वासी हो जाता है।

लेकिन क्या होता है जब कंप्यूटर अभी भी अनिश्चित होता है? सिस्टम एंट्रॉपी (entropy) (एक फैंसी शब्द जिसका अर्थ है "अनिश्चितता") पर आधारित एक "ट्रैफिक पुलिस" दृष्टिकोण का उपयोग करता है। यदि कंप्यूटर बहुत आत्मविश्वासी है (कम एंट्रॉपी), तो यह घटना को त्वरित मानव जांच के लिए चिह्नित करता है। यदि कंप्यूटर भ्रमित है (उच्च एंट्रॉपी), तो यह बारीकी से देखने के लिए शीर्ष तीन सबसे संभावित विकल्पों को एक मानव विशेषज्ञ के पास भेजता है। यह सुनिश्चित करता है कि किसी भी खतरनाक स्थिति को अनदेखा न किया जाए, लेकिन यह भी सुनिश्चित करता है कि मनुष्य स्पष्ट और आसान मामलों पर अपना समय बर्बाद न करें।

टीम ने इसे केवल लैब में ही नहीं परखा; उन्होंने इसे चार महीने के लिए एक वास्तविक भूमिगत खदान में तैनात किया। परिणाम आश्चर्यजनक थे। नया सिस्टम पुराने "निबंध लिखने वाले" तरीके की तुलना में 19.45 गुना तेज़ था, जिससे यह बिना धीमे हुए एक साथ 10 वीडियो स्ट्रीम को संभालने में सक्षम हुआ। इससे भी महत्वपूर्ण बात यह है कि इसने साइट के नियमित मैनुअल निरीक्षण की तुलना में 2.78 गुना अधिक पुष्ट सुरक्षा उल्लंघन पकड़े। जबकि मानव निरीक्षक 18 घंटे काम करते थे, AI 24 घंटे देखता था, जिसने मनुष्यों द्वारा खोजे गए 32 उल्लंघनों की तुलना में 89 उल्लंघन पकड़े। इसने मनुष्यों की जगह नहीं ली; इसके बजाय, इसने एक अथक सहायक के रूप में कार्य किया जिसने उन चीजों को पकड़ा जिन्हें मनुष्य थकान या व्याकुलता के कारण मिस कर देते हैं, और अंतिम पुष्टि के लिए पेचीदा मामलों को सौंप दिया।

संक्षेप में, MonitorVLM-v2 सुझाव देता है कि सुरक्षा-महत्वपूर्ण कार्यों के लिए, हमें ऐसे AI की आवश्यकता नहीं है जो बहुत अधिक बातें करे; हमें ऐसे AI की आवश्यकता है जो तेज़ी से निर्णय ले सके, अपनी गलतियों से सीख सके, और यह जानता हो कि कब मानव से मदद मांगनी है। जटिल तर्क को एक तेज़, सीमित निर्णय में बदलकर, शोधकर्ताओं ने दिखाया है कि कैसे AI को औद्योगिक श्रमिकों को सुरक्षित रखने के लिए एक विश्वसनीय साथी बनाया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →