← नवीनतम पेपर
💻 computer science

Towards AI-Driven Policing: Interdisciplinary Knowledge Discovery from Police Body-Worn Camera Footage

यह शोधपत्र एक नवीन अंतरविषयक ढांचे का प्रस्ताव करता है जो पुलिस बॉडी-वर्न कैमरा फुटेज में आक्रामकता (एस्केलेशन) और सम्मान जैसे व्यवहारिक गतिकी का स्वचालित रूप से पता लगाने, वर्गीकृत करने और सारांशित करने के लिए मल्टीमॉडल विश्लेषण और लार्ज लैंग्वेज मॉडल्स सहित उन्नत एआई का लाभ उठाता है ताकि कानून प्रवर्तन जवाबदेही और प्रशिक्षण को बढ़ाया जा सके।

मूल लेखक: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

प्रकाशित 2026-09-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anita Srbinovska, Angela Srbinovska, Vivek Senthil, Jonathan Bateman, Adrian Martin, John McCluskey, Ernest Fokoué

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हर दिन, संयुक्त राज्य अमेरिका के शहरों में पुलिस अधिकारी ऐसे कैमरे पहनते हैं जो जनता के साथ उनकी बातचीत को रिकॉर्ड करते हैं। ये उपकरण, जिन्हें बॉडी-वर्न कैमरा (body-worn cameras) कहा जाता है, वीडियो और ऑडियो का एक विशाल और बढ़ता हुआ पुस्तकालय बनाते हैं, जो कानून प्रवर्तन और समुदाय के बीच के क्षणों की एक कच्ची और अनफ़िल्टर्ड झलक प्रदान करते हैं। दशकों से, शोधकर्ता और पुलिस नेता इस फुटेज को छानने की उम्मीद करते रहे हैं ताकि यह समझा जा सके कि ट्रैफ़िक स्टॉप या पड़ोस की कॉल के दौरान क्या होता है, और वे सम्मान, तनाव या स्थिति को शांत करने (de-escalation) के पैटर्न की तलाश करते हैं। हालाँकि, डेटा की विशाल मात्रा ने इस कार्य को केवल मानवीय आँखों और कानों के लिए लगभग असंभव बना दिया है। एक अकेला अधिकारी एक सप्ताह में घंटों का फुटेज उत्पन्न कर सकता है, और एक पूरा विभाग हर साल हजारों घंटे जमा कर लेता है। इस बाढ़ को समझने के लिए, वैज्ञानिक कृत्रिम बुद्धिमत्ता (AI) की ओर मुड़ रहे हैं, न तो मानव निर्णय को बदलने के लिए, बल्कि इन जटिल मुठभेड़ों के सबसे महत्वपूर्ण हिस्सों को व्यवस्थित करने और उन्हें उजागर करने में मदद करने के लिए। चुनौती मशीनों को सायरन और चिल्लाने के शोर के बीच सुनना, एक अराजक दृश्य में विभिन्न आवाजों के बीच अंतर करना, और उच्च-दबाव वाली स्थितियों में बोले गए शब्दों के पीछे के अर्थ को समझना सिखाने में निहित है।

रोचेस्टर इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने, रोचेस्टर पुलिस विभाग के साथ मिलकर, इस समस्या से निपटने के लिए डिज़ाइन किया गया एक नया सिस्टम बनाया है। वे इसे 'ओपनबीडब्ल्यूसी' (OpenBWC) कहते हैं, जो एक ओपन-सोर्स टूल है जो ऑडियो प्रोसेसिंग, स्पीच रिकग्निशन और भाषा विश्लेषण के संयोजन का उपयोग करके कच्चे वीडियो फाइलों को संरचित, खोजने योग्य जानकारी में बदल देता है। लक्ष्य केवल यह ट्रांसक्राइब करना नहीं है कि क्या कहा गया था, बल्कि बातचीत की गतिशीलता की पहचान करना है: क्या अधिकारी सम्मानजनक था? क्या स्थिति बढ़ी या शांत हुई? ऐसा करने के लिए, शोधकर्ताओं ने सिस्टम को सार्वजनिक रिकॉर्ड अनुरोधों के माध्यम से प्राप्त 1,225 वीडियो खिलाए। ये रिकॉर्डिंग, जिनमें शामिल लोगों की गोपनीयता की रक्षा के लिए चेहरे धुंधले किए गए थे, ग्यारह सेकंड के छोटे क्लिप से लेकर निरंतर बारह घंटों के फुटेज तक फैली हुई थीं, जो कुल 1,877 घंटों से अधिक का वीडियो था। टीम ने इन लंबी फाइलों को प्रबंधनीय तीस सेकंड के खंडों में विभाजित किया ताकि कंप्यूटर बातचीत के प्रवाह को खोए बिना ऑडियो को प्रोसेस कर सके।

उनकी पद्धति का मूल एक बहु-चरणीय प्रक्रिया में निहित है जो इस तरह नकल करती है जैसे कोई इंसान एक कठिन रिकॉर्डिंग को सुन रहा हो। सबसे पहले, सिस्टम मिश्रित ऑडियो को व्यक्तिगत आवाजों में अलग करता है, जिसे 'स्पीकर सेपरेशन' (speaker separation) नामक तकनीक कहा जाता है। यह महत्वपूर्ण है क्योंकि बॉडी-वॉन कैमरा फुटेज में अक्सर ओवरलैपिंग स्पीच, बैकग्राउंड नॉइज़ और एक साथ कई लोगों के बोलने की स्थिति होती है। शोधकर्ताओं ने नागरिक की आवाज़ से अधिकारी की आवाज़ को अलग करने के लिए एक विशेष मॉडल का उपयोग किया, जिससे कंप्यूटर एक समय में एक वक्ता पर ध्यान केंद्रित कर सके। एक बार जब आवाजें अलग हो गईं, तो सिस्टम ने उन्नत स्पीच-टू-टेक्स्ट तकनीक का उपयोग करके ऑडियो को टेक्स्ट में ट्रांसक्राइब किया। हालाँकि, शोधकर्ताओं ने पाया कि सभी ट्रांसक्रिप्शन टूल्स इन अव्यवस्थित, वास्तविक दुनिया के वातावरण में समान रूप से प्रभावी नहीं थे। उन्होंने एक लोकप्रिय स्पीच रिकग्निशन सिस्टम के दो संस्करणों का परीक्षण किया और पाया कि छोटा और तेज़ संस्करण अक्सर शब्द छोड़ देता था, वाक्यांशों को दोहराता था, या पूरी बातचीत को पकड़ने में विफल रहता था। इसके विपरीत, बड़े और अधिक विस्तृत संस्करण ने बहुत अधिक सटीक ट्रांसक्रिप्ट तैयार किए, हालांकि सूक्ष्म त्रुटियों को पकड़ने के लिए अभी भी मानवीय समीक्षा की आवश्यकता थी।

टेक्स्ट जेनरेट करने के बाद, शोधकर्ताओं ने ट्रांसक्रिप्ट को पढ़ने और बातचीत का सारांश निकालने के लिए एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग किया। इस चरण ने सिस्टम को मुख्य विषयों की पहचान करने की अनुमति दी, जैसे कि क्या एक अधिकारी ने डी-एस्केलेशन (स्थिति शांत करने की रणनीति) का उपयोग किया या क्या बातचीत का स्वर शांत से आक्रामक में बदल गया। परिणामों को फिर एक डेटाबेस में संग्रहीत किया गया जिसे विषय, वक्ता या विशिष्ट व्यवहार के आधार पर खोजा जा सकता था, जिससे हजारों घटनाओं में पैटर्न खोजना संभव हो गया। टीम ने पाया कि जबकि सिस्टम नियमित बातचीत, जैसे कि ट्रैफ़िक स्टॉप के लिए अच्छा काम करता है, जहाँ ऑडियो स्पष्ट होता है और बोलने के पैटर्न अनुमानित होते हैं, वहीं यह अराजक परिदृश्यों में काफी संघर्ष करता है। चिल्लाने, सायरन या एक-दूसरे के ऊपर बोलने वाले कई लोगों वाली उच्च-तनाव वाली स्थितियों में, ट्रांसक्रिप्शन की सटीकता गिर गई, और सिस्टम कभी-कभी भ्रमित हो गया कि कौन बोल रहा है या महत्वपूर्ण विवरणों को छोड़ दिया।

शोधकर्ता इस बात पर ध्यान देने में सावधानी बरतते हैं कि उनका सिस्टम एक पूर्ण समाधान नहीं है और इसका उपयोग अनुशासनात्मक निर्णयों या कानूनी निर्णयों के एकमात्र आधार के रूप में नहीं किया जाना चाहिए। उन्होंने स्पष्ट रूप से इस विचार को खारिज कर दिया कि वर्तमान में महत्वपूर्ण घटनाओं में मानवीय समीक्षा को पूरी तरह से स्वचालित ट्रांसक्रिप्शन द्वारा प्रतिस्थापित किया जा सकता है। अध्ययन सुझाव देता है कि सबसे प्रभावी दृष्टिकोण एक हाइब्रिड (मिश्रित) दृष्टिकोण है, जहाँ AI डेटा को व्यवस्थित करने और सारांशित करने का भारी काम संभालता है, लेकिन मानव विशेषज्ञ परिणामों को सत्यापित करते हैं, विशेष रूप से जटिल या उच्च-दांव वाले मामलों में। टीम ने एक तकनीकी सीमा पर भी प्रकाश डाला: अधिकारी की आवाज़ अक्सर नागरिक की तुलना में बहुत अधिक स्पष्टता से पकड़ी जाती है क्योंकि कैमरा अधिकारी के शरीर पर पहना जाता है, जो उनकी ओर इशारा करता है। यह असंतुलन इस बात का संकेत देता है कि सिस्टम स्वाभाविक रूप से अधिकारी के पक्ष को समझने में बेहतर है, जो विश्लेषण को प्रभावित कर सकता है यदि इसे ध्यान में न रखा जाए।

इन चुनौतियों के बावजूद, यह परियोजना पुलिसिंग में कृत्रिम बुद्धिमत्ता के उपयोग के लिए एक व्यावहारिक मार्ग प्रदर्शित करती है। ओपन-सोर्स टूल्स के साथ कठोर परीक्षण को जोड़कर, शोधकर्ताओं ने एक ऐसा ढांचा तैयार किया है जो पुलिस विभागों को अपने स्वयं के अभ्यासों की समीक्षा करने, अधिकारियों को बेहतर संचार के लिए प्रशिक्षित करने और खुद को जनता के प्रति जवाबदेह बनाने में मदद कर सकता है। यह कार्य यह दावा नहीं करता है कि इसने पुलिस फुटेज के विश्लेषण की समस्या को हल कर लिया है, बल्कि यह बातचीत शुरू करने के लिए एक विश्वसनीय तरीका प्रदान करता है। निष्कर्ष बताते हैं कि जबकि मशीनें हमें शोर के बीच पैटर्न देखने में मदद कर सकती हैं, सबसे महत्वपूर्ण अंतर्दृष्टि अभी भी कम्प्यूटेशनल शक्ति को मानवीय समझ के साथ जोड़ने से आती है। जैसे-जैसे तकनीक में सुधार होगा और डेटासेट बढ़ेंगे, इस तरह का अंतःविषय दृष्टिकोण कानून प्रवर्तन एजेंसियों के दैनिक कार्य से सीखने के तरीके को बदल सकता है, जिससे वीडियो के विशाल अभिलेखागार को क्रियात्मक ज्ञान में बदला जा सकता है जो सभी शामिल लोगों के लिए सुरक्षा और विश्वास में सुधार करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →