← नवीनतम पेपर
⚡ electrical engineering

Towards smart and adaptive agents for active sensing on edge devices

यह शोध पत्र एक कॉम्पैक्ट, एक्टिव इन्फरेंस-आधारित एजेंटिक सिस्टम पेश करता है जो संसाधन-सीमित एज डिवाइसेस पर रीयल-टाइम, एडेप्टिव एक्टिव सेंसिंग को सक्षम बनाता है, जिससे वे पारंपरिक TinyML दृष्टिकोणों की सीमाओं को दूर करने के लिए कैमरा मूवमेंट को गतिशील रूप से प्लान और कंट्रोल कर सकते हैं।

मूल लेखक: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

प्रकाशित 2026-09-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे कैमरे की कल्पना करें जो न केवल दुनिया को रिकॉर्ड करता है, बल्कि सक्रिय रूप से यह चुनता है कि उसे क्या देखना चाहिए, ठीक वैसे ही जैसे एक मानव आँख एक पूर्ण चित्र बनाने के लिए एक विवरण से दूसरे विवरण पर जाती है। यह 'एक्टिव सेंसिंग' (सक्रिय संवेदन) का क्षेत्र है, एक ऐसी अवधारणा जहाँ मशीनें डेटा के लिए निष्क्रिय रूप से प्रतीक्षा नहीं करतीं, बल्कि सबसे उपयोगी जानकारी एकत्र करने के लिए अपने सेंसरों को घुमाती हैं। वर्षों से, यह सपना रहा है कि इस तरह के स्मार्ट, अनुकूल व्यवहार को छोटे, बैटरी से चलने वाले उपकरणों पर डाला जा सके जो सीधे वहीं स्थित होते हैं जहाँ हलचल होती है, जैसे कि एक सुरक्षा कैमरे या रोबोट पर, बिना किसी दूर स्थित क्लाउड सर्वर को डेटा भेजे। चुनौती यह थी कि इस तरह के काम करने वाले शक्तिशाली आर्टिफिशियल इंटेलिजेंस सिस्टम को आमतौर पर भारी मात्रा में कंप्यूटिंग शक्ति और मेमोरी की आवश्यकता होती है, जिससे उन्हें इन छोटे, स्थानीय उपकरणों पर चलाना असंभव हो जाता है।

शोधकर्ताओं की एक टीम ने अब इस अंतर को पाटने के लिए एक प्रणाली बनाई है, एक स्मार्ट एजेंट तैयार किया है जो वास्तविक समय में देख सकता है, योजना बना सकता है और एक छोटे कंप्यूटर बोर्ड के आकार के उपकरण पर चलते हुए कैमरे को नियंत्रित कर सकता है। हाल ही में प्रकाशित एक अध्ययन में, यह कार्य प्रदर्शित करता है कि दो अलग-अलग प्रकार के आर्टिफिशियल इंटेलिजेंस को जोड़ना संभव है: एक जो छवियों में वस्तुओं को पहचानने में उत्कृष्ट है, और दूसरा जो अनिश्चितता के तहत निर्णय लेने में उत्कृष्ट है। इसका परिणाम एक "सैकेड एजेंट" (saccade agent) है, जिसका नाम उन त्वरित, झटकेदार आंखों की गतिविधियों के नाम पर रखा गया है जो मनुष्य विवरणों पर ध्यान केंद्रित करने के लिए करते हैं, जो लोगों को ट्रैक करने या कमरे की स्वायत्त रूप से खोज करने के लिए कैमरे को नियंत्रित कर सकता है। यह प्रणाली पूरी तरह से 'एज डिवाइस' पर चलती है, जिसका अर्थ है कि यह सब कुछ स्थानीय रूप से प्रोसेस करती है, जिससे तेज़ प्रतिक्रिया सुनिश्चित होती है और डेटा की गोपनीयता बनी रहती है।

शोधकर्ताओं को एक विशिष्ट समस्या का सामना करना पड़ा: मानक डीप लर्निंग मॉडल, जो वीडियो फीड में लोगों या कारों जैसी चीजों को पहचानने में बहुत अच्छे होते हैं, बहुत कठोर होते हैं। एक बार प्रशिक्षित होने के बाद, वे वातावरण बदलने पर या कुछ नया खोजने के लिए कहाँ देखना है, यह तय करने में संघर्ष करते हैं। वे सीखने के लिए भारी मात्रा में डेटा और कंप्यूटिंग शक्ति पर निर्भर करते हैं, जो एक छोटे, कम शक्ति वाले उपकरण की आवश्यकता के बिल्कुल विपरीत है। इसे हल करने के लिए, टीम ने डीप लर्निंग मॉडल को बड़ा या अधिक स्मार्ट बनाने की कोशिश नहीं की। इसके बजाय, उन्होंने इसके ऊपर बुद्धिमत्ता की एक दूसरी परत जोड़ी, जो 'एक्टिव इन्फरेंस' (active inference) नामक एक सिद्धांत पर आधारित है। यह दृष्टिकोण एजेंट को एक वैज्ञानिक के रूप में देखता है जो लगातार दुनिया के बारे में अपने विश्वासों को अपडेट करता रहता है। यह पूछता है, "मुझे क्या देखने की उम्मीद है?" और "मुझे क्या आश्चर्यचकित करेगा?" यदि कैमरा कुछ भी नया नहीं देखता है, तो एजेंट अधिक सीखने के लिए किसी अलग स्थान पर जाने का निर्णय लेता है। यदि वह कुछ दिलचस्प देखता है, जैसे कि कोई व्यक्ति, तो वह उस पर ध्यान केंद्रित करता है। यह निर्णय लेने की प्रक्रिया अविश्वसनीय रूप से हल्की है, जिसमें बहुत कम मेमोरी की आवश्यकता होती है, जिससे यह भारी ऑब्जेक्ट-डिटेक्शन सॉफ्टवेयर के साथ चल सकती है।

इस विचार का परीक्षण करने के लिए, टीम ने एक NVIDIA Jetson डिवाइस का उपयोग करके एक भौतिक प्रोटोटाइप बनाया, जो एज पर आर्टिफिशियल इंटेलिजेंस कार्यों के लिए डिज़ाइन किया गया एक शक्तिशाली कंप्यूटर है। उन्होंने इस डिवाइस को एक ऐसे कैमरे से जोड़ा जो पैन और टिल्ट (घूम और झुक) कर सकता है, जैसा कि कई इमारतों में सुरक्षा कैमरे पाए जाते हैं। इस प्रणाली को एक सरल लेकिन शक्तिशाली कार्य दिया गया था: एक दृश्य को देखना और यह तय करना कि लेंस को कहाँ निर्देशित करना है। प्रणाली के पहले भाग, 'परसेप्शन मॉड्यूल' ने वीडियो फीड को स्कैन करने और लोगों या वस्तुओं को खोजने के लिए YOLO नामक एक प्रसिद्ध ऑब्जेक्ट डिटेक्शन टूल का उपयोग किया। इस टूल को डिवाइस के हार्डवेयर पर तेज़ी से चलने के लिए अनुकूलित किया गया था। दूसरा भाग, 'प्लानिंग मॉड्यूल', ने देखी गई चीजों की सूची ली और यह तय करने के लिए 'एक्टिव इन्फरेंस' का उपयोग किया कि अगला कदम क्या होगा। इसने गणना की कि कैमरे को किस दिशा में मुड़ना चाहिए ताकि या तो किसी व्यक्ति पर नज़र रखी जा सके या खाली क्षेत्र को स्कैन किया जा सके ताकि देखा जा सके कि क्या कुछ नया दिखाई देता है।

परिणामों ने दिखाया कि यह संयोजन हार्डवेयर की सख्त सीमाओं के भीतर भी उल्लेखनीय रूप से काम करता है। संपूर्ण प्रणाली, जिसमें चलाने के लिए आवश्यक सॉफ्टवेयर शामिल है, केवल 304 मेगाबाइट के मेमोरी फुटप्रिंट में समा गई, जो एक आर्टिफिशियल इंटेलिजेंस सिस्टम के लिए बहुत कम है। एक कॉन्फ़िगरेशन में, कैमरा वीडियो को प्रोसेस कर सकता था और यह निर्णय ले सकता था कि आगे कहाँ देखना है, 108 बार प्रति सेकंड, जो एक मानव पर्यवेक्षक के लिए तात्कालिक महसूस करने के लिए पर्याप्त तेज़ गति है। एक अन्य सेटअप में, जिसने मेमोरी उपयोग के बजाय गति को प्राथमिकता दी, उसने प्रति सेकंड 250 बार निर्णय लेते हुए 45 फ्रेम प्रति सेकंड की वीडियो विश्लेषण की गति प्राप्त की। शोधकर्ताओं ने पाया कि निर्णय लेने में लगने वाला समय इतना कम था कि प्रणाली वीडियो फीड के साथ आसानी से तालमेल बिठा सकती थी, जिससे कैमरा चलते हुए लक्ष्यों का सहजता से पीछा कर सकता था या बिना किसी लैग के कमरे में घूम सकता था।

यह उपलब्धि केवल इसलिए महत्वपूर्ण नहीं है कि कैमरा हिला, बल्कि यह कि वह कैसे हिला। एजेंट ने किसी पूर्व-निर्धारित पथ का पालन नहीं किया। इसके बजाय, इसने वास्तविक समय में वातावरण के प्रति प्रतिक्रिया दी। यदि कोई व्यक्ति फ्रेम में आया, तो कैमरा उस पर लॉक हो गया। यदि व्यक्ति हिला, तो कैमरे ने उसका पीछा किया। यदि व्यक्ति चला गया और कमरा खाली था, तो एजेंट ने यह देखने के लिए कमरे के बाकी हिस्से को स्कैन करने का निर्णय लिया कि क्या कुछ और हो रहा है। यह व्यवहार उस तरह का है जैसे मनुष्य स्वाभाविक रूप से अपने परिवेश की खोज करते हैं, जो महत्वपूर्ण चीज़ों पर ध्यान केंद्रित करने और पूरी तस्वीर के प्रति जागरूक रहने की आवश्यकता के बीच संतुलन बनाते हैं। शोधकर्ताओं ने इसे एक छोटे रोबोट पर लगे कैमरे के साथ प्रदर्शित किया, जिससे पता चला कि यह प्रणाली मानवीय हस्तक्षेप के बिना एक नए वातावरण को कुशलतापूर्वक खोजने और जानकारी एकत्र करने में मदद कर सकती है।

अध्ययन ने हार्डवेयर पर सॉफ़्टवेयर चलाने के विभिन्न तरीकों का भी सावधानीपूर्वक परीक्षण किया ताकि गति और मेमोरी उपयोग के बीच सर्वोत्तम संतुलन पाया जा सके। उन्होंने पाया कि डिवाइस के ग्राफिक्स प्रोसेसर के लिए डिज़ाइन किए गए विशिष्ट उपकरणों का उपयोग करने से सिस्टम मानक तरीकों की तुलना में बहुत तेज़ी से चल सका। हालाँकि, उन्होंने यह भी पाया कि सिस्टम के निर्णय लेने वाले भाग के लिए, जो बहुत छोटा है, इसे शक्तिशाली ग्राफिक्स प्रोसेसर पर चलाने का प्रयास करने से वास्तव में इसकी गति धीमी हो गई क्योंकि कार्य को प्रबंधित करने का ओवरहेड अतिरिक्त शक्ति के लाभ से अधिक था। यह निष्कर्ष निकालता है कि सही सॉफ़्टवेयर टूल को सही हार्डवेयर के साथ मिलाना कितना महत्वपूर्ण है, जो इन प्रणालियों को वास्तविक दुनिया के उपयोग के लिए व्यावहारिक बनाने का एक महत्वपूर्ण कदम है।

यह कार्य सुझाव देता है कि स्मार्ट उपकरणों का भविष्य आवश्यक रूप से विशाल, क्लाउड-आधारित सुपरकंप्यूटरों की मांग नहीं करता है। देखने की मजबूत क्षमता को हल्के नियोजन (प्लानिंग) क्षमता के साथ जोड़कर, ऐसे एजेंट बनाना संभव है जो बुद्धिमान और कुशल दोनों हों। शोधकर्ताओं ने दिखाया कि ये प्रणालियाँ स्वतंत्र रूप से संचालित हो सकती हैं, जो जटिल और बदलते वातावरण में जानकारी एकत्र करने के लिए पलक झपकते ही निर्णय ले सकती हैं। जबकि वर्तमान प्रणाली कैमरे को नियंत्रित करने पर केंद्रित है, उन्हीं सिद्धांतों को अन्य कार्यों में लागू किया जा सकता है, जैसे कि किसी रोबोट को भीड़भाड़ वाले कमरे में नेविगेट करने में मदद करना या ड्रोन को लापता व्यक्ति की तलाश करने में मदद करना। अध्ययन यह निष्कर्ष निकालता है कि 'एक्टिव इन्फरेंस' अनुकूल, संसाधन-कुशल मशीनों को बनाने के लिए एक आशाजनक मार्ग प्रदान करता है जो वास्तविक दुनिया की अनिश्चितताओं को संभाल सकती हैं, जिससे बुद्धिमान संवेदन की शक्ति सीधे 'एज' तक पहुँचती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →