← नवीनतम पेपर
💻 computer science

Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

यह शोध पत्र "स्पाइकिंग पैचेस" (Spiking Patches) को प्रस्तुत करता है, जो इवेंट कैमरों के लिए एक एसिंक्रोनस और स्पार्स टोकनाइजेशन विधि है जो विभिन्न विजन कार्यों में मौजूदा फ्रेम और वोक्सेल-आधारित दृष्टिकोणों की तुलना में तेज़ अनुमान और तुलनीय या बेहतर सटीकता प्राप्त करते हुए उनके अद्वितीय गुणों को संरक्षित करता है।

मूल लेखक: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

प्रकाशित 2026-09-02
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट और स्वयं-चालित कारों ने लंबे समय से मानक कैमरों पर भरोसा किया है जो दुनिया को एक मूवी कैमरे की तरह कैप्चर करते हैं, जो हर सेकंड के कुछ हिस्से में एक दृश्य की पूरी तस्वीर लेते हैं। यह तरीका कई चीजों के लिए अच्छा काम करता है, लेकिन यह डेटा का एक भारी बोझ पैदा करता है, जिसका बहुत सा हिस्सा केवल खाली स्थान या अपरिवर्तित पृष्ठभूमि होता है। एक नए प्रकार का सेंसर, जिसे इवेंट कैमरा (event camera) कहा जाता है, एक अलग सिद्धांत पर काम करता है। पूरी तस्वीरें लेने के बजाय, यह केवल परिवर्तनों को रिकॉर्ड करता है। जब सेंसर का एक पिक्सेल चमक में बदलाव महसूस करता है, तो वह ठीक उसी क्षण एक एकल संकेत, या 'इवेंट', भेजता है। इसका मतलब है कि कैमरा अलग-थलग संकेतों की एक धारा उत्पन्न करता है जो एसिंक्रोनस (asynchronous) होती है, यानी वे एक निश्चित लय के बजाय तभी होती हैं जब कुछ बदलता है। इसका यह भी अर्थ है कि डेटा स्पार्स (sparse) है, जिसमें केवल आंदोलन या परिवर्तन के बारे में जानकारी होती है, बाकी दृश्य को शांत छोड़ देती है। हालांकि यह दृष्टिकोण अविश्वसनीय रूप से कुशल और तेज़ है, लेकिन इस अद्वितीय डेटा स्ट्रीम को उन आर्टिफिशियल इंटेलिजेंस मॉडलों में फीड करना कठिन रहा है जिनका उपयोग रोबोट अपने परिवेश को समझने के लिए करते हैं।

वर्षों से, शोधकर्ताओं ने इन एसिंक्रोनस संकेतों को पुराने, परिचित मानक छवियों के प्रारूप में बदलने की कोशिश करके इसे हल करने का प्रयास किया है। वे इवेंट्स को निश्चित समय अंतराल में समूहों में बांट देते थे ताकि एक फ्रेम बनाया जा सके, ठीक वैसे ही जैसे स्नैपशॉट की एक श्रृंखला को जोड़ने जैसा हो। हालांकि, यह प्रक्रिया उन गुणों को नष्ट कर देती है जो इवेंट कैमरों को विशेष बनाते हैं। एक फ्रेम बनाने के लिए एक निश्चित समय बीतने का इंतजार करके, सिस्टम अचानक होने वाले परिवर्तनों पर तुरंत प्रतिक्रिया देने की क्षमता खो देता है, और खाली स्थानों को भरकर, यह केवल प्रासंगिक डेटा रखने की दक्षता को खो देता है। डेनमार्क की तकनीकी विश्वविद्यालय (Technical University of Denmark) के शोधकर्ताओं की एक टीम ने अब आगे बढ़ने का एक अलग तरीका प्रस्तावित किया है। उन्होंने 'स्पाइकिंग पैचेस' (Spiking Patches) नामक एक नई विधि विकसित की, जो इन बदलते संकेतों के समूहों को सूचना की एकल इकाइयों के रूप में मानती है, बिना उन्हें एक कठोर, समय-आधारित ग्रिड में मजबूर किए। यह दृष्टिकोण डेटा को एसिंक्रोनस और स्पार्स रहने देता है, जिससे मूल सेंसर की गति और दक्षता बनी रहती है और साथ ही यह शक्तिशाली आधुनिक एआई मॉडलों के अनुकूल भी हो जाता है।

शोधकर्ताओं ने अपने सिस्टम को यह देखकर डिजाइन किया कि जैविक न्यूरॉन्स कैसे काम करते हैं। मस्तिष्क में, एक न्यूरॉन तब तक प्रतीक्षा करता है जब तक कि वह एक निश्चित सीमा (threshold) तक पहुँचने के लिए पर्याप्त संकेत प्राप्त नहीं कर लेता, और फिर वह फायर (fire) करता है। टीम ने इवेंट कैमरा डेटा पर यही तर्क लागू किया। उन्होंने कैमरे के दृश्य को छोटे वर्गों, या 'पैचेस' (patches) के ग्रिड में विभाजित किया। जैसे-जैसे इवेंट्स आते हैं, वे प्रत्येक पैच के भीतर जमा होते हैं, जिससे एक आभासी क्षमता (virtual potential) बढ़ती है। एक बार जब किसी पैच में इवेंट्स की संख्या एक विशिष्ट सीमा तक पहुँच जाती है, तो वह पैच "फायर" होता है, जिससे एक 'टोकन' बनता है जो उन इवेंट्स के समूह का प्रतिनिधित्व करता है। इस टोकन को फिर प्रोसेसिंग के लिए एआई मॉडल को भेजा जाता है। महत्वपूर्ण रूप से, यह फायरिंग प्रत्येक पैच के लिए स्वतंत्र रूप से और ठीक उस क्षण होती है जब सीमा प्राप्त होती है, न कि घड़ी के टिक-टिक करने का इंतजार करती है। इसका मतलब है कि सिस्टम एक तेज़ गति से चलती वस्तु पर तुरंत प्रतिक्रिया दे सकता है, जैसे ही पर्याप्त इवेंट्स जमा होते हैं, बिना एक पूर्ण फ्रेम बनने का इंतजार किए।

यह परीक्षण करने के लिए कि क्या यह विचार व्यवहार में काम करता है, टीम ने अपने 'स्पाइकिंग पैचेस' की तुलना इवेंट डेटा को संभालने के दो सबसे सामान्य तरीकों से की: मानक फ्रेम और वोक्सेल्स (voxels) नामक डेटा के 3D ब्लॉक्स। उन्होंने तीन अलग-अलग प्रकार के एआई आर्किटेक्चर पर इसका परीक्षण किया, जिसमें ग्राफ, पॉइंट क्लाउड और ट्रांसफॉर्मर के लिए डिज़ाइन किए गए नेटवर्क शामिल थे, जिसमें हाथ के इशारों को पहचानना और ड्राइविंग फुटेज में कारों का पता लगाना जैसे कार्य शामिल थे। परिणाम चौंकाने वाले थे। गति के मामले में, नई विधि विकल्पों की तुलना में काफी तेज़ थी। हाथ के इशारों को पहचानते समय, स्पाइकिंग पैचेस सिस्टम वोक्सेल विधि की तुलना में 3.4 गुना और फ्रेम-आधारित विधि की तुलना में 10.4 गुना तक तेज़ था। यह गति बिना सटीकता से समझौता किए मिली; कई मामलों में, नया तरीका पुराने तरीकों जितना ही सटीक था, और कुछ उदाहरणों में, यह और भी अधिक सटीक था, जिससे जेस्चर रिकग्निशन में 3.8 प्रतिशत अंक और ऑब्जेक्ट डिटेक्शन में 1.4 प्रतिशत अंक तक का सुधार हुआ।

अध्ययन ने यह भी पुष्टि की कि इस पद्धति ने डेटा को स्पार्स और एसिंक्रोनस बनाए रखा। शोधकर्ताओं ने मापा कि सिस्टम एक दृश्य पर प्रतिक्रिया करने के लिए कितनी जल्दी पर्याप्त जानकारी एकत्र कर सकता है, इसकी तुलना कच्चे इवेंट स्ट्रीम से की। उन्होंने पाया कि स्पाइकिंग पैचेस सिस्टम कच्चे इवेंट्स की तरह ही लगभग उतनी ही तेज़ी से प्रतिक्रिया कर सकता है, जिसमें केवल कुछ मिलीसेकंड की मामूली देरी होती है, जबकि फ्रेम-आधारित तरीकों को एक निश्चित समय अंतराल का इंतजार करना पड़ता था, जिससे काफी लंबा लैग (lag) उत्पन्न होता था। इसके अलावा, नए तरीके ने कंप्यूटर द्वारा प्रोसेस किए जाने वाले डेटा की मात्रा को फ्रेम और वोक्सेल्स की तुलना में कम से कम 1.5 के कारक से कम कर दिया, और कुछ मामलों में, कच्चे इवेंट स्ट्रीम की तुलना में सैकड़ों गुना कम कर दिया। डेटा आकार में यह कमी ही इस कारण है कि सिस्टम इतना तेज़ चलता है, क्योंकि कंप्यूटर को विश्लेषण करने के लिए कम आइटम मिलते हैं।

इस खोज का सबसे व्यावहारिक पहलू यह है कि सिस्टम वास्तविक समय के अनुप्रयोगों को संभालने के लिए पर्याप्त तेज़ है। शोधकर्ताओं ने टोकनाइजेशन प्रक्रिया को एक ऐसी प्रोग्रामिंग भाषा में लागू किया जो अपनी गति के लिए जानी जाती है और पाया कि सिस्टम कैमरा से नए इवेंट्स आने की दर से भी तेज़ टोकन उत्पन्न कर सकता है। इसका मतलब है कि सिस्टम वास्तविक दुनिया के परिदृश्यों में, जैसे कि राजमार्ग पर चलती कार में, बिना पीछे छूटे सूचना के प्रवाह के साथ तालमेल बिठा सकता है। टीम ने यह भी पता लगाया कि विभिन्न सेटिंग्स ने प्रदर्शन को कैसे प्रभावित किया, और पाया कि वे टोकन उत्पन्न करने की संख्या और परिणाम की सटीकता के बीच संतुलन बनाने के लिए सिस्टम की संवेदनशीलता को समायोजित कर सकते हैं। उदाहरण के लिए, एक पैच के फायर होने के बाद एक संक्षिप्त विराम पेश करके, वे सटीकता को लगभग समान रखते हुए टोकन की संख्या को चार गुना कम कर सकते थे।

हालांकि परिणाम उत्साहजनक हैं, शोधकर्ता नोट करते हैं कि इस पद्धति के लिए उस थ्रेशोल्ड (threshold) को सावधानीपूर्वक ट्यून करने की आवश्यकता है जो टोकन को ट्रिगर करता है। यदि थ्रेशोल्ड बहुत कम सेट किया जाता है, तो सिस्टम बहुत अधिक बार फायर कर सकता है, जिससे बहुत अधिक डेटा उत्पन्न होता है। यदि यह बहुत अधिक सेट किया जाता है, तो यह महत्वपूर्ण विवरणों को मिस कर सकता है। टीम का सुझाव है कि भविष्य का कार्य इस थ्रेशोल्ड को दृश्य के अनुसार स्वचालित रूप से अनुकूलित करने पर केंद्रित हो सकता है। वे इस पद्धति को अन्य प्रकार के कार्यों, जैसे कि चलती वस्तुओं को ट्रैक करने या दृश्य में गति के प्रवाह की गणना करने पर भी परीक्षण करने की योजना बना रहे हैं। फिलहाल, यह कार्य यह प्रदर्शित करता है कि इवेंट कैमरों की अनूठी, एसिंक्रोनस प्रकृति और आधुनिक रोबोटिक्स को चलाने वाले शक्तिशाली एआई मॉडलों के बीच के अंतर को पाटना संभव है। इवेंट्स के समूहों को एकल, सार्थक इकाइयों के रूप में मानकर, शोधकर्ताओं ने दिखाया है कि हम आर्टिफिशियल इंटेलिजेंस के सबसे उन्नत उपकरणों का उपयोग करने की क्षमता खोए बिना इवेंट कैमरों की गति और दक्षता को बनाए रख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →