← नवीनतम पेपर
💻 computer science

GenHAR: Generalizing Cross-domain Human Activity Recognition for Last-mile Delivery

GenHAR एक नवीन फ्रेमवर्क है जो सेंसर डेटा को टोकनाइज़ करने और अत्याधुनिक सटीकता एवं दक्षता प्राप्त करने के लिए कुशल अटेंशन के साथ चयनात्मक मास्किंगिंग (selective masking) का उपयोग करके ह्यूमन एक्टिविटी रिकग्निशन में क्रॉस-डोमेन डिस्ट्रीब्यूशन शिफ्ट की समस्या को संबोधित करता है, जैसा कि लास्ट-माइल डिलीवरी में बड़े पैमाने पर वास्तविक दुनिया के परिनियोजन द्वारा प्रमाणित किया गया है।

मूल लेखक: Zhiqing Hong, Zelong Li, Xiubin Fan, Guang Yang, Baoshen Guo, Haotian Wang, Tian He, Desheng Zhang

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiqing Hong, Zelong Li, Xiubin Fan, Guang Yang, Baoshen Guo, Haotian Wang, Tian He, Desheng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को यह पहचानना सिखाने की कोशिश कर रहे हैं कि डिलीवरी ड्राइवर चल रहा है, सीढ़ियाँ चढ़ रहा है, या स्थिर खड़ा है। आप एक रोबोट को बीजिंग के ड्राइवरों के एक विशिष्ट समूह के डेटा का उपयोग करके प्रशिक्षित करते हैं। लेकिन जब आप उसी रोबोट को शंघाई में काम करने के लिए भेजते हैं, या केवल एक ही शहर के अलग-अलग ड्राइवरों के साथ काम करने के लिए भेजते हैं, तो वह गलतियाँ करने लगता है। वह भ्रमित हो जाता है क्योंकि डेटा की "आवाज़" अलग सुनाई देती है—शायद फोन अलग तरह से जेबों में रखे गए हैं, या ड्राइवरों के चलने का तरीका अलग है।

यह समस्या है जिसे GenHAR हल करता है। यह एक नया सिस्टम है जिसे कंप्यूटर को मानवीय गतिविधियों (जैसे चलना या सीढ़ियाँ चढ़ना) को पहचानने में मदद करने के लिए डिज़ाइन किया गया है, भले ही डेटा पूरी तरह से एक अलग "दुनिया" से आया हो जिस पर इसे प्रशिक्षित किया गया था।

यह कैसे काम करता है, इसके सरल अवधारणाओं में विवरण यहाँ दिया गया है:

1. समस्या: "लहजे" (Accent) का मुद्दा

सेंसर डेटा (फोन या घड़ी से) को मानव के बोलने की तरह समझें। यदि आप एक अनुवादक को किसी विशिष्ट व्यक्ति के लहजे को समझने के लिए प्रशिक्षित करते हैं, तो उसे संघर्ष करना पड़ सकता है जब वह व्यक्ति अपने किसी मित्र से बात करता है जिसका लहजा अलग हो। डिलीवरी की दुनिया में, हर कूरियर थोड़ा अलग तरह से चलता है, अपना फोन अलग जगह रखता है और अलग डिवाइस का उपयोग करता है। यह एक "डिस्ट्रीब्यूशन शिफ्ट" (वितरण बदलाव) पैदा करता है—डेटा इतना अलग दिखता है कि पुराना AI भ्रमित हो जाता है और विफल हो जाता है।

अधिकांश पिछले AI ने इसे ठीक करने की कोशिश की, प्रशिक्षण के दौरान नए समूह (लक्ष्य डोमेन) से उदाहरण दिखाकर। लेकिन वास्तविक दुनिया में, आपको अक्सर प्रशिक्षण के दौरान वह डेटा पहले से नहीं मिल पाता। आपको एक ऐसे सिस्टम की आवश्यकता है जो एक समूह से सीख सके और बिना अतिरिक्त प्रशिक्षण के तुरंत किसी भी अन्य समूह के लिए काम कर सके।

2. समाधान: शब्दों के बजाय "संगीत" को सुनना

लेखकों ने महसूस किया कि कच्चे डेटा (शब्दों या गति की समयरेखा) को देखना बहुत शोर भरा है। इसके बजाय, उन्होंने गति को फ्रीक्वेंसी स्पेस (संगीत) में बदलने का निर्णय लिया।

  • उपमा: कल्पना करें कि दो लोग एक ही गाना गा रहे हैं। एक इसे तेज़ गाता है, दूसरा इसे धीमा। यदि आप शब्दों (समय) को देखते हैं, तो वे बहुत अलग दिखते हैं। लेकिन यदि आप शीट संगीत (फ्रीक्वेंसी) को देखते हैं, तो धुन और स्वर लगभग समान होते हैं।
  • नवाचार: GenHAR कच्चे मूवमेंट डेटा को इस "फ्रीक्वेंसी शीट संगीत" में बदल देता है। इसने पाया कि किसी गतिविधि (जैसे चलना) की "धुन" वैसी ही रहती है, भले ही उसका "टेम्पो" या "वाद्य यंत्र" (विशिष्ट फोन या व्यक्ति) बदल जाए। यह AI को बहुत अधिक मजबूत बनाता है।

3. गुप्त मंत्र: "सेंसर ऑर्केस्ट्रा"

एक बार जब डेटा इस फ्रीक्वेंसी फॉर्मेट में आ जाता है, तो GenHAR एक विशेष प्रकार के 'अटेंशन मैकेनिज्म' का उपयोग करता है।

  • उपमा: एक ऑर्केस्ट्रा की कल्पना करें। एक सामान्य AI वायलिन सेक्शन को सुन सकता है और केवल यह देखकर पूरे गाने को समझने की कोशिश कर सकता है कि वायलिन के स्वर समय के साथ कैसे बदलते हैं।
  • GenHAR का दृष्टिकोण: GenHAR एक कंडक्टर की तरह कार्य करता है जो यह सुनता है कि वायलिन, सेलो और ड्रम एक-दूसरे से कैसे बात करते हैं। वह समझ जाता है कि विभिन्न सेंसरों (एक्सेलेरोमीटर और जायरोस्कोप) के बीच का संबंध गतिविधि को समझने की कुंजी है।
  • चयनात्मक मास्किंग (Selective Masking): ऊर्जा बचाने के लिए, यह हर संभावित बातचीत को नहीं सुनता है। यह जानता है कि "बाएं-दाएं" वाला एक्सेलेरोमीटर "ऊपर-नीचे" वाले जायरोस्कोप के साथ वास्तव में बात करने की ज़रूरत नहीं है। यह उन अनावश्यक बातचीत को शांत कर देता है, जिससे सिस्टम अविश्वसनीय रूप से तेज़ और कुशल बन जाता है।

4. परिणाम: तेज़, स्मार्ट और वास्तविक दुनिया में परीक्षित

पेपर तीन बड़ी जीत का दावा करता है:

  • सटीकता: यह वर्तमान अत्याधुनिक तरीकों की तुलना में काफी अधिक सटीक है (औसतन लगभग 10% बेहतर)। इसने केवल अनुमान नहीं लगाया; इसने गतिविधि की वास्तविक "धुन" को सीखा।
  • दक्षता: यह बहुत हल्का है। इसे मौजूदा सर्वश्रेष्ठ मॉडलों की तुलना में 6.4 गुना कम कंप्यूटिंग पावर की आवश्यकता होती है। यह महत्वपूर्ण है क्योंकि डिलीवरी ड्राइवर इन मॉडलों का उपयोग अपने फोन पर करते हैं, जिनकी बैटरी और प्रोसेसिंग पावर सीमित होती है।
  • वास्तविक दुनिया में तैनाती: टीम ने इसे केवल लैब में टेस्ट नहीं किया। उन्होंने JD Logistics के साथ साझेदारी की, जो चीन की एक प्रमुख डिलीवरी कंपनी है। उन्होंने 4 शहरों के 9,985 कूरियरों के फोनों पर GenHAR स्थापित किया।
    • केवल एक महीने में, सिस्टम ने सफलतापूर्वक 2.15 बिलियन गतिविधियों का पता लगाया।
    • इसने सटीक रूप से पहचाना कि कूरियर कब चल रहे थे, सीढ़ियाँ चढ़ रहे थे, या स्थिर खड़े थे, भले ही इसे पूरी तरह से अलग लोगों के डेटा पर प्रशिक्षित किया गया था।

5. डिलीवरी के लिए यह क्यों मायने रखता है

पेपर दो विशिष्ट तरीकों पर प्रकाश डालता है जिनसे यह लॉजिस्टिक्स कंपनी की मदद करता है:

  1. निष्पक्ष कार्यभार: यह जानकर कि एक कूरियर कितना चढ़ना या चलना करता है, कंपनी काम अधिक निष्पक्षता से सौंप सकती है। यदि किसी इमारत में लिफ्ट नहीं है, तो सिस्टम जानता है कि उस कूरियर ने "अतिरिक्त काम" किया है और उसके अनुसार भुगतान या कार्य भार को समायोजित किया जा सकता है।
  2. बेहतर मानचित्र: यह सिस्टम शिपिंग पते को सत्यापित करने में मदद करता है। यदि एक कूरियर कहता है कि वह एक विशिष्ट पते पर है लेकिन फोन बताता है कि वह लगातार गाड़ी चला रहा है, तो सिस्टम जान जाता है कि पता गलत हो सकता है। इसने उन्हें उच्च सटीकता के साथ 6.8 मिलियन शिपिंग पते मैप करने में मदद की।

संक्षेप में: GenHAR एक स्मार्ट, हल्का AI है जो मानवीय गति की "सार्वभौमिक धुन" को सीखता है। यह अलग-अलग फोन और लोगों के शोर को अनदेखा करता है, जिससे यह बिना पुन: प्रशिक्षित हुए, कहीं भी, कभी भी, गतिविधियों को पूरी तरह से पहचानने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →