← नवीनतम पेपर
🤖 AI

RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition

RAG-HAR एक प्रशिक्षण-मुक्त, रिट्रीवल-ऑगमेंटेड फ्रेमवर्क है जो विविध बेंचमार्क में मानव गतिविधि पहचान (human activity recognition) में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए लार्ज लैंग्वेज मॉडल्स और अनुकूलित प्रॉम्प्ट इंजीनियरिंग का लाभ उठाता है, साथ ही बिना मॉडल फाइन-ट्यूनिंग या बड़े लेबल वाले डेटासेट की आवश्यकता के अनदेखी गतिविधियों की पहचान करने में सक्षम बनाता है।

मूल लेखक: Nirhoshan Sivaroopan, Hansi Karunarathna, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nirhoshan Sivaroopan, Hansi Karunarathna, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक स्मार्टवॉच है जो आपकी गतिविधियों को ट्रैक करती है। आमतौर पर, कंप्यूटर को यह सिखाने के लिए कि आप क्या कर रहे हैं (जैसे चलना, दौड़ना या बैठना), आपको हर व्यक्ति और हर नई गतिविधि के लिए एक कस्टम "शिक्षक" बनाना पड़ता है। आप इसे हजारों घंटों का डेटा देते हैं, यह कड़ी मेहनत से अध्ययन करता है, और फिर यह अनुमान लगाने में माहिर हो जाता है। लेकिन यदि आप घड़ी बदलते हैं, व्यक्ति बदलते हैं, या गतिविधि बदलते हैं, तो शिक्षक भ्रमित हो जाता है और आपको फिर से शुरुआत करनी पड़ती है।

RAG-HAR करने का एक नया तरीका है जो इस "अध्ययन" वाले हिस्से को पूरी तरह से छोड़ देता है। एक नया "शिक्षक" प्रशिक्षित करने के बजाय, यह एक सुपर-स्मार्ट, पहले से मौजूद "विशेषज्ञ" (एक लार्ज लैंग्वेज मॉडल, या LLM) का उपयोग करता है और अनुमान लगाने से ठीक पहले उसे एक चीट शीट (cheat sheet) देता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. समस्या: "कोरी स्लेट" वाला विशेषज्ञ

एक मानक AI के बारे में सोचें जो दुनिया की हर किताब पढ़ चुका है लेकिन उसने कभी किसी विशिष्ट प्रकार की गति (motion) नहीं देखी है। यदि आप उसे किसी नए व्यक्ति के दौड़ने का सेंसर रीडिंग दिखाते हैं, तो वह "चलना" होने का अनुमान लगा सकता है क्योंकि उसके पास इस व्यक्ति की दौड़ के लिए कोई विशिष्ट संदर्भ नहीं है। यह एक शेफ से एक ऐसा व्यंजन बनाने के लिए कहने जैसा है जिसे उसने पहले कभी नहीं देखा, केवल सामग्रियों का वर्णन करके।

2. समाधान: "लाइब्रेरी" दृष्टिकोण (RAG)

RAG-HAR खेल बदल देता है। विशेषज्ञ से याददाश्त से अनुमान लगाने के लिए कहने के बजाय, यह उन्हें उनके ठीक बगल में उदाहरणों की एक लाइब्रेरी देता है।

  • चीट शीट (वेक्टर डेटाबेस): अनुमान लगाने से पहले, सिस्टम आपकी गति (जैसे, आपकी गति का 2-सेकंड का क्लिप) को देखता है। यह इस गति को सरल गणितीय तथ्यों में तोड़ देता है (जैसे "औसत गति कितनी तेज़ थी?" या "कितना कंपन हुआ?")। फिर यह एक विशाल डिजिटल लाइब्रेरी में जाता है और सबसे मिलते-जुलते 10 पिछले उदाहरण ढूंढता है।
  • संदर्भ (Context): यह उन 10 उदाहरणों को विशेषज्ञ AI को सौंप देता है और कहता है, "यह नई गति इन 10 चीजों से बहुत मिलती-जुलती है। इसके आधार पर, यह क्या है?"

3. दो-चरणीय प्रक्रिया

पेपर बताता है कि यह मुख्य रूप से दो चरणों में होता है:

  • चरण 1: बेसलाइन (एक त्वरित नज़र)
    सिस्टम आपकी गति को लेता है, उसे संख्याओं की एक सूची (सांख्यिकी) में बदल देता है, और लाइब्रेरी में समान सूचियों को खोजता है। फिर यह AI से पूछता है: "यहाँ 10 समान पिछली गतिविधियाँ और उनके लेबल हैं। यह नई गतिविधि क्या है?"

    • परिणाम: यह अकेले ही कई जटिल, प्रशिक्षित प्रणालियों से बेहतर है क्योंकि AI वास्तविक उदाहरणों का उपयोग करके "तर्क" (reasoning) कर सकता है।
  • चरण 2: अनुकूलन (विशेषज्ञ की पॉलिश)
    शोधकर्ताओं ने महसूस किया कि AI और भी बेहतर प्रदर्शन कर सकता है यदि "चीट शीट" को अधिक स्पष्ट रूप से लिखा जाए और प्रश्न अधिक चतुराई से पूछे जाएं।

    • बेहतर विवरण: केवल AI को कच्चे नंबर देने के बजाय, वे AI का उपयोग करके गति के बारे में एक छोटी, स्वाभाविक भाषा वाली कहानी लिखते हैं (जैसे, "यह एक लयबद्ध, उच्च-तीव्रता वाली गति है जिसमें एक स्थिर ताल है")। यह AI को गति के एहसास को समझने में मदद करता है, न कि केवल गणित को।
    • प्रॉम्प्ट इंजीनियरिंग (Prompt Engineering): उन्होंने सवाल पूछने के तरीके को स्वचालित रूप से लिखने के लिए एक विशेष टूल का उपयोग किया, और हजारों अलग-अलग तरीकों का परीक्षण किया जब तक कि उन्हें वह तरीका नहीं मिल गया जिससे सबसे अच्छे उत्तर मिले।

4. यह एक बड़ी बात क्यों है

पेपर RAG-HAR की तीन प्रमुख महाशक्तियों पर प्रकाश डालता है:

  • कोई प्रशिक्षण आवश्यक नहीं: आपको AI को सिखाने के लिए हफ्तों खर्च करने की आवश्यकता नहीं है। आपको बस लाइब्रेरी में नए उदाहरण जोड़ने होते हैं। यदि आप चाहते हैं कि AI "डांसिंग" को पहचान ले, तो आपको बस लाइब्रेरी में डांसिंग के कुछ उदाहरण जोड़ने होंगे। AI तुरंत जान जाएगा कि इसे कैसे करना है।
  • यह अज्ञात का अनुमान लगा सकता है: पारंपरिक AI तब फंस जाता है जब वह कुछ ऐसा देखता है जिसके लिए उसे प्रशिक्षित नहीं किया गया है (जैसे व्यायाम का एक नया प्रकार)। RAG-HAR एक अजीब नई गति को देख सकता है, कह सकता है, "मैंने इसे ठीक से नहीं देखा है, लेकिन यह जॉगिंग और जंपिंग का मिश्रण लग रहा है," और इसे एक सार्थक नाम दे सकता है। यह केवल "मुझे नहीं पता" नहीं कहता।
  • यह सस्ता और तेज़ है: क्योंकि इसे मॉडल को "प्रशिक्षित" करने के लिए एक विशाल कंप्यूटर की आवश्यकता नहीं होती है, इसलिए यह बहुत सारा पैसा और समय बचाता है। यह एक सलाहकार को काम पर रखने जैसा है जो पहले से ही सब कुछ जानता है, बजाय इसके कि एक छात्र को काम पर रखा जाए और उसे वर्षों तक सिखाया जाए।

सारांश उपमा

कल्पना कीजिए कि आप एक ऐसे पक्षी की पहचान करने की कोशिश कर रहे हैं जिसे आपने पहले कभी नहीं देखा है।

  • पुराना तरीका (डीप लर्निंग): आप 50 विशिष्ट पक्षियों की तस्वीरें याद करने में 10 साल बिताते हैं। यदि आप एक ऐसा पक्षी देखते हैं जो आपकी सूची में नहीं है, तो आप असफल हो जाते हैं।
  • RAG-HAR तरीका: आपके पास एक दोस्त है जो पक्षियों का विशेषज्ञ है। आप उसे पक्षी दिखाते हैं, और साथ ही आप उसे एक किताब भी देते हैं जिसमें वे 10 पक्षी हैं जो उससे सबसे अधिक मिलते-जुलते हैं। आपका दोस्त किताब को देखता है, पक्षी के साथ उसकी तुलना करता है, और कहता है, "आह, यह एक गौरैया और एक फिंच के मिश्रण जैसा दिखता है, लेकिन यह निश्चित रूप से गौरैया का एक नया प्रकार है।"

पेपर यह सिद्ध करता है कि यह "संदर्भ पुस्तक के साथ सलाहकार" वाला दृष्टिकोण मानव गतिविधियों को पहचानने के लिए "याददाश्त वाले छात्र" के दृष्टिकोण की तुलना में बेहतर काम करता है, और इसके लिए किसी अतिरिक्त प्रशिक्षण की आवश्यकता नहीं होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →