← नवीनतम पेपर
💻 computer science

DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints

यह शोध पत्र DETRPose को प्रस्तुत करता है, जो मल्टी-पर्सन पोज़ एस्टीमेशन के लिए वास्तविक समय (रियल-टाइम), एंड-टू-एंड ट्रांसफार्मर मॉडल्स का पहला परिवार है, जो एक संशोधित डिकोडर, एक नवीन डिनोइज़िंग कीपॉइंट तकनीक और एक विस्तारित वैरीफोकल लॉस का लाभ उठाकर काफी कम पैरामीटर्स और तेज़ इन्फरेंस स्पीड के साथ अत्याधुनिक सटीकता प्राप्त करता है।

मूल लेखक: Sebastian Janampa, Marios Pattichis

प्रकाशित 2026-07-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sebastian Janampa, Marios Pattichis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाली पार्टी में हैं, और आपको हर किसी के डांस मूव्स की फोटो लेनी है। आपका लक्ष्य हर एक व्यक्ति को तुरंत पहचानना और उन पर एक स्टिक फिगर (stick figure) बनाना है, जिसमें उनके सभी जोड़ों (कंधों, कोहनियों, घुटनों आदि) को सही ढंग से जोड़ा गया हो। कंप्यूटर वैज्ञानिक इसे मल्टी-पर्सन पोज़ एस्टीमेशन (Multi-Person Pose Estimation) कहते हैं।

लंबे समय तक, कंप्यूटर यह काम तेजी से करने में संघर्ष करते रहे। या तो वे बहुत सटीक थे लेकिन धीमे (जैसे एक सावधानीपूर्वक कलाकार जो एक व्यक्ति का चित्र बनाने में घंटों लगा देता है), या फिर तेज लेकिन अव्यवsted (जैसे एक स्पीड-ड्राइंग प्रतियोगिता जहाँ हाथ-पैर आपस में मिल जाते हैं)।

यह पेपर DETRPose पेश करता है, जो एक नया सिस्टम है जो एक "सुपर-फास्ट, सुपर-एक्यूरेट पार्टी फोटोग्राफर" की तरह काम करता है, जो ट्रांसफॉर्मर (Transformer) नामक एक विशेष प्रकार के AI दिमाग का उपयोग करता है। यह कैसे काम करता है, इसका विवरण सरल अवधारणाओं में यहाँ दिया गया है:

1. समस्या: "सर्च एंड क्रॉप" (खोजो और काटो) की बाधा

ज्यादातर तेज़ तरीके पहले एक क्लब के बाउंसर की तरह काम करते थे। पहले बाउंसर व्यक्ति को पहचानता है, उसे भीड़ से काटकर अलग करता है (इमेज को क्रॉप करता है), और फिर उसका कंकाल (skeleton) बनाने की कोशिश करता है।

  • दोष: यदि पार्टी में 50 लोग हैं, तो बाउंसर को यह काम 50 बार करना होगा। जितने अधिक लोग होंगे, प्रक्रिया उतनी ही धीमी होती जाएगी।
  • पुराना ट्रांसफॉर्मर वाला मुद्दा: नए, स्मार्ट AI मॉडल (ट्रांसफॉर्मर) पूरी भीड़ को एक साथ देख सकते थे, लेकिन वे वास्तविक समय (real-time) में उपयोगी होने के लिए बहुत धीमे थे। वे एक ऐसे जीनियस की तरह थे जिसे उस पहेली को सुलझाने में एक सप्ताह लग जाता है जिसे एक बच्चा एक मिनट में हल कर सकता है।

2. समाधान: DETRPose

लेखकों ने DETRPose बनाया है, पहला ट्रांसफॉर्मर मॉडल जो इस काम को रियल-टाइम में कर सकता है। यह एक ही बार में पूरी इमेज को देखता है और सभी के लिए कंकाल बनाता है।

इसे संभव बनाने के लिए, उन्होंने तीन मुख्य "ट्रिक्स" पेश किए हैं:

ट्रिक A: "नॉइज़-कैंसलिंग" ट्रेनिंग (डिनोइजिंग कीपॉइंट्स)

कल्पना कीजिए कि आप एक छात्र को मानचित्र पर एक विशिष्ट स्थान ढूंढना सिखा रहे हैं।

  • पुराना तरीका: आप उन्हें बस सटीक स्थान दिखाते हैं।
  • DETRPose का तरीका: आप उन्हें सटीक स्थान दिखाते हैं, लेकिन साथ ही उन्हें कुछ "नकली" स्थान भी दिखाते हैं जो थोड़े गलत हैं (बहुत बाईं ओर, बहुत दाईं ओर)। आप छात्र को सिखाते हैं: "यह असली है, लेकिन वे दूसरे पास के हैं पर गलत हैं।"
  • परिणाम: AI को "असली" जोड़ों और "शोर वाले" नकली जोड़ों के बीच अंतर करने के लिए प्रशिक्षित करके, मॉडल बहुत तेजी से सीखता है और बहुत अधिक आत्मविश्वासी हो जाता है। इसे डिनोइजिंग कीपॉइंट्स (Denoising Keypoints) कहा जाता है।

ट्रिक B: "क्वालिटी कंट्रोल" स्कोर (KSVF लॉस)

आमतौर पर, AI मॉडल अनुमान लगाते हैं कि जोड़ कहाँ है और उसे एक स्कोर देते हैं। लेकिन पोज़ एस्टीमेशन में, एक "अच्छा अनुमान" केवल पास होने के बारे में नहीं है; यह इस बारे बारे में है कि जोड़ व्यक्ति के शरीर के आकार में कितनी अच्छी तरह फिट बैठता है।

  • लेखकों ने एक नया स्कोरिंग नियम बनाया जिसे कीपॉइंट सिमिलरिटी वैरीफोकल (KSVF) लॉस कहा जाता है।
  • इसे एक सख्त शिक्षक के रूप में सोचें जो केवल "निकटता" के आधार पर ग्रेड नहीं देता, बल्कि यह भी जाँचता है कि क्या उत्तर पूरी तस्वीर के संदर्भ में सही है। यह AI को खराब अनुमानों को अनदे로 करने और केवल उच्च-गुणवत्ता वाले अनुमानों पर ध्यान केंद्रित करने में मदद करता है, जिससे कंप्यूटिंग पावर बचती है।

ट्रिक C: "रिफाइंड डिकोडर" (ग्रुपपोज़ अपग्रेड)

AI का वह हिस्सा जो वास्तव में रेखाएं खींचता है (डिकोडर), उसे अपग्रेड किया गया था।

  • उन्होंने उन अनावश्यक चरणों को हटा दिया जो चीजों को धीमा कर देते थे।
  • उन्होंने Pose-LQE (लोकलाइजेशन क्वालिटी एस्टीमेशन) नामक एक विशेष लेयर जोड़ी। इसे एक दूसरी जोड़ी आँखों के रूप में समझें जो अंतिम चित्र भेजने से पहले ड्राइंग की दोबारा जाँच करती है, यह सुनिश्चित करती है कि कंधे और कोहनियां बिना प्रक्रिया को धीमा किए बिल्कुल सही जगह पर हों।

3. परिणाम: गति बनाम सटीकता

यह पेपर इसकी तुलना वर्तमान चैंपियंस (जैसे YOLO मॉडल और अन्य भारी ट्रांसफॉर्मर मॉडल) से करता है।

  • "छोटा" मॉडल (DETRPose-S): यह सबसे बड़े, भारी YOLO मॉडलों जितना सटीक है, लेकिन यह बहुत छोटा है (81% कम मेमोरी संसाधनों का उपयोग करता है) और बहुत तेज़ है (इन्फरेंस 52% तेज़ है)।
  • "बड़ा" मॉडल (DETRPose-X): एक बहुत ही भीड़भाड़ वाले डेटासेट (CrowdPose) पर, यह लगभग सभी अन्य ट्रांसफॉर्मर मॉडलों को पछाड़ देता है जबकि 13 गुना कम कंप्यूटिंग पावर (FLOPs) का उपयोग करता है।
  • "आउट-ऑफ-डिस्ट्रीब्यूशन" टेस्ट: जब इसे बहुत अजीब, भीड़भाड़ वाले या असामान्य पोज़ वाले लोगों के डेटासेट (OCHuman) पर टेस्ट किया गया जिसे मॉडल ने पहले नहीं देखा था, तो DETRPose ने बाकी सभी से बेहतर प्रदर्शन किया। यह दिखाता है कि यह मजबूत है और केवल ट्रेनिंग डेटा को रटता नहीं है।

4. एक कमी

लेखक एक सीमा स्वीकार करते हैं: भले ही DETRPose गणितीय रूप से कुशल है, फिर भी यह कच्चे रूप में सबसे तेज़ "YOLO" मॉडलों की तुलना में थोड़ा धीमा है। ऐसा इसलिए है क्योंकि लोगों को एक साथ जोड़ने के तरीके में कुछ जटिल डेटा शेफलिंग (जैसे ताश के पत्तों को फिर से व्यवस्थित करना) की आवश्यकता होती है जो थोड़ा अतिरिक्त समय लेती है। हालांकि, यह वास्तविक समय (real-time) में काम करने के लिए पर्याप्त तेज़ है और पिछले ट्रांसफॉर्मर प्रयासों की तुलना में बहुत अधिक कुशल है।

सारांश

DETRPose एक बड़ी उपलब्धि है क्योंकि यह आखिरकार "स्मार्ट, सर्वव्यापी" शक्ति को रियल-टाइम पोज़ एस्टीमेशन में लाता है। यह यह सब इसलिए कर पाता है क्योंकि यह AI को अपनी गलतियों से तेज़ी से सीखने (डिनोइजिंग), अपने उत्तरों को अधिक बुद्धिमानी से ग्रेड करने (KSVF लॉस), और अपनी ड्राइंग प्रक्रिया को सुव्यवस्थित करने की शिक्षा देता है। परिणाम एक ऐसा सिस्टम है जो अविश्वसनीय रूप से सटीक है, भीड़ को पहले से बेहतर तरीके से संभालता है, और वर्चुअल रियलिटी या एक्टिविटी रिकग्निशन जैसे वास्तविक दुनिया के अनुप्रयोगों के लिए पर्याप्त तेज़ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →