← नवीनतम पेपर
💻 computer science

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

Pose-dIVE एक नवीन डेटा ऑग्मेंटेशन फ्रेमवर्क है जो विविध प्रशिक्षण नमूने उत्पन्न करने के लिए SMPL-आधारित मानव मुद्राओं और कैमरा दृष्टिकोणों पर आधारित डिफ्यूजन मॉडल का लाभ उठाता है, जिससे पोज़ और व्यूपॉइंट पूर्वाग्रहों को कम किया जा सकता है और पर्सन री-आइडेंटिफिकेशन मॉडलों की सामान्यीकरण क्षमता को बढ़ाया जा सकता है।

मूल लेखक: Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शॉपिंग मॉल में लोगों को पहचानने के लिए एक सुरक्षा गार्ड को प्रशिक्षित कर रहे हैं। कंप्यूटर के लिए यह Person Re-Identification (Re-ID) करता है: यह कैमरों को एक कैमरे से दूसरे कैमरे में चलते हुए विशिष्ट लोगों को ट्रैक करने और पहचानने में मदद करता है।

हालाँकि, एक बड़ी समस्या है कि हम आमतौर पर अपने "डिजिटल गार्ड" को कैसे प्रशिक्षित करते हैं।

समस्या: "बोरिंग क्लासरूम" (उबाऊ कक्षा)

कल्पना कीजिए कि आप अपने सुरक्षा गार्ड को केवल उन लोगों की तस्वीरें दिखाकर प्रशिक्षित करते हैं जो सीधे आगे चल रहे हैं और स्थिर खड़े हैं, जिन्हें आई-लेवल (आंखों के स्तर) वाले कैमरों से लिया गया है।

  • वास्तविकता: वास्तविक दुनिया में, लोग दौड़ते हैं, नाचते हैं, बैठते हैं, कूदते हैं और तिरछे चलते हैं। कैमरे अक्सर दीवारों पर ऊंचे या जमीन पर नीचे लगे होते हैं।
  • परिणाम: जब आपका गार्ड किसी व्यक्ति को दौड़ते हुए या ऊंचे एंगल से देखता है, तो वह भ्रमित हो जाता है। वह सोच सकता है, "मैंने इस व्यक्ति को पहले कभी नहीं देखा!" क्योंकि प्रशिक्षण डेटा बहुत सीमित था।

मौजूदा डेटासेट एक ऐसी कक्षा की तरह हैं जहाँ हर कोई एक ही कुर्सी पर, एक ही दिशा में बैठा है। छात्र (AI मॉडल) व्यक्ति को नहीं, बल्कि कुर्सी को पहचानना सीख जाते हैं।

समाधान: Pose-dIVE (इमेजिनेशन जिम)

यह पेपर इस समस्या को ठीक करने के लिए Pose-dIVE नामक एक नई विधि पेश करता है। Pose-dIVE को अपने सुरक्षा गार्ड के लिए एक जादुई इमेजिनेशन जिम (कल्पना जिम) के रूप में समझें। केवल लोगों के चलने की अधिक तस्वीरें दिखाने के बजाय, यह एक शक्तिशाली AI टूल (जिसे Diffusion Model कहा जाता है) का उपयोग करके नए परिदृश्य गढ़ता है।

यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "पुतला" (SMPL)

सबसे पहले, सिस्टम एक 3D डिजिटल पुतले का उपयोग करता है जिसे SMPL कहा जाता है। इसे एक लचीले, पोज़ देने योग्य कंकाल के रूप में समझें।

  • ट्रिक: केवल किसी व्यक्ति की फोटो लेने के बजाय, सिस्टम उस पुतले को एक अजीब डांस पोज़ में मोड़ देता है और उसके चारों ओर कैमरा घुमा देता है।
  • क्यों? इससे वे एक ऐसा "टारगेट" पोज़ बना सकते हैं जो मूल तस्वीरों में मौजूद नहीं था। वे कह सकते हैं, "ठीक है, पुतले, गोल घूमो और कूदो!"

2. "जादुई चित्रकार" (Diffusion Model)

एक बार जब उनके पास वह मुड़ा हुआ पुतला आ जाता है, तो उन्हें उसे किसी विशिष्ट व्यक्ति की वास्तविक फोटो में बदलना होता है।

  • वे एक Diffusion Model का उपयोग करते हैं (जैसे वह AI जो टेक्स्ट से कला बनाता है)।
  • प्रक्रिया: कल्पना कीजिए कि आपके पास आपके दोस्त बॉब की एक फोटो है। आप जादुई चित्रकार से कहते हैं: "बॉब का चेहरा और कपड़े लो, लेकिन उसे इस नए पोज़ में डाल दो जो हमने अभी पुतले के साथ बनाया था, और फोटो को ऊपर से ऊंचे एंगल से लो।"
  • AI बॉब की एक बिल्कुल नई, अति-यथार्थवादी (hyper-realistic) छवि बनाता है जिसमें वह बैकफ्लिप कर रहा है और उसे छत पर लगे सुरक्षा कैमरे के दृष्टिकोण से देखा जा रहा है।

3. "मिक्स-एंड-मैच" रणनीति

पेपर का असली मंत्र विविधता (diversity) है।

  • पुराना तरीका: वे पहले से मौजूद पोज़ की नकल करने की कोशिश करते थे (जैसे किसी छात्र के होमवर्क की नकल करना)।
  • Pose-dIVE का तरीका: वे एक बाहरी लाइब्रेरी (जैसे डांस वीडियो) में जाते हैं ताकि अजीब और दुर्लभ पोज़ खोज सकें जो मूल डेटासेट में कभी नहीं देखे गए। वे इन दुर्लभ पgetों को मूल लोगों के साथ मिला देते हैं।
  • परिणाम: सुरक्षा गार्ड अब परिदृश्यों की एक विशाल लाइब्रेरी पर प्रशिक्षित है: बॉब चल रहा है, बॉब नाच रहा है, बॉब बैठा है, बॉब को ऊपर से देखा जा रहा है, बॉब को नीचे से देखा जा रहा है।

यह क्यों महत्वपूर्ण है (द "सुपर गार्ड")

जब आप अपने सुरक्षा गार्ड को Pose-dIVE के साथ प्रशिक्षित करते हैं:

  1. वे अनुमान लगाना बंद कर देते हैं: वे सीखते हैं कि "बॉब" बॉब ही है, चाहे वह खड़ा हो, दौड़ रहा हो, या किसी अजीब एंगल से देखा जा रहा हो।
  2. वे अज्ञात स्थितियों को संभालते हैं: यदि कोई अपराधी मॉल में कार्टव्हील (cartwheel) करते हुए दौड़ता है, तो गार्ड उसे तुरंत पहचान लेगा क्योंकि उसने प्रशिक्षण के दौरान एक समान "कार्टव्हील बॉब" को देखा है।
  3. बेहतर गोपनीयता: आपको हजारों लोगों को कैमरों के सामने हर संभव पोज़ करने के लिए काम पर रखने की आवश्यकता नहीं है। AI इन परिदृश्यों को सुरक्षित रूप से उत्पन्न करता है।

निष्कर्ष (Bottom Line)

Pose-dIVE एक ऐसे छात्र को देने जैसा है जिसके पास केवल बिल्लियों की तस्वीरें वाला टेक्स्टबुक है, और फिर एक जादु적인 छड़ी का उपयोग करके बिल्लियों की टोपी पहने हुए, उड़ती हुई और पानी के नीचे तैरती हुई तस्वीरें बनाना। जब वह छात्र अंततः जंगल में टोपी पहने हुए एक असली बिल्ली को देखता है, तो वह भ्रमित नहीं होता—वह उसे तुरंत पहचान लेता है।

इन AI-जनरेटेड, पोज़-समृद्ध छवियों के साथ "प्रशिक्षण आहार" को विविध बनाकर, यह पेपर दिखाता है कि Re-ID मॉडल बहुत अधिक स्मार्ट, मजबूत और वास्तविक, अनिश्चित दुनिया के लिए तैयार हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →