← नवीनतम पेपर
💻 computer science

PSHuman: Photorealistic Single-image 3D Human Reconstruction using Cross-Scale Multiview Diffusion and Explicit Remeshing

PSHuman एक नवीन फ्रेमवर्क है जो विस्तृत, पहचान-संरक्षित दृश्य संश्लेषण के लिए क्रॉस-स्केल मल्टीव्यू डिफ्यूजन को शारीरिक निरंतरता और उच्च-सटीक ज्यामिति सुनिश्चित करने के लिए SMPL-X-कंडीशन्ड एक्सप्लिसिट रिमेशिंग के साथ जोड़कर, एकल RGB इमेज से फोटो-यथार्थवादी 3D मानव पुनर्निर्माण प्राप्त करता है।

मूल लेखक: Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peng Li, Wangguandong Zheng, Yuan Liu, Tao Yu, Yangguang Li, Xingqun Qi, Xiaowei Chi, Siyu Xia, Yan-Pei Cao, Wei Xue, Wenhan Luo, Yike Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक पार्क में खड़े व्यक्ति की एक अकेली तस्वीर है। आप उस एक सपाट 2D चित्र को एक वास्तविक, 3D वीडियो गेम चरित्र में बदलना चाहते हैं जिसे आप चारों ओर घूमकर देख सकें, ज़ूम कर सकें और हर कोण से देख सकें। यह वह चुनौती है जिसे PSHuman हल करता है।

यहाँ यह पेपर उनके समाधान को सरल अवधारणाओं और उपमाओं में तोड़कर समझाता है:

समस्या: "मैजिक मिरर" ग्लिच (जादुई दर्पण की खराबी)

मौजूदा तरीके सामने की फोटो के आधार पर यह अनुमान लगाने की कोशिश करते हैं कि व्यक्ति का पिछला हिस्सा कैसा दिखता होगा। लेकिन वे अक्सर विफल हो जाते हैं।

  • चेहरे की समस्या: यदि आप एक छोटी सी फोटो से पूरे शरीर का अनुमान लगाने की कोशिश करते हैं, तो चेहरा अक्सर विकृत हो जाता है या किसी दूसरे व्यक्ति जैसा दिखने लगता है। यह बिल्कुल वैसा ही है जैसे केवल पेंट के एक छोटे, धुंधले धब्बे का उपयोग करके एक विस्तृत चित्र बनाने की कोशिश करना।
  • पोज़ (मुद्रा) की समस्या: यदि फोटो में व्यक्ति झुक रहा है या उसने हाथ बांध रखे हैं, तो कंप्यूटर भ्रमित हो जाता है। वह "भ्रम" (hallucinate) पाल सकता है कि उसकी बांह हवा में तैर रही है या उसके पैर असंभव तरीके से मुड़े हुए हैं क्योंकि वह मानव शरीर रचना (anatomy) को नहीं समझता।

समाधान: PSHuman की तीन-चरणीय रेसिपी

लेखकों ने PSHuman नामक एक सिस्टम बनाया है जो एक विशेष सेट के औजारों के साथ एक मास्टर मूर्तिकार की तरह काम करता है।

1. "ज़ूम-इन" कैमरा (क्रॉस-स्केल डिफ्यूजन)

अधिकांश AI मॉडल पूरे शरीर और चेहरे को एक साथ बनाने की कोशिश करते हैं, जिससे चेहरे धुंधले हो जाते हैं।

  • उपमा: कल्पना कीजिए कि एक फोटोग्राफर भीड़ की तस्वीर ले रहा है। यदि वह एक ही बार में पूरे स्टेडियम और उस व्यक्ति की विशिष्ट मुस्कान को कैप्चर करने की कोशिश करता है, तो चेहरा छोटा और पिक्सेलेटेड (धुंधला) हो जाएगा।
  • समाधान: PSHuser एक "क्रॉस-स्केल" दृष्टिकोण का उपयोग करता है। यह एक साथ दो तस्वीरें लेता है: एक पूरे शरीर का वाइड शॉट और दूसरा केवल चेहरे का एक क्लोज-अप "ज़ूम" शॉट। फिर यह इन दोनों को आपस में मिला देता है। इससे यह सुनिश्चित होता है कि चेहरा स्पष्ट रहे और मूल फोटो में दिख रहे व्यक्ति जैसा ही दिखे, जबकि शरीर भी आनुपातिक बना रहे।

2. "कंकाल गाइड" (SMPL-X कंडीशन)

AI मॉडल अनुमान लगाने में अच्छे होते हैं, लेकिन भौतिकी (physics) और शरीर रचना को समझने में खराब होते हैं।

  • उपमा: कल्पना कीजिए कि आप जोड़ों (joints) की जानकारी के बिना एक मानव आकृति बनाने की कोशिश कर रहे हैं। आप एक ऐसा हाथ बना सकते हैं जो पीछे की ओर मुड़ा हो या एक ऐसा पैर जो दूसरे से दोगुना लंबा हो।
  • समाधान: नई दृश्य छवियां (views) उत्पन्न करने से पहले, PSHuman एक डिजिटल कंकाल (जिसे SMPL-X कहा जाता है) का अनुमान लगाता है जो फोटो में मौजूद व्यक्ति पर फिट बैठता है। यह AI को इस कंकाल का उपयोग एक गाइड के रूप में करने के लिए मजबूर करता है। भले ही व्यक्ति किसी अजीब मुद्रा में हो, AI जानता है कि, "ठीक है, हाथ कंधे से जुड़ा होना चाहिए और इसी तरह मुड़ना चाहिए।" यह AI को असंभव, मुड़े हुए शरीर बनाने से रोकता है।

3. "डिजिटल नक्काशी" (एक्सप्लिसिट रिमेशिंग)

एक बार जब AI ने व्यक्ति के छह अलग-अलग दृश्य (सामने, पीछे, बाएं, दाएं, आदि) सटीक रंगों और छायाओं के साथ बना लिए होते हैं, तो इसे एक 3D ऑब्जेक्ट में बदलने की आवश्यकता होती है।

  • उपमा: कल्पना कीजिए कि आपके पास मिट्टी का एक ब्लॉक (डिजिटल कंकाल) है। आपके पास छह तस्वीरें हैं कि अलग-अलग कोणों से तैयार मूर्ति कैसी दिखनी चाहिए। केवल मिट्टी पर पेंट करने के बजाय, आप एक विशेष उपकरण का उपयोग करके मिट्टी को "तराशते" (carve) हैं, उन हिस्सों को काट देते हैं जिनकी आवश्यकता नहीं है और कपड़ों की सिलवटें जोड़ देते हैं।
  • समाधान: सिस्टम उत्पन्न छवियों को लेता है और 3D मेश को "तराशता" है। यह केवल सतह का अनुमान नहीं लगाता; यह उत्पन्न तस्वीरों में दिखने वाली सिलवटों, फोल्ड्स और विवरणों से मेल खाने के लिए डिजिटल मिट्टी को शारीरिक रूप से नया आकार देता है।

परिणाम

पेपर का दावा है कि यह प्रक्रिया अविश्वसनीय रूप से तेज़ है (लगभग एक मिनट लेती है) और ऐसे परिणाम देती है जो हैं:

  • ज्यामितीय रूप से सटीक (Geometrically Accurate): शरीर का आकार और कपड़ों की सिलवटें वास्तविक लगती हैं, न कि किसी चिकने, प्लास्टिक के पुतले जैसी।
  • पहचान सुरक्षित (Identity Preserved): चेहरा मूल व्यक्ति जैसा दिखता है, न कि कोई विकृत संस्करण।
  • सुसंगत (Consistent): यदि आप 3D मॉडल के चारों ओर घूमते हैं, तो सिर का पिछला हिस्सा और कपड़ों का पिछला हिस्सा प्राकृतिक दिखता है और सामने के हिस्से से मेल खाता है।

जहाँ यह विफल होता है (पेपर की ईमानदार सीमाएं)

लेखक स्वीकार करते हैं कि सिस्टम अभी भी पूर्ण नहीं है। यह बहुत अधिक इस बात पर निर्भर करता है कि शुरुआती कंकाल सही प्राप्त हुआ है या नहीं। यदि कंप्यूटर शुरुआत में मुद्रा (pose) का गलत अनुमान लगा लेता है, तो अंतिम 3D मॉडल भी गलत होगा। इसके अलावा, यह बहुत जटिल विवरणों जैसे कि ढीले, उड़ते हुए बाल या हाथों के साथ संघर्ष करता है, जो अंतिम परिणाम में थोड़े अस्त-व्यस्त दिख सकते हैं।

संक्षेप में: PSHuman चेहरे के लिए "ज़ूम-इन" ट्रिक, शरीर के लिए "कंकाल गाइड" और अंतिम मॉडल बनाने के लिए "डिजिटल नक्काशी" टूल का उपयोग करके एक एकल फोटो को 3D चरित्र में बदलने का एक नया तरीका है, और यह सब एक मिनट से भी कम समय में होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →