← नवीनतम पेपर
💻 computer science

PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes

PoseAdapter एक हल्का फ्रेमवर्क है जो सटीक स्थानिक-कोणीय एंकर्स (spatial-angular anchors) के साथ एक डुअल-स्ट्रीम 2.5D प्रतिनिधित्व और वैश्विक सुसंगतता को बनाए रखते हुए एट्रीब्यूट लीकेज को समाप्त करने के लिए एक संदर्भ-जागरूक तंत्र का उपयोग करके जटिल बहु-वस्तु दृश्यों के लिए उच्च-निष्ठा, नियंत्रणीय छवि निर्माण प्राप्त करता है।

मूल लेखक: Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

प्रकाशित 2026-08-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufeng Chi, Huimin Ma, Fan Gao, Zhice Niu, Keqin Li, Jianmin Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वर्षों से, कंप्यूटर शब्दों से चित्र बनाना सीख रहे हैं। यदि आप किसी मशीन से "एक बिल्ली बनाओ" कहते हैं, तो वह एक बिल्ली की विश्वसनीय छवि बना सकती है। लेकिन कुछ अधिक विशिष्ट चीज़ माँगना, जैसे कि "एक लाल कुर्सी पर बैठी हुई, बाईं ओर देखती हुई एक बिल्ली, जिसके बगल में एक नीला कुत्ता हो," अक्सर कंप्यूटर को भ्रमित कर देता है। यह बिल्ली को कुर्सी पर तो रख सकता है लेकिन उसे गलत दिशा में मोड़ सकता है, या यह दोनों जानवरों के रंगों को मिला सकता है जिससे वे एक ही अजीब जीव की तरह दिखने लगते हैं। यह कठिनाई इसलिए उत्पन्न होती है क्योंकि वर्तमान इमेज-बनाने वाले उपकरण दृश्य के सामान्य मिजाज को पकड़ने में तो उत्कृष्ट हैं, लेकिन कई वस्तुओं की सटीक ज्यामिति (geometry) को समझने में संघर्ष करते हैं। उनमें यह समझने की क्षमता की कमी है कि प्रत्येक वस्तु वास्तव में कहाँ होनी चाहिए, उसका आकार कितना होना चाहिए, और वह त्रि-आयामी स्थान (three-dimensional space) में किस दिशा में उन्मुख होनी चाहिए।

शोधकर्ताओं ने इसे कंप्यूटर को जटिल 3D मानचित्र खिलाकर हल करने का प्रयास किया है, जो वास्तुकारों द्वारा घर बनाने के लिए उपयोग किए जाने वाले ब्लूप्रिंट के समान हैं। हालाँकि, ये मानचित्र भारी होते हैं, इन्हें बनाना कठिन होता है, और ये प्रक्रिया को धीमा कर देते हैं। अन्य लोगों ने केवल दृश्यों में वस्तुओं को काटने और चिपकाने (cut and paste) का प्रयास किया है, लेकिन इससे अक्सर ऐसे चित्र बनते हैं जो असंबंधित भागों के कोलाज की तरह दिखते हैं, जिनमें प्राकृतिक छाया या सुसंगत प्रकाश का अभाव होता है। चुनौती एक ऐसा तरीका खोजने की थी जिससे कंप्यूटर को चीजें कहाँ रखनी हैं इसके बारे में सख्त निर्देश दिए जा सकें, बिना उसे अत्यधिक डेटा संसाधित करने के लिए मजबूर किए या दृश्य की प्राकृतिक सामंजस्यता को खोए बिना।

शोधकर्ताओं के एक दल ने PoseAdapter नामक एक नया दृष्टिकोण पेश किया है, जिसे कंप्यूटर को स्थान और दिशा का बहुत सटीक बोध कराने के लिए डिज़ाइन किया गया है। भारी 3D ब्लूप्रिंट पर निर्भर रहने के बजाय, यह प्रणाली दृश्य की प्रत्येक वस्तु के लिए निर्देशों का एक हल्का सेट (lightweight set) उपयोग करती है: वस्तु क्या है इसका विवरण, स्क्रीन पर उसके स्थान को दर्शाने वाला एक सरल बॉक्स, और तीन संख्याएँ जो कंप्यूटर को ठीक से बताती हैं कि वस्तु किस ओर मुड़ी हुई है। इसे कंप्यूटर को एक जटिल 3D मॉडल देने के बजाय, निर्देशांक (coordinates) और कोणों की एक सूची देने के रूप में समझें। यह विधि कंप्यूटर को उच्च सटीकता के साथ चित्र बनाने की अनुमति देती है, यह सुनिश्चित करती है कि मोटरसाइकिल न केवल सही स्थान पर हो, बल्कि सही कोण पर झुकी हुई और सही दिशा में उन्मुख भी हो।

इस कार्य का मुख्य नवाचार यह है कि कंप्यूटर इन निर्देशों को कैसे संसाधित करता है। कई वस्तुओं वाले चित्र बनाते समय, कंप्यूटर के सामने एक कठिन विकल्प होता है: यदि वह प्रत्येक वस्तु को अलग रखने पर बहुत सख्ती से ध्यान केंद्रित करता है, तो दृश्य कठोर और अप्राकृतिक दिखता है, जैसे कि वस्तुओं को पृष्ठभूमि पर चिपका दिया गया हो। यदि वह उन्हें एक साथ मिलाने पर बहुत अधिक ध्यान केंद्रित करता है, तो वस्तुएं आपस में मिल जाती हैं, जिससे लाल कुर्सी नीली हो जाती है या कुत्ते के लक्षण बिल्ली के समान हो जाते हैं। इसे हल करने के लिए, शोधकर्ताओं ने एक दोहरी-पथ प्रणाली (dual-pathway system) बनाई। एक पथ एक सख्त गार्ड की तरह कार्य करता है, यह सुनिश्चित करता है कि प्रत्येक वस्तु अपनी सीमाओं के भीतर रहे और अपने अद्वितीय रंग और बनावट को बनाए रखे। दूसरा पथ एक कनेक्टर के रूप में कार्य करता है, जिससे वस्तुओं को एक-दूसरे को "देखने" की अनुमति मिलती है ताकि वे स्वाभाविक रूप से प्रकाश, छाया और परिप्रेक्ष्य (perspective) साझा कर सकें। इन दोनों पथों को एक साथ चलाकर, प्रणाली वस्तुओं को विशिष्ट बनाए रखने के साथ-साथ उन्हें एक ही दुनिया का हिस्सा महसूस कराने में सक्षम होती है।

इस प्रणाली को काम करना सिखाने के लिए, शोधकर्ताओं ने OrientLayout नामक चित्रों का एक विशाल नया संग्रह बनाया। इस डेटासेट में 1,10,000 से अधिक उदाहरण हैं जहाँ प्रत्येक वस्तु को उसके स्थान, आकार और अभिविन्यास (orientation) के साथ सावधानीपूर्वक लेबल किया गया है। टीम ने यह सुनिश्चित करने के लिए महत्वपूर्ण प्रयास किया कि दिशाएँ सटीक हों, यहाँ तक कि त्रुटियों को सुधारने के लिए हजारों छवियों की मैन्युअल रूप से जाँच भी की। उन्होंने इस डेटा का उपयोग मॉडल को एक सरल निर्देशों के सेट और अंतिम दृश्य परिणाम के बीच के संबंध को समझने के लिए प्रशिक्षित करने हेतु किया। प्रशिक्षण प्रक्रिया को दृश्य के समग्र लेआउट को प्राथमिकता देने के लिए डिज़ाइन किया गया था, यह सुनिश्चित करते हुए कि कंप्यूटर सूक्ष्म विवरणों की चिंता करने से पहले बड़ी तस्वीर को सही ढंग से समझ ले।

अन्य अग्रणी विधियों के विरुद्ध परीक्षण करने पर, PoseAdapter ने स्पष्ट लाभ दिखाया। एकल वस्तुओं वाले प्रयोगों में, यह वस्तुओं को अत्यधिक सटीकता के साथ रख सकता था, जो पिछले सिस्टम की तुलना में अनुरोधित स्थिति और कोण से कहीं बेहतर था। फर्नीचर से भरे कमरे या कई वाहनों वाली सड़क जैसे कई वस्तुओं वाले जटिल दृश्यों में, नई विधि ने उन गुणों के मिश्रण को सफलतापूर्वक रोका जो पुराने मॉडलों की समस्या थी। जहाँ अन्य सिस्टम सिल्वर लैपटॉप स्क्रीन के बजाय ग्रीन लैपटॉप स्क्रीन बना सकते थे, या ढलान पर कार को सही ढंग से रखने में विफल हो सकते थे, वहीं PoseAdapter ने प्रत्येक वस्तु की अखंडता को बनाए रखा और दृश्य को सुसंगत रखा। यह प्रणाली बहुत तेज़ भी सिद्ध हुई, क्योंकि इसे चित्र बनाने से पहले भारी 3D मानचित्रों को उत्पन्न या संसाधित करने की आवश्यकता नहीं थी।

परिणाम बताते हैं कि इमेज जनरेशन पर सटीक नियंत्रण के लिए भारी कम्प्यूटेशनल उपकरणों या जटिल 3D मॉडलिंग की आवश्यकता नहीं है। स्थानिक और कोणीय निर्देशों के एक सरल, कुशल सेट का उपयोग करके, और सख्त अलगाव तथा प्राकृतिक जुड़ाव के बीच संतुलन बनाकर, कंप्यूटर अब जटिल, बहु-वस्तु दृश्यों को बना सकते हैं जो सटीक और दृष्टिगत रूप से यथार्थवादी भी हैं। यह प्रगति इस क्षेत्र को एक ऐसे भविष्य के करीब ले जाती है जहाँ उपयोगकर्ता एक कहानी बताने की सहजता के साथ दृश्य की सटीक संरचना तय कर सकते हैं, और कंप्यूटर न केवल शब्दों को, बल्कि उस स्थान को भी समझता है जो वे घेरते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →