← नवीनतम पेपर
💻 computer science

High Quality Image Generation using Improved Generative Adversarial Networks and Optimized Stable Diffusion Models

यह शोध पत्र प्रशिक्षण अस्थिरता और मोड कोलैप्स को संबोधित करने के लिए जेनरेटिव एडवरसैरियल नेटवर्क (GANs) और अनुकूलित स्टेबल डिफ्यूजन मॉडलों को संयोजित करने वाला एक हाइब्रिड आर्किटेक्चर प्रस्तावित करता है, जो फोरेंसिक पुनर्निर्माण से लेकर डेटा ऑग्मेंटेशन तक के अनुप्रयोगों के लिए स्टैंडअलोन GANs की तुलना में बेहतर यथार्थवाद के साथ उच्च-गुणवत्ता वाली छवि पीढ़ी प्राप्त करता है।

मूल लेखक: Satishkumar Varma, Kunal Wagh, Omkar Raul, Sejal Chandgadkar, Shreya Belanekar, Kanchan Dabre

प्रकाशित 2026-09-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Satishkumar Varma, Kunal Wagh, Omkar Raul, Sejal Chandgadkar, Shreya Belanekar, Kanchan Dabre

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल युग में, कंप्यूटरों ने देखना और रचना करना सीख लिया है, जो साधारण गणना से कहीं आगे बढ़कर कलात्मक संश्लेषण के क्षेत्र में पहुँच गए हैं। इस क्षमता के केंद्र में वे प्रणालियाँ हैं जिन्हें शून्य से चित्र बनाने के लिए डिज़ाइन किया गया है, जो उस तरह की नकल करती हैं जैसे कोई मनुष्य उस दृश्य को चित्रित या फोटोग्राफ करता है जिसे उसने वास्तव में कभी नहीं देखा हो। वर्षों तक, इस कार्य के लिए अग्रणी विधि एक अवधारणा पर निर्भर थी जिसे 'जेनरेटिव एडवरसेरियल नेटवर्क' (Generative Adversarial Network) के रूप में जाना जाता है। कल्पना कीजिए कि एक ही स्टूडियो में दो कलाकार काम कर रहे हैं: एक एक विश्वसनीय जालसाजी बनाने की कोशिश करता है, जबकि दूसरा एक सख्त आलोचक के रूप में कार्य करता है, जो नकली को पहचानने की कोशिश करता है। वे एक निरंतर खेल खेलते हैं जहाँ जालसाज अपनी चालों को छिपाने में बेहतर होता जाता है, और आलोचक उन्हें खोजने में अधिक तेज होता जाता है। समय के साथ, यह प्रतिस्पर्धा जालसाज को इतने वास्तविक चित्र बनाने के लिए मजबूर करती है कि विशेषज्ञ आलोचक भी उन्हें असली से अलग नहीं कर पाता। हालाँकि, इस प्रक्रिया को प्रबंधित करना बेहद कठिन है; कलाकार अक्सर एक ही ढर्रे में फंस जाते हैं, बार-बार वही कुछ चित्र बनाते रहते हैं, या खेल उपयोगी कुछ भी बनाने से पहले ही विफल हो जाता है।

हाल ही में, एक अलग दृष्टिकोण उभरा है, जो प्रतिस्पर्धी खेल पर निर्भर नहीं है बल्कि क्रमिक परिष्करण (gradual refinement) की प्रक्रिया पर आधारित है। इसे एक ऐसे कैनवास के रूप में सोचें जो स्टैटिक (static) से ढका हुआ है, जैसे पुराने टेलीविजन स्क्रीन पर दिखने वाला शोर, और धीरे-धीरे शोर को साफ करके नीचे एक स्पष्ट चित्र प्रकट किया जाता है। यह विधि, जिसे 'डिफ्यूजन मॉडल' (diffusion model) कहा जाता है, उच्च गुणवत्ता वाले चित्र बनाने की उल्लेखनीय क्षमता प्रदर्शित करती है जो स्थिर और विविध होते हैं। इस तकनीक का एक विशिष्ट संस्करण, जिसे 'स्टेबल डिफ्यूजन' (Stable Diffusion) कहा जाता है, ने लिखित विवरणों को दृश्य दृश्यों में बदलने की अपनी शक्ति के लिए ध्यान आकर्षित किया है। शोधकर्ता लंबे समय से आश्चर्य करते आए हैं कि ये दो अलग-अलग विधियाँ—प्रतिस्पर्धी खेल और क्रमिक परिष्करण—जब अपनी सीमाओं तक पहुँचती हैं, तो आपस में कैसे तुलना करती हैं, और क्या उनकी शक्तियों को जोड़ना उन निरंतर समस्याओं को हल कर सकता है जिन्होंने वर्षों से इमेज जनरेशन को रोक रखा है।

मुंबई, भारत के कॉलेजों के शोधकर्ताओं की एक टीम ने दोनों प्रणालियों को अगल-बगल बनाकर और परीक्षण करके इस प्रश्न का पता लगाने के लिए हाथ बढ़ाया। उनका कार्य एक विशिष्ट चुनौती पर केंद्रित था: जब उपलब्ध डेटा सीमित हो, तो उच्च गुणवत्ता वाले चित्र बनाना, जो अक्सर फोरेंसिक या मेडिकल इमेजिंग जैसे क्षेत्रों में होता है जहाँ वास्तविक उदाहरण दुर्लभ होते हैं। उन्होंने अपने सिस्टम को तीन अलग-अलग चित्रों के संग्रह पर प्रशिक्षित किया: मानव चेहरों के 3,000 उच्च-गुणवत्ता वाले पोर्ट्रेट का एक सेट, इंटरनेट से ली गई 6,000 सामान्य छवियों का एक बड़ा संग्रह, और 100 मशहूर हस्तियों की तस्वीरों का एक छोटा समूह। लक्ष्य यह देखना था कि कौन सी प्रणाली सबसे जीवंत परिणाम दे सकती है और क्या वे केवल कुछ उदाहरणों के आधार पर किसी विशिष्ट व्यक्ति, जैसे कि एक अभिनेता, की नई छवियां बना सकते हैं।

उनके प्रयोगों के परिणामों ने दोनों तकनीकों के बीच एक स्पष्ट अंतर प्रकट किया। पारंपरिक प्रतिस्पर्धी प्रणाली, जेनरेटिव एडवरसेरियल नेटवर्क, प्रशिक्षण के बाद पहचानने योग्य चेहरे सीखने और बनाने में सक्षम थी, लेकिन उसे निरंतरता बनाए रखने में संघर्ष करना पड़ा। जब शोधकर्ताओं ने इंटरनेट छवियों के बड़े संग्रह पर इसका परीक्षण किया, तो सिस्टम वास्तविक छवियों बनाम अपनी रचनाओं को लगभग 91 प्रतिशत बार सही ढंग से पहचान सका, और पोर्ट्रेट संग्रह पर, इसने 81 प्रतिशत सटीकता प्राप्त की। हालाँकि ये संख्याएँ दर्शाती हैं कि सिस्टम सीख रहा था, लेकिन इसके द्वारा बनाए गए चित्रों में अक्सर सूक्ष्म विवरणों और वास्तविक जीवन में पाई जाने वाली प्राकृतिक विविधता की कमी थी। शोधकर्ताओं ने देखा कि सिस्टम कभी-कभी डेटा की पूरी संभावनाओं को पकड़ने में विफल रहता था, जिससे चित्र थोड़े दोहराव वाले या कम स्पष्ट महसूस होते थे।

इसके विपरीत, क्रमिक परिष्करण प्रक्रिया पर आधारित प्रणाली, स्टेबल डिफ्यूजन मॉडल ने, वास्तविक और विविध चित्र बनाने की श्रेष्ठ क्षमता प्रदर्शित की। जब शोधकर्ताओं ने इस मॉडल को विशिष्ट विषयों को समझने के लिए फाइन-ट्यून किया, तो सुधार आश्चर्यजनक था। उदाहरण के लिए, जब उन्होंने मॉडल को अभिनेता ब्रैड पिट की छवियों पर प्रशिक्षित किया, तो इसने केवल देखी गई तस्वीरों की नकल नहीं की; फाइन-ट्यून किए गए मॉडल ने अभिनेता के शुरुआती स्वरूप का प्रभावी ढंग से अनुमान लगाया, भले ही प्रशिक्षण डेटा में बचपन की कोई फोटो शामिल नहीं थी। विषय के जीवन के विभिन्न चरणों के बारे में कल्पना करने की यह क्षमता बताती है कि मॉडल उसके बचपन के एक विश्वसनीय चित्र को उत्पन्न कर सकता है। शोधकर्ताओं ने इस सफलता को एक स्कोरिंग प्रणाली का उपयोग करके मापा जो यह जाँचती है कि चित्र दिए गए विवरण से कितनी अच्छी तरह मेल खाता है; अनुकूलित मॉडल ने इंटरनेट इमेज डेटासेट पर 31.98 का स्कोर प्राप्त किया, जो उच्च स्तर की दृश्य सुसंगतता और विवरण का संकेत देता है।

अध्ययन ने यह भी पता लगाया कि रेडियो के ट्यूनिंग नॉब को स्पष्ट सिग्नल खोजने के लिए घुमाने की तरह, उनके आंतरिक सेटिंग्स को समायोजित करके इन प्रणालियों को बेहतर कैसे बनाया जाए। उन्होंने पाया कि एक बार में कंप्यूटर द्वारा संसाधित छवियों के समूह का आकार आउटपुट की गुणवत्ता को महत्वपूर्ण रूप से प्रभावित करता है। विभिन्न समूह आकारों का परीक्षण करके, उन्होंने पाया कि एक समय में पांच छवियों को संसाधित करने से उनके विशिष्ट सेटअप के लिए सर्वोत्तम परिणाम मिले। इसके अलावा, उन्होंने परिष्करण तकनीक के विभिन्न संस्करणों की तुलना की और पाया कि पोर्ट्रेट बनाने के लिए सबसे अच्छा मॉडल वह नहीं था जो सामान्य दृश्यों के लिए सबसे अच्छा काम करता था। यह इस बात को रेखांकित करता है कि हर काम के लिए कोई एक आदर्श उपकरण नहीं होता है; सिस्टम का चुनाव बनाए जा रहे चित्रों के विशिष्ट प्रकार के आधार पर तय किया जाना चाहिए।

अंततः, शोधकर्ताओं ने निष्कर्ष निकाला कि जबकि प्रतिस्पर्धी पद्धति का अपना स्थान है, क्रमिक परिष्करण दृष्टिकोण उच्च-गुणवत्ता वाली छवियां उत्पन्न करने के लिए अधिक विश्वसनीय मार्ग प्रदान करता है, विशेष रूप से जब लक्ष्य कम डेटा से किसी विषय के वास्तविक रूपांतरण बनाना हो। परिष्कृत मॉडलों ने कम त्रुटियों वाले चित्र बनाए, जैसे कि धुंधले किनारे या अजीब विकृतियाँ, और प्रकाश एवं रंग में एक ऐसी निरंतरता बनाए रखी जिसे दूसरा सिस्टम मैच करने में संघर्ष करता था। यह कार्य सुझाव देता है कि उच्च निष्ठा (fidelity) वाले अनुप्रयोगों के लिए, जैसे कि कानूनी मामलों के लिए दृश्य साक्ष्य बनाना, मेडिकल स्कैन को बेहतर बनाना या कला उत्पन्न करना, नई परिष्करण-आधारित तकनीक अधिक शक्तिशाली उपकरण है। शोधकर्ताओं ने उल्लेख किया कि उनके निष्कर्ष कृषि से लेकर फोरेंसिक विज्ञान तक विविध क्षेत्रों में मदद कर सकते हैं, जिससे वहां वास्तविक दृश्य डेटा उत्पन्न करने का मार्ग प्रशस्त होगा जहां पहले कुछ नहीं था। यह अध्ययन एक व्यावहारिक प्रदर्शन है कि आधुनिक प्रणालियों को अनुकूलित करके, हम ऐसी मशीनों के करीब पहुँच सकते हैं जो न केवल चित्र, बल्कि विश्वसनीय वास्तविकताएं बनाती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →