A Survey on Generative Modeling with Limited Data, Few Shots, and Zero Shot
यह सर्वेक्षण डेटा बाधाओं (सीमित-डेटा, फ्यू-शॉट और ज़ीरो-शॉट) के तहत जनरेटिव मॉडलिंग पर एक व्यापक समीक्षा और एकीकृत परिप्रेक्ष्य प्रदान करता है, जो कार्यों और विधियों को वर्गीकृत करने के लिए नवीन वर्गीकरण पेश करता है और ओवरफिटिंग जैसी चुनौतियों से निपटने के लिए एक व्यावहारिक रोडमैप प्रदान करने तथा भविष्य के अनुसंधान दिशाओं को निर्देशित करने के लिए 230 से अधिक शोध पत्रों का विश्लेषण करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
AI की "कौलिनरी स्कूल" (पाक कला विद्यालय): लगभग बिना सामग्री के कला बनाने के लिए एक मार्गदर्शिका
कल्पना कीजिए कि आप एक विश्व प्रसिद्ध शेफ हैं। आपके पास एक विशाल रसोई (एक सुपरकंप्यूटर) है और लाखों व्यंजनों की एक लाइब्रेरी (एक विशाल डेटासेट) है। आप अपनी आँखें बंद करके भी एक परफेक्ट स्टेक या एक जटिल सूफ़ले बना सकते हैं। आज के अधिकांश आधुनिक AI इमेज जनरेटर इसी तरह काम करते हैं: उन्हें लाखों तस्वीरों पर प्रशिक्षित किया जाता है ताकि वे जान सकें कि एक "बिल्ली", एक "सूर्यास्त" या एक "चेहरा" कैसा दिखता है।
लेकिन क्या होगा यदि आपको केवल तीन सामग्रियों के साथ एक छोटे, खाली किचन में छोड़ दिया जाए? या शायद आपके पास शून्य सामग्रियां हों और केवल उस चीज़ का विवरण हो जिसे आप पकाना चाहते हैं?
यही वह समस्या है जिसे यह पेपर हल करता है। यह एक व्यापक सर्वेक्षण (एक "मानचित्र") है कि AI को नई, यथार्थवादी छवियां बनाना कैसे सिखाया जाए जब उसके पास सीखने के लिए पर्याप्त डेटा न हो। लेखक इसे डेटा कंस्ट्रेंट के तहत जेनेरेटिव मॉडलिंग (Generative Modeling under Data Constraint - GM-DC) कहते हैं।
यहाँ उनके निष्कर्षों का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) के साथ समझाया गया है।
1. "भूख" के तीन स्तर
यह पेपर समस्या को कठिनाई के तीन स्तरों में वर्गीकृत करता है, जैसे कि कुकिंग चैलेंज के अलग-अलग स्तर:
- सीमित डेटा (एक "छोटा पेंट्री"): आपके पास 50 से 5,000 तस्वीरें हैं। यह बहुत अधिक नहीं है, लेकिन आपके पास कुछ तो है।
- उपमा: आपके पास कुछ सेब और कुछ आटा है। आप अभी भी एक पाई बना सकते हैं, लेकिन आपको बहुत सावधान रहना होगा कि वह जले नहीं।
- फ्यू-शॉट (एक "टेस्ट टेस्ट"): आपके पास केवल 1 से 50 तस्वीरें हैं।
- उपमा: आपको एक विशिष्ट कुत्ते की केवल एक फोटो दी जाती है और फिर आपसे उसी कुत्ते की अलग-अलग मुद्राओं में 100 अलग तस्वीरें बनाने के लिए कहा जाता है। आपको सिर्फ एक नज़र में उस कुत्ते के चेहरे को पूरी तरह से याद करना होगा।
- ज़ीरो-शॉट (एक "आंखों पर पट्टी बंधा शेफ"): आपके पास शून्य तस्वीरें हैं। आपके पास केवल एक टेक्स्ट विवरण है।
- उपमा: कोई आपसे कहता है, "चाँद पर टक्सीडो पहने हुए एक बिल्ली की तस्वीर बनाओ," लेकिन आपने कभी बिल्ली, टक्सीडो या चाँद को देखा ही नहीं है। आपको पूरी तरह से अपनी कल्पना और सामान्य ज्ञान पर निर्भर रहना होगा।
2. बड़ी समस्या: "रटना" बनाम "सीखना"
जब आप एक शक्तिशाली AI को केवल कुछ तस्वीरें देते हैं, तो वह भ्रमित हो जाता है। बिल्ली की अवधारणा (concept) सीखने के बजाय, वह केवल उस विशिष्ट बिल्ली को रट (memorize) लेता है।
- परिणाम: यदि आप उससे एक नई बिल्ली बनाने के लिए कहते हैं, तो वह बस वही सटीक फोटो या उसका थोड़ा धुंधला संस्करण थमा देता है। उसने बिल्ली होने के "नियमों" को नहीं सीखा है; वह बस एक फोटोकॉपी मशीन बन गया है।
- पेपर का लक्ष्य: हम AI को एक फोटोकॉपी करने वाली मशीन बनने से कैसे रोक सकते हैं और उसे एक सच्चा कलाकार कैसे बना सकते हैं, भले ही उसके पास सीमित सामग्रियां हों?
3. टूलकिट: हम इसे कैसे हल करते हैं?
लेखकों ने सैकड़ों शोध पत्रों को रणनीतियों के एक "टूलबॉक्स" में व्यवस्थित किया है। यहाँ मुख्य रणनीतियाँ दी गई हैं, जिन्हें सरल रूप में समझाया गया है:
अ. ट्रांसफर लर्निंग (एक "मास्टर शेफ का मेंटरशिप")
AI को शुरुआत से सिखाने के बजाय, हम एक ऐसे मॉडल को लेते हैं जो पहले से ही विशेषज्ञ है (लाखों तस्वीरों पर प्रशिक्षित), और उसे आपके विशिष्ट विषय पर एक छोटा "रिफ्रेशर कोर्स" देते हैं।
- उपमा: कल्पना कीजिए कि एक मास्टर शेफ है जो सब कुछ बनाना जानता है। आप उनसे केवल 5 सामग्रियों का उपयोग करके एक विशिष्ट स्थानीय व्यंजन बनाना सीखने के लिए कहते हैं। आप उन्हें चाकू पकड़ना नहीं सिखाते; आप बस उन्हें 5 सामग्रियां दिखाते हैं और उन्हें अपने मौजूदा कौशल को अनुकूलित करने देते हैं।
- सावधानी: कभी-कभी मास्टर शेफ अपनी पुरानी रसोई की तकनीकें इस्तेमाल करने की कोशिश करते हैं जो नई सामग्रियों के अनुकूल नहीं होतीं (जैसे, टोफू से स्टेक बनाने की कोशिश करना)। पेपर इस बारे में चर्चा करता है कि AI को पुरानी जानकारी को नए समस्याओं पर "थोपने" से कैसे रोका जाए।
ब. डेटा ऑग्मेंटेशन (एक "जादुई दर्पण")
चूंकि आपके पास पर्याप्त तस्वीरें नहीं हैं, इसलिए आप जो तस्वीरें आपके पास हैं, उनके नकली संस्करण बनाते हैं। आप उन्हें पलटते हैं, घुमाते हैं, रंग बदलते हैं, या उन्हें काटते हैं।
- उपमा: आपके पास एक सेब है। इसे सौ सेबों जैसा दिखाने के लिए, आप सेब की एक फोटो लेते हैं, उसे 90 डिग्री घुमाते हैं, उसे लाल करते हैं, फिर हरा करते हैं, फिर उसे आधा काटते हैं। आप AI से कहते हैं, "देखो, यहाँ 100 अलग-अलग सेब हैं!"
- जोखिम: यदि आप ऐसा बहुत अधिक करते हैं, तो AI यह सोच सकता है कि "घूमे हुए सेब" एक नई प्रजाति हैं और केवल घूमे हुए सेब ही बनाने लगेगा।
स. नेचुरल लैंग्वेज गाइडेंस (एक "वर्णनात्मक आलोचक")
यह नवीनतम और सबसे चर्चित ट्रेंड है। हम छवि निर्माण को निर्देशित करने के लिए टेक्स्ट को समझने की AI की क्षमता का उपयोग करते हैं।
- उपमा: आप AI को "दुखी जोकर" की फोटो नहीं दिखाते। इसके बजाय, आप एक बहुत बुद्धिमान सहायक (जैसे CLIP, एक लैंग्वेज मॉडल) को बताते हैं, "इसे दुखी जोकर जैसा दिखाएं।" सहायक AI के चित्र की जांच करता है और कहता है, "नहीं, यह बहुत खुश लग रहा है। आँखों को और झुकाओ।" AI टेक्स्ट के आधार पर समायोजन करता है, न कि तस्वीरों के आधार पर।
द. फ्रीक्वेंसी कंपोनेंट्स (एक "हाई-डेफिनिशन फिल्टर")
AI अक्सर बारीक विवरणों (जैसे फर की बनावट या त्वचा की झुर्रियों) के साथ संघर्ष करता है क्योंकि वह "बड़ी तस्वीर" (लो फ्रीक्वेंसी) पर ध्यान केंद्रित करता है और "बारीक विवरणों" (हाई फ्रीक्वेंसी) को अनदेखा कर देता है।
- उपमा: कल्पना कीजिए कि आप दूर से एक पेंटिंग देख रहे हैं। आप रंग और आकार देखते हैं। लेकिन यदि आप करीब जाते हैं, तो आप ब्रश के स्ट्रोक देखते हैं। इनमें से कुछ तरीके AI को "ब्रशस्ट्रोक" (हाई-फ्रीक्वेंसी विवरण) देखने के लिए मजबूर करते हैं ताकि छवि धुंधली न लगे।
4. "सैंकी डायग्राम" (Sankey Diagram): भविष्य का मानचित्र
पेपर में एक विशाल, रंगीन फ्लो चार्ट शामिल है। इसे AI शोधकर्ताओं के लिए एक सबवे मैप की तरह समझें।
- यह दिखाता है कि कौन से "स्टेशन" (कार्य) लोकप्रिय हैं।
- यह दिखाता है कि कौन सी "ट्रेनें" (तरीके) लोगों को वहां ले जा रही हैं।
- आश्चर्य: अभी, लगभग सभी लोग "ट्रांसफर लर्निंग" वाली ट्रेन ले रहे हैं। लेकिन मानचित्र दिखाता है कि कुछ स्टेशन (जैसे "ज़ीरो-शॉट" या "सब्जेक्ट-ड्रिवन" जनरेशन) अभी बनना शुरू ही हुए हैं।
5. यह क्यों मायने रखता है?
आप पूछ सकते हैं, "इसकी क्या ज़रूरत है? क्या हम बस और अधिक डेटा का इंतज़ार नहीं कर सकते?"
इसका उत्तर है नहीं, क्योंकि कई वास्तविक दुनिया के क्षेत्रों में, आप अधिक डेटा प्राप्त नहीं कर सकते:
- चिकित्सा (Medicine): आप किसी दुर्लभ बीमारी की 10 लाख तस्वीरें नहीं ले सकते क्योंकि दुनिया में केवल 50 लोगों को यह बीमारी है।
- सैटेलाइट इमेजिंग: आपको किसी पुल पर होने वाले विशिष्ट प्रकार के नुकसान का पता लगाने की आवश्यकता हो सकती है, लेकिन आपके पास उस नुकसान की केवल 10 तस्वीरें हैं।
- कला (Art): एक कलाकार अपनी विशिष्ट शैली में चित्र बनाना चाह सकता है, लेकिन उसके पास केवल कुछ स्केच हैं।
6. भविष्य: आगे क्या है?
लेखक तीन बड़ी चीजें बताते हैं जिन पर हमें काम करने की आवश्यकता है:
- बेहतर "मेंटर": हमें पुराने मॉडलों के बजाय नवीनतम, सबसे बड़े AI मॉडल्स (फाउंडेशन मॉडल्स) को अपने शुरुआती बिंदु के रूप में उपयोग करने की आवश्यकता है।
- रिमोट अडैप्टेशन (Remote Adaptation): हमें AI को उन चीजों से सीखने के लिए प्रशिक्षित करने की आवश्यकता है जो उससे बहुत अलग हैं (जैसे, एक चेहरा बनाने वाले AI को फूल बनाना सिखाना)। वर्तमान में, यह इसमें बुरी तरह विफल होता है।
- बेहतर परीक्षण: हमें कैसे पता चलेगा कि AI ने अच्छा काम किया है यदि हमारे पास तुलना करने के लिए केवल 5 तस्वीरें हैं? हमें इन "छोटे डेटा" वाली रचनाओं की गुणवत्ता को आंकने के लिए नए तरीकों की आवश्यकता है।
सारांश
यह पेपर AI के "कौलिनरी स्कूल" के लिए एक विशाल मार्गदर्शिका है। यह हमें बताता है कि जबकि पूरी सामग्री के साथ खाना बनाना आसान है, एक अकेली सामग्री के साथ खाना बनाना कठिन है। लेकिन स्मार्ट ट्रिक्स का उपयोग करके—जैसे मास्टर शेफ के कौशल को उधार लेना, टेक्स्ट विवरणों को गाइड के रूप में उपयोग करना, और अपनी सामग्रियों को सावधानी से चुनना—हम AI को डेटा की कमी होने पर भी सुंदर, विविध कला बनाने के लिए प्रशिक्षित कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।