SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model
यह शोध पत्र SCHEMA को प्रस्तुत करता है, जो Google के Gemini 3 Pro Image मॉडल के लिए एक संरचित प्रॉम्प्ट इंजीनियरिंग पद्धति है, जो व्यापक अनुभवजन्य परीक्षण के आधार पर छह पेशेवर डोमेन में उच्च अनुपालन दर और उत्कृष्ट निरंतरता प्राप्त करने के लिए एक त्रि-स्तरीय प्रगतिशील प्रणाली और मॉड्यूलर आर्किटेक्चर का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक अविश्वसनीय रूप से प्रतिभाशाली, लेकिन थोड़ा अराजक (chaotic) कलात्मक सहायक है जिसका नाम Gemini है। यह सहायक आपकी हर बात पर कुछ भी पेंट कर सकता है, लेकिन अगर आप सिर्फ कहेंगे, "एक अच्छा लिविंग रूम पेंट करो," तो वह आपको एक ऐसा कमरा दे सकता है जिसमें सोफा हवा में तैर रहा हो, छत जेली की बनी हो, या ऐसा कलर स्कीम जो आपके ब्रांड से बिल्कुल मेल न खाता हो।
लंबे समय तक, AI आर्ट टूल्स का उपयोग करने वाले लोग एक टैक्सी ड्राइवर को अस्पष्ट निर्देश चिल्लाने वाले पर्यटकों की तरह थे: "मुझे एक अच्छी जगह ले चलो!" ड्राइवर (AI) अनुमान लगाता था, और अक्सर आप गलत मोहल्ले में पहुँच जाते थे।
यह शोधकर्ता Luca Cazzaniga द्वारा लिखा गया एक पेपर है, जो इस कलात्मक सहायक से बात करने का एक नया तरीका पेश करता है जिसे SCHEMA कहा जाता है। SCHEMA को एक "प्रॉम्ट" के रूप में नहीं, बल्कि आपके द्वारा चाही गई छवि के लिए एक सख्त वास्तुशिल्प ब्लूप्रिंट (architectural blueprint) या एक कानूनी अनुबंध (legal contract) के रूप में समझें।
यहाँ सरल शब्दों में, कुछ रचनात्मक उपमाओं (analogies) का उपयोग करते हुए इस पेपर का विवरण दिया गया है:
1. समस्या: "अस्पष्ट इच्छा" बनाम "ब्लूप्रिंट"
SCHEMA से पहले, लोग AI को एक जादू के जिन्न की तरह मानते थे। आपने एक इच्छा जताई, और उसने अपना सर्वश्रेष्ठ देने की कोशिश की। लेकिन वास्तविक दुनिया में (जैसे कार का विज्ञापन बनाना या घर की लिस्टिंग के लिए फोटो बनाना), आप "सर्वश्रेष्ठ प्रयास" पर निर्भर नहीं रह सकते। आपको सटीकता चाहिए।
- पुराना तरीका: "एक शानदार कार की फोटो बनाओ।" (परिणाम: शायद एक ट्रक, शायद एक लाल कार, शायद एक नीली कार, शायद पहिए पिघल रहे हों)।
- SCHEMA का तरीका: "एक विशिष्ट लाल कार की फोटो बनाओ, जो 45-डिग्री के कोण पर खड़ी हो, गर्म धूप (3000 Kelvin) के नीचे हो, और हुड पर कोई रिफ्लेक्शन न हो।"
2. नियंत्रण के तीन स्तर (वीडियो गेम की उपमा)
SCHEMA सुझाव देता है कि आप सीधे सबसे कठिन स्तर पर न कूदें। इसमें आपको सीखने और बेहतर परिणाम प्राप्त करने में मदद करने के लिए तीन "मोड" हैं:
- लेवल 1: BASE ("एक्सप्लोरेशन मोड")
- उपमा: आप एक अंधेरे कमरे में प्रवेश कर रहे हैं और यह देखने के लिए लाइट का स्विच ऑन कर रहे हैं कि वहां क्या है।
- यह क्या करता है: आप AI से बस "इसे दिखाने के लिए कहें कि यह क्या सोचता है।" यह आपको AI के प्राकृतिक पूर्वाग्रहों (biases) को देखने में मदद करता है (जैसे, "ओह, यह हमेशा आसमान नीला ही बनाता है")। यह खोज के बारे में है, अंतिम परिणामों के बारे में नहीं।
- लेवल 2: MEDIO ("डायरेक्टर मोड")
- उपमा: अब आप एक मूवी सेट पर निर्देशक हैं। आप अभिनय नहीं कर रहे हैं, लेकिन आप क्रू को ठीक-ठीक बता रहे हैं कि रोशनी और कैमरा कहाँ रखना है।
- यह क्या करता है: आप AI को गाइड करने के लिए एक संरचित चेकलिस्ट (7 विशिष्ट बॉक्स जिन्हें भरना है) का उपयोग करते हैं। यहाँ आपको पेशेवर ड्राफ्ट मिलते हैं।
- लेवल 3: AVANZATO ("आर्किटेक्ट मोड")
- उपमा: आप एक पुल बनाने वाले मास्टर इंजीनियर हैं। हर बोल्ट, हर माप, और हर सामग्री मिलीमीटर तक निर्दिष्ट है।
- यह क्या करता है: यह अंतिम उत्पाद के लिए है। आप शब्दों जैसे "चमकदार" या "गर्म" के बजाय नंबरों (जैसे Hex कोड में सटीक रंग या केल्विन में लाइट टेम्परेचर) का उपयोग करते हैं। यह आपको 95% नियंत्रण देता है।
3. सीक्रेट सॉस: "क्या न करें" (Don'ts) "क्या करें" (Dos) से बेहतर काम करते हैं
पेपर की सबसे बड़ी खोजों में से एक यह है कि AI के दिमाग कैसे काम करते हैं, इसकी एक अजीब विशेषता है।
- निष्कर्ष: AI के लिए एक "क्या न करें" (Do Not) कमांड का पालन करना एक "क्या करें" (Do) कमांड की तुलना में बहुत आसान है।
- उपमा: कल्पना कीजिए कि आप एक बच्चे को उसका कमरा साफ करने के लिए कह रहे हैं।
- कमांड A: "कमरे को एकदम परफेक्ट बना दो।" (बच्चा भ्रमित हो जाता है: परफेक्ट क्या है? शायद वह बिस्तर पर एक खिलौना छोड़ दे।)
- कमांड B: "बिस्तर पर खिलौने मत छोड़ना। फर्श पर कपड़े मत छोड़ना।" (बच्चा जानता है कि किन चीजों से बचना है, और कमरा अंततः अधिक साफ होता है।)
- परिणाम: पेपर में पाया गया कि यदि आप AI को कहते हैं "धुंधले किनारे (blurry edges) न हों" (एक निषेध/prohibition), तो वह 94% बार इसका पालन करता है। यदि आप उसे कहते हैं "किनारों को शार्प बनाओ" (एक अनिवार्यता/mandatory), तो वह केवल 91% बार इसका पालन करता है। AI गलतियों को बचने में, पूर्णता को प्राप्त करने की तुलना में बेहतर है।
4. "वन-शॉट" नियम (इतिहास को फिर से न लिखें)
पेपर एक आम आदत के खिलाफ चेतावनी देता है: एक AI इमेज लेना, उससे आँखें "ठीक" करने के लिए कहना, फिर उसी नई इमेज को लेकर हाथों को "ठीक" करने के लिए कहना।
- समस्या: AI इमेज को "ठीक" नहीं करता है; यह इसे फिर से व्याख्या (re-interpret) करता है। हर बार जब आप सुधार के लिए कहते हैं, तो AI थोड़ा और भ्रमित हो जाता है, और इमेज खराब होने लगती है (जैसे फोटोकॉपी की फोटोकॉपी)।
- SCHEMA का नियम: यदि आपको परिणाम पसंद नहीं आता है, तो एक बेहतर ब्लूप्रिंट के साथ शुरुआत से शुरू करें। खराब इमेज को एडिट करने की कोशिश न करें। हर जनरेशन को मूल योजना से एक नई शुरुआत के रूप में मानें।
5. "एग्जिट स्ट्रैटेजी" (कब रुकना है, यह जानना)
SCHEMA में एक "डिसीजन ट्री" (Decision Tree) शामिल है। यह एक GPS की तरह है जो आपको बताता है कि कब गाड़ी बदलनी है।
- यदि आपको इमेज के एक छोटे से हिस्से को एडिट करने की आवश्यकता है (जैसे किसी व्यक्ति को हटाना), तो पेपर कहता है: "इस टूल का उपयोग न करें। Adobe Firefly का उपयोग करें।"
- यदि आपको एक सटीक ज्यामितीय ग्रिड (geometric grid) की आवश्यकता है, तो पेपर कहता है: "Midjourney का उपयोग करें।"
- यह स्वीकार करता है कि कोई भी सिंगल टूल हर चीज़ के लिए परफेक्ट नहीं है और जब वर्तमान टूल अपनी सीमा पर पहुँच जाए, तो टूल्स बदलने के लिए आपको एक नक्शा देता है।
6. इमेज में टेक्स्ट का "जादू"
पेपर ने AI के लिए एक बहुत कठिन चीज़ का परीक्षण किया: इमेज के अंदर टेक्स्ट लिखना (जैसे किसी स्टोर का साइन या बोतल का लेबल)।
- परिणाम: सख्त "आर्किटेक्ट मोड" (लेवल 3) का उपयोग करके, AI ने पहली बार में ही स्पेलिंग और प्लेसमेंट को 95% बार सही तरीके से किया।
- महत्व: आमतौर पर, AI बड़बड़ (gibberish) लिखता है। यह साबित करता है कि यदि आप AI को एक रचनात्मक कलाकार के बजाय एक सख्त इंजीनियर की तरह ट्रीट करते हैं, तो वह वास्तव में पेशेवर ग्राफिक डिजाइन का काम कर सकता है।
सारांश: मुख्य निष्कर्ष क्या है?
पेपर का तर्क है कि AI आर्ट अब "जादू" के बारे में नहीं है; यह इंजीनियरिंग के बारे में है।
पेशेवर परिणाम प्राप्त करने के लिए, आपको AI से एक दोस्त की तरह बात करना बंद करना होगा और एक कंप्यूटर प्रोग्राम की तरह बात करना शुरू करना होगा। आपको विशिष्ट होना होगा, "Dos" के बजाय "Don'ts" का उपयोग करना होगा, विशेषणों के बजाय नंबरों का उपयोग करना होगा, और यह जानना होगा कि कब एडिटिंग बंद करके फिर से शुरू करना है।
SCHEMA वह निर्देश पुस्तिका (instruction manual) है जो आपको यह नई भाषा बोलना सिखाती है, जो एक अराजक जादू के खेल को एक विश्वसनीय, औद्योगिक मशीन में बदल देती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।