← नवीनतम पेपर
🤖 AI

IV-CoT: Implicit Visual Chain-of-Thought for Structure-Aware Text-to-Image Generation

यह शोध पत्र IV-CoT का प्रस्ताव करता है, जो एक लेटेंट विजुअल रीजनिंग फ्रेमवर्क है जो केवल प्रशिक्षण-आधारित स्केच पर्यवेक्षण द्वारा निर्देशित एक स्ट्रक्चरल-टू-सेमेंटिक कैस्केड के माध्यम से संरचनात्मक योजना (structural planning) को उपस्थिति रेंडरिंग (appearance rendering) से अलग करके, एकल फॉरवर्ड पास के भीतर, स्ट्रक्चर-अवेयर टेक्स्ट-टू-इमेज जनरेशन में सुधार करता है।

मूल लेखक: Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

प्रकाशित 2026-06-24
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zixuan Li, Haokun Lin, Yicheng Xiao, Zhiwei Li, Xinyang Song, Zelong Zheng, Yong He, Heng Yao, Ke Ding, Chao Yu, Chuan Yuan, Qi Li, Zhenan Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वास्तुकार (architect) हैं जो किसी क्लाइंट के विवरण के आधार पर एक घर बनाने की कोशिश कर रहे हैं।

समस्या: "उलझा हुआ" वास्तुकार
वर्तमान AI इमेज जनरेटर उन वास्तुकारों की तरह हैं जो घर का लेआउट (दीवारें कहाँ होंगी) और वॉलपेपर (रंग और बनावट) दोनों को एक ही समय में डिजाइन करने की कोशिश करते हैं, और यह सब एक ही माइक्रोफोन में निर्देश चिल्लाते हुए करते हैं। क्योंकि वे सब कुछ एक साथ कर रहे हैं, इसलिए वे अक्सर भ्रमित हो जाते हैं। वे किचन को बेडरूम में रख सकते हैं, दूसरी मंजिल बनाना भूल सकते हैं, या सामने के दरवाजे को गलत रंग से पेंट कर सकते हैं। वे एक ऐसा चित्र बना सकते हैं जो दिखने में अच्छा हो, लेकिन वह अनुरोध के विशिष्ट नियमों का पालन नहीं करता है।

समाधान: IV-CoT (द "टू-स्टेप" आर्किटेक्ट)
यह पेपर एक नई विधि पेश करता है जिसे IV-CoT (इम्प्लिसिट विजुअल चेन-ऑफ-थॉट) कहा जाता है। इसे एक ऐसे वास्तुकार के रूप में सोचें जो "ब्लूप्रिंट चरण" और "सजावट चरण" को सख्ती से अलग करता है, लेकिन वह इसे इतनी तेजी से और गुप्त रूप से करता है कि आप ब्लूप्रिंट को कभी देख ही नहीं पाते।

यह इस प्रकार काम करता है, जिसे सरल चरणों में विभाजित किया गया है:

1. गुप्त ब्लूप्रिंट (लेटेंट रीजनिंग)

निर्देशों की एक लंबी सूची लिखने या कागज पर कोई दृश्य स्केच बनाने के बजाय (जो चीजों को धीमा कर देता है), AI अपने स्वयं के "मस्तिष्क" (अपने छिपे हुए डेटा) के भीतर एक मानसिक ब्लूप्रिंट बनाता है।

  • स्ट्रक्चरल क्वेरीज (संरचनात्मक प्रश्न): सबसे पहले, AI खुद से पूछता है, "वस्तुएं कहाँ जाती हैं? वे कितनी हैं? सामान्य आकार क्या है?" यह एक मोटा, अदृश्य मानचित्र बनाता है।
  • सिमेंटिक क्वेरीज (अर्थ संबंधी प्रश्न): फिर, और केवल तभी, वह पूछता है, "अब जब मुझे पता है कि दीवारें कहाँ हैं, तो उनका रंग क्या होना चाहिए? बनावट क्या होनी चाहिए?"

यह एक ही, बिजली की गति वाले पास (pass) में होता है। AI आपको ब्लूप्रिंट दिखाने के लिए नहीं रुकता; वह बस अंतिम चित्र को निर्देशित करने के लिए इसका उपयोग करता है।

2. "ट्रेनिंग-ओनली" स्केच कोच

AI इन सटीक मानसिक ब्लूप्रिंट को बनाना कैसे सीखता है?

  • ट्रेनिंग के दौरान: शोधकर्ता AI को एक चित्र और उसका स्केच (एक साधारण रेखा चित्र) दिखाते हैं। वे AI को कहते हैं: "तुम्हारा पहला काम इस स्केच को देखना और इसका लेआउट समझना है। अभी के लिए रंगों और बनावटों को अनदेखा करो।" यह AI के "स्ट्रक्चरल" हिस्से को केवल आकृतियों और स्थितियों पर ध्यान केंद्रित करने के लिए मजबूर करता है।
  • वास्तविक उपयोग (इन्फरेंस) के दौरान: जब आप वास्तव में AI से कोई इमेज बनाने के लिए कहते हैं, तो स्केच की आवश्यकता नहीं होती। AI पहले से ही सीख चुका होता है कि अपने आप वह मानसिक ब्लूप्रिंट कैसे बनाया जाए। यह एक ऐसे संगीतकार की तरह है जिसने वर्षों तक शीट म्यूजिक के साथ अभ्यास किया है लेकिन अब वह बिना कागज देखे गाना बजा सकता है।

3. परिणाम: एक बेहतर घर

क्योंकि AI "कहाँ" (संरचना) को "क्या" (दिखावट) से अलग करता है, इसलिए यह जटिल नियमों का पालन करने में बहुत बेहतर हो जाता है।

  • यदि आप "नीली कुर्सी पर बैठे तीन लाल बिल्लियों" के लिए कहते हैं, तो एक सामान्य AI दो बिल्लियाँ बना सकता है या कुर्सी को बिल्ली के सिर पर रख सकता है।
  • IV-CoT पहले अपने मानसिक प्लान में "तीन बिल्लियों" और "कुर्सी" के लेआउट को लॉक करता है, फिर उसके ऊपर लाल और नीला रंग लगाता है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

  • गति: क्योंकि AI दृश्य स्केच बनाने या इमेज बनाने से पहले लंबा टेक्स्ट विवरण लिखने के लिए नहीं रुकता है, इसलिए यह समान चीजें करने वाले अन्य तरीकों की तुलना में 9 से 15 गुना तेज है।
  • सटीकता: यह वस्तुओं की संख्या, स्थिति और संबंधों के बारे में निर्देशों का पालन करने में पिछले मॉडलों की तुलना में बहुत बेहतर है।
  • नियंत्रण: पेपर दिखाता है कि आप वास्तव में एक इमेज से "ब्लूप्रिंट" को दूसरी इमेज की "सजावट" के साथ बदल सकते हैं। उदाहरण के लिए, आप "जंगल" का लेआउट और "सूर्यास्त" के रंग ले सकते हैं ताकि एक "सूर्यास्त वाला जंगल" बना सकें, जो यह साबित करता है कि AI संरचना और शैली को अपने मन में अलग रखता है।

संक्षेप में:
IV-Coට एक मास्टर शेफ की तरह है जो वास्तव में सामग्री को काटने और मसाले डालने (दिखावट) से पहले मानसिक रूप से सामग्री और खाना पकाने के चरणों (संरचना) को व्यवस्थित करता है। अपनी योजना को अदृश्य और आंतरिक रखकर, शेफ तेजी से खाना पकाता है और कम गलतियाँ करता है, और वही व्यंजन परोसता है जैसा ग्राहक ने ऑर्डर किया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →