← नवीनतम पेपर
🤖 AI

Di3PO - Diptych Diffusion DPO for Targeted Improvements in Image Generation

यह शोध पत्र Di3PO प्रस्तुत करता है, जो टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल्स के लिए एक नवीन विधि है जो स्थिर संदर्भ बनाए रखते हुए लक्षित क्षेत्रीय सुधारों के साथ प्राथमिकता युग्मों (preference pairs) का निर्माण करके प्रशिक्षण दक्षता में सुधार करती है, और SFT एवं DPO बेसलाइन की तुलना में टेक्स्ट रेंडरिंग में बेहतर प्रदर्शन प्रदर्शित करती है।

मूल लेखक: Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta

प्रकाशित 2026-02-20
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sanjana Reddy, Ishaan Malhi, Sally Ma, Praneet Dutta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े भ्रमित कलाकार को एक विशिष्ट दृश्य बनाना सिखा रहे हैं: एक सुंदर सूर्यास्त जिसमें आकाश में "Hello World" शब्द स्पष्ट रूप से लिखे हों।

कलाकार सूर्यास्त पेंट करने में बहुत माहिर है, लेकिन वह टेक्स्ट (शब्दों) के साथ बार-बार गलती करता रहता है। कभी अक्षर उलझे हुए होते हैं, कभी स्पेलिंग गलत होती है, तो कभी वे एलियन प्रतीकों जैसे दिखने लगते हैं।

पुराना तरीका: "अनुमान लगाने का खेल"

पारंपरिक रूप से, कलाकार को सिखाने के लिए, आप उसे दो चित्र दिखाते:

  1. चित्र A: एक आदर्श सूर्यास्त और आदर्श टेक्स्ट के साथ।
  2. चित्र B: एक खराब टेक्स्ट वाले सूर्यास्त के साथ।

समस्या: पुराने तरीके में, चित्र B अक्सर चित्र A से पूरी तरह से अलग दिखता था। शायद सूरज बाईं ओर के बजाय दाईं ओर था, बादलों का रंग अलग था, या पहाड़ गायब थे।

जब आप कलाकार से पूछते, "चित्र A बेहतर क्यों है?" तो वह भ्रमित हो जाता।

  • "क्या यह इसलिए बेहतर है क्योंकि टेक्स्ट सही है?"
  • "या इसलिए क्योंकि सूरज सही जगह पर है?"
  • "या इसलिए क्योंकि बादल अधिक सुंदर हैं?"

क्योंकि इसमें बहुत सारे अंतर थे, कलाकार यह समझ नहीं पाता था कि वास्तव में क्या सुधारना है। वह अनजाने में सूरज को बाईं ओर खिसकाने के लिए सीख सकता था सिर्फ एक "थम्स अप" पाने के लिए, जबकि वह टेक्स्ट को अभी भी गलत ही रखता। इसे क्रेडिट असाइनमेंट प्रॉब्लम (Credit Assignment Problem) कहा जाता है—शिक्षक ड्राइंग के सही हिस्से को श्रेय (या दोष) नहीं दे पाता।

नया तरीका: "डिप्टिक" (दो-पैनल) ट्रिक

कागज में एक नई विधि बताई गई है जिसे Di3PO (Diptych Diffusion DPO) कहा जाता है। इसे एक स्प्लिट-स्क्रीन या डिप्टिक (बगल में रखे दो पैनलों वाली पेंटिंग) के रूप में सोचें।

दो पूरी तरह से अलग चित्र दिखाने के बजाय, कलाकार को एक ही इमेज दिखाई जाती है जो बीच से विभाजित है:

  • बायां पैनल: "Hello World" टेक्स्ट के साथ एक आदर्श सूर्यास्त।
  • दायां पैनल: वही बिल्कुल समान सूर्यास्त, वही बिल्कुल समान बादल, सूरज और पहाड़, लेकिन टेक्स्ट में "Helo World" लिखा है (गलत स्पेलिंग)।

जादू:
चूंकि बैकग्राउंड दोनों तरफ पिक्सेल-परफेक्ट समान है, इसलिए कलाकार के पास केवल उस चीज़ पर ध्यान केंद्रित करने के अलावा कोई विकल्प नहीं बचता जो अलग है: शब्दों की स्पेलिंग।

  • "आह!" कलाकार कहता है। "मुझे पता है कि मुझे क्या ठीक करना है। मुझे सूरज को हिलाने या बादलों को बदलने की ज़रूरत नहीं है। मुझे बस 'Hello' में 'o' को ठीक करने की ज़रूरत है।"

यह एक बड़ी बात क्यों है?

  1. बर्बाद प्रयास की कमी: कलाकार अपना दिमाग बेकार की चीजों में नहीं लगाता कि बैकग्राउंड क्यों बदल गया। वह अपनी 100% ऊर्जा विशिष्ट गलती (टेक्स्ट) को सुधारने में लगाता है।
  2. तेज़ सीखना: क्योंकि सबक बहुत स्पष्ट है, कलाकार बहुत तेज़ी से सीखता है। आपको हजारों उदाहरण दिखाने की ज़रूरत नहीं है; ऐसे कुछ सौ "स्प्लिट-स्क्रीन" सबक ही काफी हैं।
  3. कोई फैंसी जज की ज़रूरत नहीं: आमतौर पर, आपको एक जटिल कंप्यूटर प्रोग्राम (एक "रिवॉर्ड मॉडल") या किसी इंसान की ज़रूरत होती है जो चित्रों को देखकर कहे कि कौन सा बेहतर है। Di3PO के साथ, "खराब" चित्र को जानबूझकर स्पेलिंग गलत करके बनाया जाता है। कंप्यूटर बिना किसी जज की मदद के तुरंत जान जाता है कि कौन सा पक्ष "विजेता" है और कौन सा "हारने वाला"।

परिणाम

शोधकर्ताओं ने इसका परीक्षण एक लोकप्रिय AI मॉडल (SDXL) पर किया।

  • पहले: AI टेक्स्ट लिखने में संघर्ष करता था, अक्सर अर्थहीन शब्द बनाता था।
  • बाद में (Di3PO के बाद): AI ने स्पष्ट और पठनीय टेक्स्ट लिखना शुरू कर दिया, यहाँ तक कि जटिल दृश्यों में भी।

उपमा का सारांश (Analogy Summary)

  • पुराना तरीका: किसी को पेरिस में एक आदर्श ड्राइव का वीडियो दिखाकर ड्राइविंग सिखाने की कोशिश करना, और फिर टोक्यो में एक दुर्घटना का वीडियो दिखाना। उन्हें पता नहीं चलेगा कि दुर्घटना स्टीयरिंग की वजह से हुई, गति की वजह से, या अलग ट्रैफिक नियमों की वजह से।
  • Di3PO तरीका: उन्हें एक स्प्लिट-स्क्रीन वीडियो दिखाना। बाईं ओर, वे पहिया सही दिशा में घुमाते हैं। दाईं ओर, वे पहिया गलत दिशा में घुमाते हैं। सड़क, कार और दृश्य बिल्कुल समान हैं। वे तुरंत सीख जाते हैं: "पहिया इस तरफ घुमाना ही समस्या है।"

संक्षेप में: Di3PO एक चतुर तरीका है जिससे AI मॉडल को "पहले और बाद" की तस्वीरें दिखाकर सिखाया जाता है जहाँ आप जो चीज़ ठीक करना चाहते हैं, उसके अलावा बाकी सब कुछ समान होता है। यह सीखने की प्रक्रिया को तेज़, सस्ता और बहुत अधिक प्रभावी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →