← नवीनतम पेपर
💻 computer science

ELDiff: When Evidential Learning Meets Text-to-Image Diffusion

ELDiff एक नवीन टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल है जो पिक्सेल एविडेंस और टोकन कॉन्फ्लिक्ट लॉस के माध्यम से सेगमेंटेशन मैप बायस और सिमेंटिक संघर्षों को कम करने के लिए एविडेंशियल लर्निंग को एकीकृत करता है, जिससे ऑब्जेक्ट-वाइज कंसिस्टेंसी में वृद्धि होती है और बिना किसी अतिरिक्त इन्फरेंस-टाइम मैनिपुलेशन के कई डिफ्यूजन आर्किटेक्चरों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingtao Pan, Kai Ye, Zhihao Dou, Bing Ji, Shuo Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कलाकार हैं जो एक बहुत ही विशिष्ट विवरण के आधार पर एक चित्र बनाने की कोशिश कर रहे हैं, जैसे कि "एक हरे रंग की कुर्सी पर बैठा एक भूरा टेडी बियर।" AI इमेज जनरेशन की दुनिया में, इसे "टेक्स्ट-टू-इमेज" (Text-to-Image) कहा जाता है। हालाँकि AI इसमें अविश्वसनीय रूप से अच्छा होता जा रहा है, लेकिन जब विवरण जटिल हो जाता है, तो यह अक्सर संघर्ष करता है। यह भालू को कुर्सी के अंदर बना सकता है, भालू और कुर्सी को एक ही ढेर में मिला सकता है, या रंगों को गलत कर सकता है।

यह शोध पत्र इन गड़बड़ियों को ठीक करने के लिए एक नई विधि पेश करता है जिसे ELDiff कहा जाता है। यह कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:

समस्या: "अति-आत्मविश्वासी" कलाकार और "टकराव वाले" निर्देश

लेखकों ने पहचान की कि AI कई वस्तुओं को सही ढंग से बनाने में दो मुख्य कारणों से विफल होता है:

  1. "खराब मानचित्र" की समस्या (सेगमेंटेशन बायस/Segmentation Bias):
    AI को यह सिखाने के लिए कि चीजों को कहाँ रखना है, पिछले तरीकों ने एक "मानचित्र" (एक सेगमेंटेशन मैप) का उपयोग किया जो दूसरे AI टूल द्वारा बनाया गया था। इसे एक GPS मानचित्र की तरह समझें। कभी-कभी, GPS गलत होता है—यह कह सकता है कि पार्क वहाँ है जहाँ वास्तव में लाइब्रेरी है। यदि कलाकार (AI) इस खराब मानचित्र का आँख मूंदकर पालन करता है, तो वह गलत चीजों को गलत जगहों पर बना देता है। पिछले तरीके बहुत "अति-आत्मविश्वासी" थे, वे कलाकार को मानचित्र का पालन करने के लिए मजबूर करते थे भले ही वह स्पष्ट रूप से गलत क्यों न हो, जिससे गलतियाँ होती थीं।

  2. "टकराव वाले निर्देशों" की समस्या (सिमेंटिक ओवरलैप/Semantic Overlap):
    कल्पना कीजिए कि आप कलाकार को कहते हैं, "एक बिल्ली बनाओ" और "एक कुर्सी बनाओ।" यदि बिल्ली कुर्सी पर बैठी है, तो उनके शरीर एक-दूसरे के ऊपर आते हैं। पुराने तरीकों ने इन्हें दो अलग-अलग, गैर-अतिव्यापी (non-overlapping) निर्देशों के रूप में माना। यह कलाकार को यह बताने जैसा था कि "इस विशिष्ट बॉक्स में बिल्ली बनाओ" और "इस विशिष्ट बॉक्स में कुर्सी बनाओ," बिना यह समझे कि बॉक्स एक-दूसरे के ऊपर हैं। इसके कारण AI भ्रमित हो जाता था और खुद से ही लड़ने लगता था, जिसके परिणामस्वरूप एक गंदा मिश्रण बनता था जहाँ बिल्ली और कुर्सी गलत तरीके से आपस में मिल जाते थे।

समाधान: ELDiff (एक "सतर्क" और "राजनयिक" कलाकार)

ELDiff AI को दो नए कौशल सिखाकर इन समस्याओं को ठीक करता है, जिसे एविडेंशियल लर्निंग (Evidential Learning) नामक अवधारणा का उपयोग करके समझाया गया है। इसे एक "कॉन्फिडेंस मीटर" (विश्वास मीटर) और एक "कॉन्फ्लिक्ट डिटेक्टर" (संघर्ष डिटेक्टर) देने के रूप में समझें।

1. "कॉन्फिडेंस मीटर" (पिक्सेल एविडेंस लॉस/Pixel Evidence Loss)

"खराब मानचित्र" का आँख मूंदकर पालन करने के बजाय, ELDiff AI को यह सिखाता है कि, "मैं इस बारे में कितना आश्वस्त हूँ?"

  • उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। यदि शिक्षक (मानचित्र) कहता है कि उत्तर "A" है, लेकिन छात्र 90% आश्वस्त है कि उत्तर "B" है, तो एक सामान्य छात्र शिक्षक को खुश करने के लिए "A" ही चुन लेगा। ELDiff छात्र को यह सिखाता है कि, "मैं देख रहा हूँ कि शिक्षक कहता है 'A', लेकिन मैं इस उत्तर के बारे में बहुत आश्वस्त नहीं हूँ, इसलिए मैं अपने विकल्प खुले रखूँगा।"
  • परिणाम: जब मानचित्र गलत या धुंधला होता है, तो AI सटीक मिलान करने के लिए मजबूर नहीं होता। वह "सतर्क" रहता है, और केवल इसलिए भालू को कुर्सी के अंदर बनाने की गलती नहीं करता क्योंकि मानचित्र ने ऐसा कहा था। वह अविश्वसनीय निर्देशों को अनदेखा करना सीख जाता है।

2. "कॉन्फ्लिक्ट डिटेक्टर" (टोकन कॉन्फ्लिक्ट लॉस/Token Conflict Loss)

यह हिस्सा AI को ओवरलैपिंग वस्तुओं को बिना आपस में टकराए संभालने में मदद करता है।

  • उपमा: कल्पना कीजिए कि दो लोग डांस फ्लोर पर एक ही जगह पर दावा करने की कोशिश कर रहे हैं। पुराने तरीकों ने दोनों को वहीं खड़े होने के लिए मजबूर किया, जिससे टकराव हुआ। ELDiff एक स्मार्ट डांस इंस्ट्रक्टर की तरह कार्य करता है जो कहता है, "ठीक है, बिल्ली और कुर्सी दोनों इस स्थान को चाहते हैं। आइए मापते हैं कि वे कितना लड़ रहे हैं।"
  • परिणाम: AI एक "संघर्ष स्कोर" (conflict score) की गणना करता है। यदि बिल्ली और कुर्सी बहुत अधिक ओवरलैप हो रहे हैं, तो AI पेंटिंग को इस तरह समायोजित करता है कि वे स्वाभाविक रूप से एक साथ फिट हो सकें (जैसे कि कुर्सी पर बैठी बिल्ली) बजाय इसके कि वे एक ही अजीब वस्तु में मिल जाएँ। यह प्रॉम्प्ट के विभिन्न शब्दों के बीच स्थान के लिए समझौता करना सीख जाता है।

परिणाम: एक बेहतर पेंटिंग

लेखकों ने कई लोकप्रिय AI मॉडलों (जैसे Stable Diffusion) पर ELDiff का परीक्षण किया। उन्होंने पाया कि:

  • बेहतर संरचना (Better Composition): AI चीजों को आपस में मिलाए बिना उन्हें सही स्थानों पर बनाने में बहुत बेहतर हो गया।
  • कोई अतिरिक्त प्रतीक्षा समय नहीं: अन्य तरीकों के विपरीत जो पेंटिंग की प्रक्रिया को धीमा कर देते हैं, ELDiff इमेज जेनरेट करते समय कोई अतिरिक्त समय नहीं लेता है। यह एक "ट्रेनिंग" सुधार है, न कि "धीमा करने वाला" सुधार।
  • बहुमुखी प्रतिभा (Versatility): यह पुराने मॉडलों से लेकर नवीनतम, शक्तिशाली मॉडलों तक, विभिन्न प्रकार के AI मॉडलों पर अच्छी तरह काम करता है।

सारांश में

ELDiff एक AI कलाकार को खराब मानचित्रों का आँख मूंदकर पालन करने वाले और ओवरलैपिंग निर्देशों से भ्रमित होने वाले व्यक्ति से, एक सतर्क और राजनयिक कलाकार में अपग्रेड करने जैसा है। वह जानता है कि निर्देशों पर कब भरोसा करना है और कब संदेह करना है, और वह जानता है कि कई वस्तुओं को चित्र में शांतिपूर्वक सह-अस्तित्व में रहने के लिए कैसे व्यवस्थित करना है। परिणाम अधिक स्पष्ट, सटीक चित्र हैं जो टेक्स्ट विवरण से बहुत बेहतर ढंग से मेल खाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →