← नवीनतम पेपर
🤖 machine learning

Exposing Diversity Bias in Deep Generative Models: Statistical Origins and Correction of Diversity Error

यह शोध पत्र प्रकट करता है कि वेन्डी (Vendi) और आरकेई (RKE) जैसे एंट्रॉपी-आधारित मेट्रिक्स के परिमित-नमूना पूर्वाग्रह (finite-sample bias) के कारण डीप जेनेरेटिव मॉडल वास्तविक वितरण की तुलना में डेटा विविधता को व्यवस्थित रूप से कम प्रदर्शित करते हैं, और इस त्रुटि को कम करने के लिए विविधता-जागरूक नियमितीकरण रणनीतियों (diversity-aware regularization strategies) का प्रस्ताव करता है।

मूल लेखक: Farzan Farnia, Mohammad Jalali, Azim Ospanov

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Farzan Farnia, Mohammad Jalali, Azim Ospanov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Exposing Diversity Bias in Deep Generative Models" का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी तस्वीर: "कॉपीकैट" (नकलची) की समस्या

कल्पना कीजिए कि आपने एक शानदार कलाकार को एक व्यस्त शहर के एक हज़ार चित्र बनाने के लिए काम पर रखा है। आप चाहते हैं कि वे शहर के 'वाइब' (vibe) को पकड़ें: शोर, रंग, अलग-अलग तरह के लोग और अनूठी वास्तुकला।

कलाकार बहुत अच्छा काम करता है। पेंटिंग्स वास्तविक लगती हैं। लेकिन यदि आप ध्यान से देखें, तो आप कुछ अजीब देखते हैं: हर एक पेंटिंग में बिल्कुल एक ही प्रकार की तीन कारें, वही पाँच चेहरे और सूरज का वही एक कोण दिखाई देता है। कलाकार एक "कॉपीकैट" बन गया है। वह प्रत्येक व्यक्तिगत पेंटिंग को एकदम सटीक बनाने पर इतना केंद्रित हो गया है कि वह पूरे शहर की अराजक, अव्यवस्थित और विविध (diverse) वास्तविकता को पकड़ना भूल गया है।

यही चीज़ इस शोध पत्र ने आधुनिक AI इमेज जनरेटरों (जैसे DALL-E, Midjourney, या Stable Diffusion) के बारे में खोजी है। हालांकि वे शानदार चित्र बनाते हैं, लेकिन वे व्यवस्थित रूप से वास्तविक दुनिया की विविधता को कम करके आंकते (underestimate) हैं। वे "सुरक्षित" तो हैं, लेकिन पर्याप्त "जंगली" या विविध नहीं हैं।


मुख्य खोज: "छोटा सैंपल" वाला जाल

शोधकर्ताओं ने पूछा: AI ऐसा क्यों करता है?

उन्होंने पाया कि इसका कारण एक सांख्यिकीय विचित्रता है जिसे फाइनाइट-सैंपल बायस (Finite-Sample Bias) कहा जाता है।

आइसक्रीम शॉप की उपमा:
कल्पना कीजिए कि आपकी 1,000 फ्लेवर वाली एक आइसक्रीम शॉप है।

  1. वास्तविक दुनिया (The Population): आपके पास एक विशाल बाल्टी है जिसमें उन 1,000 फ्लेवर्स में से हर एक की एक-एक बूंद आपस में मिली हुई है।
  2. AI का प्रशिक्षण (The Sample): आप AI को चखने के लिए उस बाल्टी से केवल एक छोटा चम्मच आइसक्रीम देते हैं।

चूंकि चम्मच छोटा है, इसलिए सांख्यिकीय रूप से यह संभावना कम है कि उसमें उन सभी 1,000 फ्लेवर्स में से हर एक मौजूद हो। इसमें "लावा लैंप" फ्लेवर या "ब्लू चीज़" फ्लेवर पूरी तरह से छूट सकता है। AI इसी छोटे चम्मच से सीखता है। वह सोचता है, "ठीक है, दुनिया में केवल वही फ्लेवर हैं जो इस चम्मच में हैं।"

जब AI नई आइसक्रीम बनाने की कोशिश करता है, तो वह केवल वही फ्लेवर बनाता है जो उसने उस छोटे चम्मच में देखे थे। वह गायब फ्लेवर्स को कभी नहीं बना पाता क्योंकि उसे पता ही नहीं कि उनका अस्तित्व है।

शोध पत्र की अंतर्दर्दृष्टि:
शोधकर्ताओं ने गणितीय रूप से सिद्ध किया कि जैसे-जैसे आप अधिक सैंपल लेते हैं (एक बड़ा चम्मच), आपकी कुल विविधता का अनुमान बेहतर होता जाता है। लेकिन चूंकि AI मॉडल सीमित डेटासेट (भले ही वे बहुत बड़े हों) पर प्रशिक्षित होते हैं, वे हमेशा "पूरे बाल्टी" के बजाय एक "चम्मच" के साथ काम करते हैं। इसके कारण वे स्वाभाविक रूप से वास्तविक दुनिया की तुलना में कम विविधता पैदा करते हैं।


उन्होंने इसे कैसे मापा: "वेंडी स्कोर" (Vendi Score)

AI द्वारा बनाई गई छवियों के ढेर में "विविधता" को कैसे मापें? आप बस किसी इंसान से उन्हें गिनने के लिए नहीं कह सकते; यह बहुत धीमा और व्यक्तिपरक (subjective) होगा।

यह शोध पत्र वेंडी स्कोर (Vendi Score) (और इसका एक संबंधी RKE) नामक एक चतुर गणितीय उपकरण का उपयोग करता है।

पार्टी की उपमा:
कल्पना कीजिए कि आप एक पार्टी में हैं।

  • कम विविधता (Low Diversity): हर कोई बिल्कुल एक जैसी टी-शर्ट पहने हुए है। "वेंडी स्कोर" कम है।
  • उच्च विविधता (High Diversity): हर कोई कुछ पूरी तरह से अलग पहने हुए है। "वेंडी स्कोर" अधिक है।

शोधकर्ताओं ने छवियों के "संगीत" को सुनने के लिए एक "सुपर-ईयर" (गणितीय कर्नेल) का उपयोग किया। उन्होंने गणना की कि कितने "अद्वितीय स्वर" (unique notes) बजाए जा रहे थे।

  • परिणाम: जब उन्होंने वास्तविक तस्वीरों (जैसे ImageNet से) का "संगीत" बजाया, तो स्कोर अधिक था (बहुत सारे अद्वितीय स्वर)।
  • परिणाम: जब उन्होंने AI द्वारा निर्मित तस्वीरों का "संगीत" बजाया, तो स्कोर काफी कम था। AI बार-बार उन्हीं कुछ स्वरों को दोहरा रहा था।

समाधान: "पासे हिलाना" (Shaking the Dice)

यदि समस्या यह है कि AI बहुत "सुरक्षित" है और विविधता के मानचित्र के एक छोटे कोने में फंसा हुआ है, तो हम इसे कैसे ठीक कर सकते हैं?

शोध पत्र दो मुख्य रणनीतियों का सुझाव देता है, जिनका उन्होंने सफलतापूर्वक परीक्षण किया:

1. "विविधता दंड" (Diversity Penalty) के साथ प्रशिक्षण

उपमा: कल्पना कीजिए कि एक शिक्षक छात्र को ग्रेड दे रहा है।

  • पुराना तरीका: "आपको 'A' ग्रेड तब मिलेगा जब आपका चित्र संदर्भ फोटो के बिल्कुल समान दिखेगा।"
  • नया तरीका: "आपको 'A' ग्रेड तब मिलेगा यदि आपका चित्र फोटो जैसा दिखता है और यदि यह उन अन्य चित्रों से अलग है जो आपने अभी बनाए हैं।"

शोधकर्ताओं ने AI के प्रशिक्षण में एक "विविधता दंड" जोड़ा। यदि AI ऐसी छवियां बनाने लगता है जो एक-दूसरे के बहुत समान हैं, तो उसे "फेलिंग ग्रेड" (दंड) मिलता है। यह AI को अपने पैर फैलाने और आइसक्रीम की बाल्टी में मौजूद "गायब फ्लेवर्स" को खोजने के लिए मजबूर करता है।

2. "पोस्ट-प्रोसेसिंग" फ़िल्टर

उपमा: कल्पना कीजिए कि आपके पास 1,000 AI-जनरेटेड तस्वीरों की एक बाल्टी है। कुछ बेहतरीन हैं, लेकिन कई एक-दूसरे की नकल हैं।
उन्हें फेंकने के बजाय, आप एक विशेष फ़िल्टर का उपयोग करके उन्हें पुनः भारित (re-weight) करते हैं। आप कहते हैं, "मैं इस दुर्लभ, अजीब फोटो को रखूँगा, लेकिन मैं उस उबाऊ फोटो की 50 कॉपियों को फेंक दूँगा।"

शोध पत्र दिखाता है कि गणितीय रूप से यह बदलकर कि कौन सी छवियां दिखाई दी जा सकती हैं, आप पूरे AI को फिर से प्रशिक्षित किए बिना तुरंत विविधता स्कोर को बढ़ा सकते हैं।


यह क्यों मायने रखता है

यह केवल "बेहतर" या "खराब" चित्र बनाने के बारे में नहीं है। यह ईमानदारी के बारे में है।

  • कलाकारों के लिए: यदि AI आपको किसी शैली का केवल "औसत" संस्करण दिखाता है, तो यह मानवीय रचनात्मकता को सीमित करता है।
  • विज्ञान के लिए: यदि कोई AI जैविक प्रक्रिया का अनुकरण करता है लेकिन दुर्लभ, विविध विविधताओं को छोड़ देता है, तो इससे गलत चिकित्सा निष्कर्ष निकल सकते हैं।
  • समाज के लिए: यदि कोई AI समाचार या ऐतिहासिक डेटा उत्पन्न करता है, और वह मानवीय अनुभव की विविधता को "सपाट" (flatten) कर देता है, तो यह वास्तविकता का एक विकृत दृश्य बनाता है।

मुख्य निष्कर्ष (Takeaway)

डीप लर्निंग मॉडल अद्भुत हैं, लेकिन उनकी एक अंध बिंदु (blind spot) है: वे स्वाभाविक रूप से रूढ़िवादी (conservative) हैं। वे सुरक्षित खेलना पसंद करते हैं और उन पैटर्न को दोहराते हैं जो उन्होंने देखे हैं, जिससे वे दुर्लभ और अद्वितीय चीजों को छोड़ देते हैं।

यह शोध पत्र उस "रूढ़िवादिता" को मापने के उपकरण और AI को अधिक साहसी बनाने के लिए गणितीय "धक्के" प्रदान करता है, ताकि यह सुनिश्चित हो सके कि वह वास्तविक दुनिया की पूरी, अराजक और सुंदर विविधता को पकड़े, न कि केवल उसका एक सुरक्षित, छोटा हिस्सा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →