← नवीनतम पेपर
🤖 machine learning

Diffusion Models Preferentially Memorize Prototypical Examples or: Why Does My Diffusion Model Love Slop?

यह शोध पत्र प्रदर्शित करता है कि डिफ्यूजन मॉडल दुर्लभ या असामान्य नमूनों के बजाय सामान्य सबस्ट्रिंग्स (substrings) से बने प्रोटोटाइपिकल उदाहरणों को प्राथमिकता से याद करते हैं और उनका अत्यधिक उत्पादन करते हैं, जो यह दर्शाता है कि मेमोराइजेशन (memorization) और उत्पन्न आउटपुट में होने वाले परिणामी "स्लॉप" (slop) को रोकने के लिए उच्च अमूर्त स्तरों पर डेटासेट की विविधता अत्यंत महत्वपूर्ण है।

मूल लेखक: Marta Aparicio Rodriguez, Anastasia Borovykh, Grigorios A. Pavliotis, Daniel J. Korchinski

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marta Aparicio Rodriguez, Anastasia Borovykh, Grigorios A. Pavliotis, Daniel J. Korchinski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को एक नया व्यंजन बनाना सिखा रहे हैं। आप उसे एक विशाल कुकबुक (प्रशिक्षण डेटा) देते हैं जो अनूठे व्यंजनों से भरी है। आपका लक्ष्य यह है कि रोबोट खाना पकाने के सिद्धांतों को सीखे ताकि वह अपने स्वयं के स्वादिष्ट भोजन का आविष्कार कर सके, न कि केवल किताब के पन्नों की नकल करे।

हालाँकि, यह शोध पत्र पाता है कि रोबट की एक अजीब आदत है: यह सबसे पहले अजीब और अनोखे व्यंजनों को याद नहीं करता है। इसके बजाय, यह "मानक" सामग्रियों और सामान्य चरणों को पहले याद करता है।

यहाँ शोधकर्ताओं द्वारा की गई खोजों का विवरण दिया गया, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. बड़ी गलतफहमी: "अजीब चीजें पहले अटक जाती हैं"

आप सोच सकते हैं कि यदि कोई रोबोट आपकी किताब को याद करने जा रहा है, तो वह सबसे असामान्य, दुर्लभ या कठिन व्यंजनों पर पहले अटकेगा क्योंकि वे अलग दिखते हैं।

  • वास्तविकता: रोबोट वास्तव में सामान्य चीजों पर पहले अटक जाता है।
  • उपमा: एक छात्र की परीक्षा लेने की कल्पना करें। आप सोच सकते हैं कि वे सबसे कठिन, दुर्लभ प्रश्नों पर पहले संघर्ष करेंगे। लेकिन यह अध्ययन दिखाता है कि छात्र वास्तव में सबसे आम, मानक प्रश्नों को पहले याद करता है। यदि रोबोट एक ऐसी रेसिपी देखता है जिसमें "नमक और काली मिर्च" (सामान्य) है, तो वह उस पैटर्न को जल्दी सीख लेता है। यदि वह "ड्रैगन फ्रूट और ट्रफल ऑयल" (दुर्लभ) वाली रेसिपी देखता है, तो उसे उस विशिष्ट संयोजन को याद करने में बहुत अधिक समय लगता है।

2. "स्लॉप" (Slop) चरण: जब रोबोट उबाऊ हो जाता है

रोबोट के सीखने के एक विशिष्ट चरण को शोध पत्र में "स्लॉप" (Slop) चरण कहा गया है।

  • क्या होता है: पूरी रेसिपी की नकल करने से पहले, रोबोट एक मध्य चरण में प्रवेश करता है। इस चरण में, वह रचनात्मक होना बंद कर देता है और उन सबसे आम सामग्रियों का अत्यधिक उपयोग करने लगता है जिन्हें उसने शुरुआत में सीखा था।
  • उपमा: एक संगीतकार की कल्पना करें जो जैज़ (jazz) बजाना सीख रहा है। शुरू में, वह मूल, जटिल सोलो बजाता है। फिर, वह एक "स्लॉप" चरण में पहुँचता है जहाँ वह सुधार (improvisation) करना बंद कर देता है और बस उन्हीं तीन सरल, लोकप्रिय नोट्स को बार-बार बजाता रहता है। यह किसी विशिष्ट गीत की नकल नहीं है, बल्कि यह उबाऊ और दोहराव वाला है क्योंकि वह केवल उन "सामान्य" हिस्सों को दोहरा रहा है जिन्हें उसने पहले याद किया था।
  • परिणाम: यदि आप इस "स्लॉप" चरण के दौरान रोबोट को प्रशिक्षित करना रोक देते हैं, तो यह ऐसा आउटपुट देता है जो सुरक्षित, सामान्य और उबाऊ महसूस होता है—जिसे लोग ऑनलाइन अक्सर "AI स्लॉप" कहते हैं।

3. "लेगो" (Lego) सबक: महलों से पहले ईंटों को याद करना

शोधकर्ताओं ने एक विशेष प्रकार के सिंथेटिक डेटा का उपयोग किया है जो लेगो ब्लॉक्स की तरह काम करता है।

  • यह कैसे काम करता है: एक "चित्र" बड़े ब्लॉकों (जैसे एक बिल्ली) से बना है, जो छोटे ब्लॉकों (कान, आँखें) से बने हैं, जो बहुत छोटे ब्लॉकों (रंग, आकार) से बने हैं।
  • निष्कर्ष: रोबोट पूरी तस्वीर को याद करने से पहले छोटे, सामान्य ब्लॉकों (जैसे "नारंगी" रंग या "वृत्त" का आकार) को याद करता है।
  • खतरा: भले ही आप प्रशिक्षण डेटा से डुप्लिकेट चित्रों को हटा दें (ताकि प्रत्येक छवि अद्वितीय हो), रोबोट फिर भी उन छवियों के सामान्य भागों को पहले याद कर लेता है। इसका मतलब है कि केवल डुप्लिकेट हटाना रोबोट को उन बिल्डिंग ब्लॉक्स को याद करके "चीटिंग" करने से रोकने के लिए पर्याप्त नहीं है।

4. "फैट टेल्स" (Fat Tails) क्यों मदद करते हैं (दुर्लभता की लंबी पूंछ)

शोध पत्र ने उन डेटासेट्स का अध्ययन किया जहाँ कुछ चीजें बहुत आम हैं और कुछ बहुत दुर्लभ हैं (एक "फैट-टेल्ड" वितरण)।

  • निष्कर्ष: यदि आपके डेटासेट में बहुत सारी दुर्लभ, अजीब चीजें (एक लंबी पूंछ) हैं, तो रोबोट किसी भी चीज़ को याद करना शुरू करने में अधिक समय लेगा।
  • उपमा: यदि आप एक रोबोट को एक ऐसी लाइब्रेरी खिलाते हैं जहाँ 99% किताबें "बिल्लियों" के बारे में हैं और 1% "एलियन स्पेस कैट्स" के बारे में हैं, तो वह "बिल्ली" वाली किताबों को तुरंत याद कर लेगा। लेकिन यदि आप उसे एक ऐसी लाइब्रेरी खिलाते हैं जहाँ हर एक किताब एक अलग एलियन के बारे में एक अनूठी, अजीब कहानी है, तो उसे उन्हें कॉपी करना शुरू करने में बहुत अधिक समय लगेगा क्योंकि पकड़ बनाने के लिए कोई "सामान्य" पैटर्न नहीं है।
  • सबक: विविधता एक ढाल है। आपका डेटा जितना विविध और "अजीब" होगा, मॉडल के लिए उबाऊ "स्लॉप" पैदा करने के जाल में फंसना उतना ही कठिन होगा।

5. रचनाकारों के लिए सीख

शोध पत्र निष्कर्ष निकालता है कि यदि आप चाहते हैं कि AI उबाऊ, दोहराव वाली सामग्री ("स्लॉप") न बनाए, तो आपको इस बात पर ध्यान देना होगा कि आप मॉडल को प्रशिक्षित करने के लिए कब रोकते हैं।

  • यदि आप बहुत जल्दी रुक जाते हैं, तो मॉडल "स्लॉप" चरण में हो सकता है, जो सामान्य विशेषताओं का अत्यधिक उपयोग कर रहा है।
  • यदि आप इसे बहुत लंबे समय तक प्रशिक्षित करते हैं, तो यह पूरे डेटासेट को याद करना शुरू कर देता है।
  • सही संतुलन (Sweet Spot): यह एक संकीर्ण खिड़की है जहाँ मॉडल नियमों को समझता है लेकिन सबसे आम पैटर्न पर अत्यधिक निर्भर होना शुरू नहीं करता है।

संक्षेप में: डिफ्यूजन मॉडल्स (वह AI जो कई इमेज जनरेटर के पीछे है) औसत और सामान्य चीजों को पहले याद करना पसंद करते हैं। इससे एक ऐसा चरण आता है जहाँ वे विशिष्ट उदाहरणों की नकल करने से पहले उबाऊ, दोहराव वाली सामग्री का उत्पादन करते हैं। इससे बचने के लिए, आपको विविध डेटा की आवश्यकता है और प्रशिक्षण को कब रोकना है, इसके सटीक समय की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →