← नवीनतम पेपर
💻 computer science

Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings

यह शोध पत्र प्रकट करता है कि स्टेबल डिफ्यूजन (Stable Diffusion) में रटंत विद्या (memorization) अप्रत्याशित रूप से पैडिंग टोकन में एंड-ऑफ-टेक्स्ट (end-of-text) एम्बेडिंग के संरचनात्मक दोहराव द्वारा संचालित होती है, जो इसके प्रभाव को बढ़ा देती है, और यह छवि की गुणवत्ता को कम किए बिना इस समस्या को कम करने के लिए सरल इन्फरेंस-टाइम (inference-time) रणनीतियों का प्रस्ताव करता है।

मूल लेखक: Bumjun Kim, Albert No

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bumjun Kim, Albert No

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Memorization In Stable Diffusion Is Unexpectedly Driven by CLIP Embeddings" का सरल अवधारणाओं और उपमाओं के साथ विवरण दिया गया है।

बड़ी समस्या: मॉडल अपनी यादों पर "अटक" जाता है

कल्पना कीजिए कि एक प्रतिभाशाली कलाकार (Stable Diffusion) है जिसे लाखों तस्वीरों पर प्रशिक्षित किया गया है। कभी-कभी, जब आप इस कलाकार से कुछ नया बनाने के लिए कहते हैं, तो वह अनजाने में अपने प्रशिक्षण सेट की एक विशिष्ट फोटो को बिल्कुल वैसा ही, पिक्सेल-दर-पिक्सेल कॉपी कर देता है। इसे मेमोराइजेशन (याद करना/रटना) कहा जाता है। यह गोपनीयता और कॉपीराइट के लिए एक जोखिम है क्योंकि मॉडल कुछ नया नहीं बना रहा है; वह बस पुराने डेटा को दोहरा रहा है।

वैज्ञानिक यह समझने की कोशिश कर रहे हैं कि ऐसा क्यों होता है। अधिकांश सिद्धांतों ने आपके द्वारा लिखे गए शब्दों (प्रॉम्ट) या मॉडल के आंतरिक गणित पर ध्यान केंद्रित किया। हालाँकि, इस शोध पत्र ने पाया कि एक आश्चर्यजनक अपराधी निर्देशों के "पैडिंग" (खाली जगह भरने) में छिपा हुआ है।

सेटअप: कलाकार निर्देशों को कैसे पढ़ता है

इस खोज को समझने के लिए, हमें यह देखना होगा कि कलाकार आपके निर्देशों को कैसे पढ़ता है।

  1. प्रॉम्ट (Prompt): आप "A cat on a mat" जैसा एक वाक्य टाइप करते हैं।
  2. सीमा (Limit): कलाकार केवल एक निश्चित लंबाई तक के निर्देश पढ़ सकता है (77 "टोकन" या शब्द-हिस्से)।
  3. फिलर (Filler): यदि आपका वाक्य छोटा है (जैसे, केवल 10 शब्द), तो कंप्यूटर को 77 की सीमा तक पहुँचने के लिए शेष 67 खाली स्थानों को भरना पड़ता है।

पुराना तरीका (Stable Diffusion v1.4):
कंप्यूटर उन खाली स्थानों को एक विशेष "End of Text" टोकन (मान लीजिए <eot>) से भर देता है।

  • उपमा: कल्पना कीजिए कि आप एक कहानी पढ़ रहे हैं, लेकिन अंतिम पृष्ठ खाली है। खाली छोड़ने के बजाय, प्रिंटर उस खाली जगह को भरने के लिए बार-बार "THE END" शब्द को स्टैम्प करता रहता है।
  • इसलिए, एक छोटे प्रॉम्ट के लिए, कलाकार देखता है: [आपके शब्द] + [THE END] + [THE END] + [THE END]... (60+ बार दोहराव)।

खोज: "इको चैंबर" (गूँज का कमरा) प्रभाव

शोधकर्ताओं ने पाया कि कलाकार इन बार-बार आने वाले "THE END" स्टैम्प्स पर बहुत अधिक निर्भर करता है, खासकर तब जब वह छवियों को याद (memorize) कर रहा होता है।

उन्होंने यहाँ घटनाओं की एक श्रृंखला देखी:

  1. प्रशिक्षण विसंगति (Training Mismatch): शब्दों को गणित में बदलने वाला सिस्टम (जिसे CLIP कहा जाता है) को इस तरह प्रशिक्षित किया गया था कि वह पूरे वाक्य के सबसे महत्वपूर्ण सारांश के रूप में पहले "THE END" टोकन को मानता था। इसने वास्तविक शब्दों और फिलर टोकन को अनदेखा करना सीख लिया था।
  2. ग्लिच (Glitch): क्योंकि कंप्यूटर खाली जगह को और अधिक "THE END" टोकन से भर देता है, कलाकार अचानक दर्जनों बार दोहराए गए "THE END" टोकन को देखता है।
  3. प्रवर्धन (Amplification): कलाकार सोचता है, "वाह, यहाँ इतने सारे 'THE END' टोकन हैं! इसका मतलब है कि यह निर्देश का सबसे महत्वपूर्ण हिस्सा है!"
  4. परिणाम: मॉडल इस दोहराए गए टोकन पर अत्यधिक ध्यान केंद्रित करने लगता है। यदि वह विशिष्ट "THE END" पैटर्न प्रशिक्षण के दौरान किसी विशिष्ट कॉपीराइट वाली छवि से जुड़ा था, तो मॉडल एक लूप में फंस जाता है और आपके वास्तविक अनुरोध को अनदेखा करते हुए ठीक उसी छवि को दोबारा बना देता है।

रूपक (Metaphor):
एक गायक मंडली (choir) की कल्पना करें जहाँ कंडक्टर (मॉडल) को एक सोलोइस्ट (आपका प्रॉम्ट) को सुनने के लिए कहा जाना चाहिए। लेकिन, गायक मंडली के सदस्य बार-बार "रुको!" (पैडिंग टोकन) चिल्ला रहे हैं। कंडक्टर चिल्लाहट से इतना अभिभूत हो जाता है कि वह सोलोइस्ट को सुनना बंद कर देता है और केवल "रुको!" के आदेशों के आधार पर गोल-गोल घूमने लगता है। यदि "रुको!" का आदेश पहले किसी विशिष्ट नृत्य की मुद्रा से जुड़ा था, तो गायक मंडली संगीत को अनदेखा कर केवल वही नृत्य दोहराती है।

आश्चर्यजनक मोड़: शब्दों का महत्व कम हो जाता है

लेखकों ने वास्तविक शब्दों को हटाकर और उन्हें "End" टोकन से बदलकर इसका परीक्षण किया।

  • परिणाम: मॉडल अभी भी एक पहचानने योग्य छवि बना सका।
  • निष्कर्ष: आपके द्वारा टाइप किए गए वास्तविक शब्द (प्रॉम्ट) मेमोराइजेशन की प्रक्रिया में बहुत कम योगदान देते हैं। "फिलर" टोकन ही इस नकल करने वाले व्यवहार का मुख्य भार उठा रहे हैं।

समाधान: दो सरल सुधार

शोध पत्र इस समस्या को रोकने के दो आसान तरीके प्रस्तावित करता है, जिससे पूरे मॉडल को फिर से प्रशिक्षित करने या धीमा करने की आवश्यकता नहीं है। दोनों "इन्फरेंस-टाइम" (inference-time) सुधार हैं, जिसका अर्थ है कि आप छवि उत्पन्न करने से ठीक पहले इन्हें लागू कर सकते हैं।

सुधार 1: फिलर टोकन बदलें

  • कार्रवाई: खाली स्थान को "THE END" (<eot>) से भरने के बजाय, उसे एक तटस्थ प्रतीक जैसे विस्मयादिबोधक चिह्न (!) से बदल दें।
  • यह क्यों काम करता है: यह इको चैंबर को तोड़ देता है। मॉडल अब "THE END" टोकन की 60 कॉपियाँ नहीं देखता। वह एक तटस्थ प्रतीक देखता है जिसमें उतना भारी वजन नहीं होता।
  • बोनस: अतिरिक्त सुरक्षा के लिए वे एकल मूल "End" टोकन को भी छिपा (mask) देते हैं।

सुधार 2: फिलर को म्यूट (Mute) करें

  • कार्रवाई: टोकन को वैसा ही रहने दें, लेकिन बस दोहराए गए "End" टोकनों की आवाज़ (volume) को कम कर दें (mask) ताकि मॉडल उन पर कम ध्यान दे।
  • यह क्यों काम करता है: यह टोकनाइज़र को बदले बिना, दोहराव के प्रभाव को कम करता है।

प्रमाण: वर्जन 2.1 बेहतर क्यों है?

लेखकों ने देखा कि Stable Diffusion v2.1 (एक नया संस्करण) में यह मेमोराइजेशन की समस्या उतनी गंभीर नहीं है।

  • क्यों? पता चला कि v2.1 के रचनाकारों ने अनजाने में इस समस्या को ठीक कर दिया था। उन्होंने एक अलग टेक्स्ट सिस्टम (OpenCLIP) पर स्विच कर दिया जो पैडिंग के लिए "THE END" को दोहराने के बजाय एक तटस्थ प्रतीक का उपयोग करता है।
  • सीख: यह तथ्य कि v2.1 ने स्वाभाविक रूप से इतनी अधिक मेमोराइजेशन को रोक दिया, यह साबित करता है कि "दोहराया गया End टोकन" ही समस्या का मुख्य कारण था।

सारांश

  • समस्या: Stable Diffusion कभी-कभी प्रशिक्षण छवियों की हूबहू नकल करता है।
  • कारण: छोटे प्रॉम्ट्स को बार-बार आने वाले "End of Text" टोकन से भरा जाता है। मॉडल इन दोहराए गए टोकनों को निर्देश का सबसे महत्वपूर्ण हिस्सा समझ लेता है, जिससे वह विशिष्ट छवियों को "ओवरफिट" और मेमोराइज़ कर लेता है।
  • सुधार: फिलर टोकन को किसी तटस्थ चीज़ (जैसे !) से बदलें या दोहराए गए टोकनों को म्यूट करें। यह छवि की गुणवत्ता बनाए रखते हुए मेमोराइजेशन को रोकता है।
  • लाभ: आप बिना AI को फिर से प्रशिक्षित किए या जोखिम भरी छवियों का पता लगाए, इस सुधार का तुरंत उपयोग कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →