← नवीनतम पेपर
🤖 machine learning

Destruction is a General Strategy to Learn Generation; Diffusion's Strength is to Take it Seriously; Exploration is the Future

यह शोधपत्र डिफ्यूजन मॉडल्स को विनाश के माध्यम से सूचना रोकने की एक लचीली रणनीति के रूप में पुनर्गठित करता है, डेटा-दुर्लभ सेटिंग्स में उनकी क्षमता का तर्क देता है, और एक डिफ्यूजन-नेटिव ढांचे के भीतर अन्वेषण चुनौतियों को संबोधित करने के लिए भविष्य की दिशाओं का पता लगाता है।

मूल लेखक: Pierre-André Noël

प्रकाशित 2026-06-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pierre-André Noël

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पियरे-आंद्रे नोएल के ब्लॉग पोस्ट का हिंदी अनुवाद दिया गया है:

मुख्य विचार: चीजों को तोड़कर सीखना

कल्पना कीजिए कि आप एक रोबोट को एक आदर्श लैंडस्केप (प्राकृतिक दृश्य) पेंट करना सिखाना चाहते हैं।

  • पुराना तरीका (ऑटोरेग्रेसिव): आप रोबोट को एक खाली कैनवास दिखाते हैं और कहते हैं, "पहले आसमान पेंट करो, फिर पहाड़, फिर पेड़।" उसे केवल उसी के आधार पर अगला ब्रशस्ट्रोक अनुमान लगाना होता है जो उसने पहले ही पेंट कर लिया है। यह एक घर को ईंट-दर-ईंट, एक बार में एक करके बनाने जैसा है।
  • पेपर का विचार (डिफ्यूजन): निर्माण करने के बजाय, आप एक तैयार पेंटिंग से शुरुआत करते हैं और उसे कीचड़ से पोत देते हैं जब तक कि वह सिर्फ एक भूरा धब्बा न बन जाए। फिर, आप रोबोट को उस कीचड़ वाले धब्बे को देखने और यह अनुमान लगाने के लिए सिखाते हैं कि उसके नीचे की साफ पेंटिंग कैसी दिखती थी। आप इसे बार-बार करते हैं, थोड़े से कीचड़ से शुरू करते हैं और बहुत अधिक कीचड़ तक समाप्त करते हैं, जब तक कि रोबोट कीचड़ लगाने की प्रक्रिया को पूरी तरह से उलटने (reverse) में माहिर न हो जाए।

लेखक इसे "विनाश द्वारा सीखना" (Learning by Destroying) कहते हैं। मुख्य तर्क यह है कि जानकारी को जानबूझकर "नष्ट" करके (पेंटिंग को पोतना, शब्दों को छिपाना, या डेटा को अस्त-व्यस्त करना) और एआई को यह अनुमान लगाने के लिए मजबूर करके कि क्या खो गया था, मॉडल बेहतर सीखता है, खासकर तब जब उसके पास शुरुआत में बहुत अधिक ट्रेनिंग डेटा नहीं होता।


भाग 1: थीसिस (क्यों?)

1. विनाश एक सामान्य रणनीति है
लेखक का तर्क है कि लगभग सभी आधुनिक एआई लर्निंग वास्तव में "पहेली के एक टुकड़े को छिपाने और छात्र को उसे भरने के लिए कहने" का एक शानदार संस्करण है।

  • सुपरवाइज्ड लर्निंग: उत्तर कुंजी (लेबल) को छिपा देना।
  • लैंग्वेज मॉडल्स: अगले शब्द को छिपा देना।
  • डिफ्यूजन मॉडल्स: इमेज को शोर (noise) में बदलकर मूल इमेज को छिपा देना।

2. डिफ्यूजन क्यों विशेष है (द "मेसी" एडवांटेज)
अधिकांश एआई मॉडल बहुत व्यवस्थित होने के लिए प्रशिक्षित होते हैं। वे जानकारी को एक सख्त, अनुमानित क्रम में नष्ट करते हैं (जैसे बाएं से दाएं किताब पढ़ना)।

  • उपमा: कल्पना कीजिए कि आप एक रेसिपी सीखने की कोशिश कर रहे हैं।
    • स्टैंडर्ड एआई: आप रेसिपी को चरण-दर-चरण पढ़ते हैं। यदि आप एक चरण चूक जाते हैं, तो आप पीछे नहीं जा सकते।
    • डिफ्यूजन एआई: शेफ सभी सामग्रियों को एक ब्लेंडर में डाल देता है, उन्हें स्मूदी में मिला देता है, और आपसे मूल रेसिपी का अनुमान लगाने के लिए कहता है। फिर, वे इसे फिर से ब्लेंड करते हैं, लेकिन इस बार वे गाजर का एक छोटा टुकड़ा दिखाई देने देते हैं।
  • लाभ: क्योंकि डिफ्यूजन मॉडल इस "मेसी" (अव्यवस्थित) प्रक्रिया पर प्रशिक्षित होते हैं—यानी चित्र के हिस्सों का रैंडम क्रम में अनुमान लगाना, न कि केवल बाएं-से-दाएं—वे अधिक लचीले बन जाते हैं। लेखक का सुझाव है कि जब डेटा कम होता है (जैसे कि सीखने के लिए बहुत कम फोटो होना), तो यह "मेसी" ट्रेनिंग एआई को उन सूक्ष्म बारीकियों को पकड़ने में मदद करती है जिन्हें कठोर, व्यवस्थित मॉडल छोड़ देते हैं।

3. एक्सप्लोरेशन की समस्या (द "रिवॉर्ड" ट्रैप)
पेपर एक पेचीदा समस्या पर चर्चा करता है जब हम एआई को "रीइन्फोर्समेंट लर्निंग" (जहाँ एआई को अच्छा काम करने के लिए अंक मिलते हैं) के साथ मिलाते हैं।

  • समस्या: मानक एआई में, हमें पता होता है कि घटनाओं का एक विशिष्ट क्रम कितना संभावित है। डिफ्यूजन में, क्योंकि एआई किसी भी क्रम में चित्र का अनुमान लगा सकता है, यह जानना कठिन है कि एआई ने सही उत्तर इसलिए दिया क्योंकि वह स्मार्ट था, या सिर्फ इसलिए क्योंकि उसने भाग्य से सही क्रम का अनुमान लगा लिया।
  • लेखक का दृष्टिकोण: हम शायद एआई को "चीटिंग" करना सिखा रहे हैं, जहाँ हम उसे अंतिम परिणाम के लिए पुरस्कृत करते हैं बिना इस बात की परवाह किए कि वह वहां तक पहुँचने के लिए किस रास्ते पर चला। लेखक का सुझाव है कि हमें सावधान रहने की आवश्यकता है और शायद "रिवॉर्ड" को एक फिल्टर के रूप में मानना चाहिए (केवल एआई को सबसे अच्छे परिणाम दिखाना) न कि एक नए पथ के मार्गदर्शक के रूप में।

भाग 2: ट्यूटोरियल (डायग्राम के साथ "कैसे")

पेपर का दूसरा भाग यह समझाने के लिए डायग्राम का उपयोग करता है कि जानकारी को कैसे नष्ट और पुनर्गठित किया जाता है। यहाँ तीन मुख्य रूपक (metaphors) दिए गए हैं:

1. द "मैश" (विभाजित और जीतना - Divide-and-Conquer)

  • अवधारणा: कल्पना कीजिए कि आपके पास एक गुप्त कोड है। आप इसे एक दोस्त को भेजते हैं, लेकिन आप दो अलग-अलग कोड को एक में "मैश" (मिला) देते हैं।
  • परिणाम: आपका दोस्त मैश किया हुआ कोड देखता है और बता नहीं पाता कि वह किस मूल कोड से आया था। जानकारी नष्ट हो गई है।
  • पाठ: यदि आप चीजों को आपस में मिलाते रहते हैं जब तक कि सब कुछ एक जैसा (एक सिंगलटन) न दिखने लगे, तो आपने सारी जानकारी नष्ट कर दी है। एआई का काम इसे "अन-मैश" (Un-mash) करना सीखना है।
    • स्टैंडर्ड एआई: वाक्य के अंत से आखिरी शब्द को हटा देता है।
    • डिफ्यूजन एआई: वाक्य में से रैंडम शब्द निकाल देता है, जिससे एक अराजक स्थिति पैदा होती है जिसे एआई को साफ करना पड़ता है।

2. द "शफल" (शोर/नॉइज़)

  • अवधारणा: कल्पना कीजिए कि आपके पास ताश की एक गड्डी है। आप उन्हें फेंटते (shuffle) हैं, लेकिन आप इसमें दूसरे डेक के कुछ अतिरिक्त, नकली कार्ड भी जोड़ देते हैं।
  • परिणाम: मूल क्रम खो गया है (नष्ट हो गया), लेकिन नकली कार्ड (शोर) जोड़ दिए गए हैं।
  • पाठ: यह एक इमेज में "गॉसियन नॉइज़" (स्टैटिक) जोड़ने जैसा है। मूल इमेज रैंडम स्टैटिक के नीचे दब जाती है। एआई स्टैटिक को छानकर उसके नीचे छिपी इमेज को ढूंढना सीखता है। लेखक नोट करते हैं कि यह "शफलिंग" जानकारी को नष्ट करने का एक बहुत ही "ऑर्गेनिक" तरीका है, जो सख्त "मैश" के विपरीत है।

3. द "कम्यूटेटिव डायग्राम" (मानचित्र)

  • अवधारणा: लेखक इन एआई प्रक्रियाओं के लिए मानचित्र बनाने का एक नया तरीका पेश करते हैं।
  • उपमा: एक सबवे मैप के बारे में सोचें।
    • स्टैंडर्ड एरो (तीर): ये ट्रेन की पटरियों की तरह हैं। यदि आप स्टेशन A से B पर जाते हैं, तो आपको B पर ही पहुँचना होगा। (डिटरमिनिस्टिक)।
    • हारपून एरो (हरपून तीर): ये "शायद" वाले रास्तों की तरह हैं। यदि आप स्टेशन A से B पर जाते हैं, तो आप B पर पहुँच सकते हैं, या आप C पर भी पहुँच सकते हैं, यह एक कॉइन टॉस (सिक्का उछालने) पर निर्भर करता है। (प्रोबेबिलिस्टिक)।
  • बिंदु: ये डायग्राम यह विज़ुअलाइज़ करने में मदद करते हैं कि सूचना कैसे प्रवाहित होती है, नष्ट होती है और पुनर्जीवित होती है। वे दिखाते हैं कि जानकारी को "नष्ट" करना (अभिसरण पथ/converging paths) और जानकारी को "जेनरेट" करना (अपसरण पथ/diverging paths) एक ही सिक्के के दो पहलू हैं।

निष्कर्ष

लेखक यह दावा नहीं करते कि उन्होंने हर समस्या को हल कर लिया है। इसके बजाय, वे एक नए दिशा में इशारा कर रहे हैं:

  1. विनाश एक शक्तिशाली उपकरण है: हमें जानकारी को नष्ट करने के "मेसी" तरीकों (जैसे डिफ्यूजन) को अपनाना चाहिए, न कि केवल साफ-सुथरे, व्यवस्थित तरीकों पर टिके रहना चाहिए।
  2. डेटा की कमी: यह दृष्टिकोण एआई को तब सिखाने की कुंजी हो सकता है जब हमारे पास भारी मात्रा में डेटा नहीं होता।
  3. भविष्य का अन्वेषण: हमें यह पता लगाने की आवश्यकता है कि इस "मेसी" लर्निंग को "रिवॉर्ड-बेस्ड" लर्निंग (रीइन्फोर्समेंट लर्निंग) के साथ गणित को तोड़े बिना कैसे जोड़ा जाए।

संक्षेप में: पेपर सुझाव देता है कि मशीन को रचना (create) सिखाने के लिए, हमें पहले उसे चीजों को "अन-ब्रेक" (un-break) करना सिखाना चाहिए, और जितना अधिक "मेसी" तरीके से चीजें टूटेंगी, मशीन उतनी ही स्मार्ट हो सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →