← नवीनतम पेपर
💬 NLP

Epidemiology of Model Collapse: Modeling Synthetic Data Contamination via Bilayer SIR Dynamics

यह शोध पत्र AI मॉडलों और डेटा कॉर्पोरा के बीच क्रॉस-कंटैमिनेशन (cross-contamination) को मॉडल करने के लिए एक द्विस्तरीय युग्मित (bilayer coupled) SIR/SIRS महामारी विज्ञान ढांचे का प्रस्ताव करता है, जो सैद्धांतिक विश्लेषण, एजेंट-आधारित सिमुलेशन और अनुभवजन्य प्रयोगों के माध्यम से यह प्रदर्शित करता है कि सिंथेटिक डेटा कंटैमिनेशन से सुपरक्रिटिकल मॉडल कोलैप्स डायनेमिक्स (supercritical model collapse dynamics) उत्पन्न होता है जहाँ डिटेक्शन-आधारित फ़िल्टरिंग सबसे प्रभावी शमन रणनीति है।

मूल लेखक: Xiangyu Wang

प्रकाशित 2026-06-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiangyu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, साझा स्विमिंग पूल है। वर्षों से, मनुष्य ही इसमें तैरते रहे हैं, छपाछप करते रहे हैं और अपने पैरों के निशान (डेटा) पीछे छोड़ते रहे हैं। अब, आर्टिफिशियल इंटेलिजेंस (AI) मॉडल इसमें कूद पड़े हैं। वे तैरना सीख रहे हैं, सीखते हैं कि कैसे हिलना-डुलना है, और फिर अपनी खुद की छपाछप बनाना शुरू कर देते हैं—सिंथेटिक टेक्स्ट, इमेज और कोड।

यहाँ समस्या यह है: जैसे-जैसे AI मॉडल बेहतर होते जा रहे हैं, वे बेहतर तरीके से तैरना सीखने के लिए उसी पूल का पानी पीना शुरू कर देते हैं। लेकिन अब, पानी में AI द्वारा बनाई गई "छपाछप" भी मिल गई है। यदि कोई AI बहुत अधिक सिंथेटिक पानी पी लेता है, तो वह अपने ही आउटपुट से घुटने लगता है। उसकी गुणवत्ता गिर जाती है, उसकी रचनात्मकता सिमट जाती है, और वह अपने ही एक 'ज़ोंबी' संस्करण में बदल जाता है। इसे "मॉडल कोलैप्स" (Model Collapse) कहा जाता है।

अधिकांश पिछले अध्ययनों ने इसे एक व्यक्ति द्वारा बार-बार एक ही कप से पानी पीने की तरह देखा। लेकिन यह शोध पत्र तर्क देता है कि वास्तविक दुनिया इस तरह काम नहीं करती है। AI इकोसिस्टम एक भीड़भाड़ वाली पार्टी की तरह है जहाँ हर कोई ड्रिंक्स साझा कर रहा है।

"वायरस" की उपमा (The "Virus" Analogy)

इस शोध के लेखकों ने इस अव्यवस्था को समझने के लिए महामारी विज्ञान (रोगों के अध्ययन) से एक उपकरण उधार लेने का निर्णय लिया। उन्होंने सिंथेटिक डेटा संदूषण (Synthetic Data Contamination) को एक वायरस की तरह माना।

उन्होंने एक दो-स्तरीय मॉडल बनाया, जो मनुष्यों और जानवरों के बीच फ्लू फैलने के समान है:

  1. लेयर 1: डेटा पूल (द "फूड")

    • ससेप्टिबल (स्वच्छ/Susceptible): ताज़ा, मानव-लिखित डेटा।
    • संक्रमित (संदूषित/Infected): AI-जनरेटेड टेक्स्ट के साथ मिला हुआ डेटा।
    • रिकवर्ड (फ़िल्टर किया हुआ/Recovered): वह डेटा जिसे डिटेक्टर्स द्वारा साफ किया गया है।
  2. लेयर 2: AI मॉडल (द "ईटर्स")

    • ससेप्टिबल (स्वस्थ/Susceptible): स्वच्छ डेटा पर प्रशिक्षित मॉडल।
    • संक्रमित (संदूषित/Infected): वे मॉडल जिन्होंने बहुत अधिक सिंथेटिक डेटा खा लिया है और अब निम्न-गुणवत्ता वाला आउटपुट दे रहे हैं।
    • रिकवर्ड (पुनः प्रशिक्षित/Recovered): वे मॉडल जिन्हें उनकी बुरी आदतों को ठीक करने के लिए स्वच्छ डेटा पर फिर से प्रशिक्षित किया गया है।

"वायरस" कैसे फैलता है:

  • एक संक्रमित मॉडल (Infected Model) खराब टेक्स्ट बनाता है और उसे डेटा पूल में डाल देता है, जिससे डेटा संक्रमित हो जाता है।
  • एक ससेप्टिबल मॉडल (Susceptible Model) उस संक्रमित डेटा पर प्रशिक्षण लेता है, और स्वयं एक संक्रमित मॉडल बन जाता है।

यह एक फीडबैक लूप है: खराब मॉडल खराब डेटा बनाते हैं, जिससे और अधिक खराब मॉडल बनते हैं।

"R0R_0" संख्या: क्या कोलैप्स फैलेगा?

रोग नियंत्रण में, वैज्ञानिक प्रकोप की भविष्यवाणी करने के लिए R0R_0 (आर-नॉट) नामक संख्या का उपयोग करते हैं।

  • यदि R0<1R_0 < 1, तो वायरस खत्म हो जाता है।
  • यदि R0>1R_0 > 1, तो वायरस फैलता है और एंडेमिक (हमेशा मौजूद) हो जाता है।

यह पेपर AI संदूषण के लिए इस R0R_0 की गणना करता है। उन्होंने पाया कि वर्तमान रुझानों के तहत, R0R_0 संभवतः 1 से अधिक है। इसका मतलब है कि "संदूषण वायरस" सुपरक्रिटिकल है—यह केवल एक अस्थायी गड़बड़ी नहीं है; यह एक निरंतर समस्या है जो तब तक फैलती रहेगी जब तक हम हस्तक्षेप नहीं करते।

यह तेज़ी से क्यों फैलता है? (सेंसिटिविटी एनालिसिस)

शोधकर्ताओं ने पूछा: इसे रोकने के लिए हम कौन सा लीवर खींच सकते हैं? उन्होंने विभिन्न कारकों का परीक्षण किया:

  • नया डेटा कितनी तेज़ी से बनाया जा रहा है?
  • मॉडल्स को कितनी तेज़ी से रिटायर (सेवामुक्त) किया जा रहा है?
  • हम AI टेक्स्ट को पहचानने में कितने अच्छे हैं?

विजेता: सबसे शक्तिशाली कारक γD\gamma_D (डेटा डिटेक्शन/फ़िल्टरिंग) है।
इसे डेटा पूल के इम्यून सिस्टम (प्रतिरक्षा प्रणाली) के रूप में समझें। यदि आपके पास AI-जनरेटेड टेक्स्ट का पता लगाने और उसे हटाने के बेहतर उपकरण हैं, तो आप प्रसार को नाटकीय रूप रूप से कम कर देते हैं। अन्य कारक, जैसे कि मॉडल कितनी बार अपडेट किए जाते हैं, बहुत कम मायने रखते हैं।

प्रयोग: क्या उन्होंने इसका परीक्षण किया?

हाँ। उन्होंने केवल गणित नहीं किया; उन्होंने एक छोटे AI मॉडल (GPT-2) के साथ वास्तविक प्रयोग किए।

  1. "जहरीला कुआँ" टेस्ट (The "Poisoned Well" Test): उन्होंने बढ़ते हुए AI-जनरेटेड टेक्स्ट (0% से 100% तक) वाले डेटा पर मॉडल्स को प्रशिक्षित किया।

    • परिणाम: जैसे-जैसे "ज़हर" (सिंथेटिक डेटा) बढ़ा, मॉडल की गुणवत्ता तेजी से गिरी। 100% सिंथेटिक डेटा पर, मॉडल लगभग बेकार हो गया। इसने "डोज़-रिस्पॉन्स" विचार की पुष्टि की: अधिक संदूषण = खराब कोलैप्स।
  2. "विविध स्रोत" टेस्ट (The "Diverse Sources" Test): उन्होंने एक आशावादी प्रश्न पूछा: यदि हम कई अलग-अलग AI मॉडल्स (केवल एक के बजाय) से डेटा मिलाते हैं, तो क्या इससे मदद मिलती है? शायद विविधता एक बफर का काम करे?

    • परिणाम: जब संदूषण 100% था, तब इसने बहुत थोड़ी मदद की, लेकिन जब संदूषण वास्तविक स्तर (50%) पर था, तो इसने कुछ भी नहीं किया।
    • सीख: स्रोतों को मिलाने पर भरोसा न करें। यदि पानी गंदा है, तो उसे दूसरे गंदे पानी के साथ मिलाने से वह साफ नहीं होगा। आपको उसे फ़िल्टर करने की आवश्यकता है।

मुख्य निष्कर्ष (The Bottom Line)

इस पेपर का मुख्य संदेश सरल है:

  1. AI संदूषण एक महामारी की तरह है। यह मॉडल्स और डेटा के बीच एक चक्र में फैलता है।
  2. यह वर्तमान में फैल रहा है। गणित बताता है कि हम "सुपरक्रिटिकल" ज़ोन में हैं जहाँ संदूषण बना रहेगा।
  3. सबसे अच्छा इलाज डिटेक्शन (पहचान) है। मॉडल कोलैप्स को रोकने का सबसे प्रभावी तरीका अपने डेटा स्रोतों में विविधता लाना नहीं है, बल्कि बेहतर फ़िल्टर बनाना है जो ट्रेनिंग डेटा से AI-जनरेटेड कंटेंट का पता लगा सके और उसे हटा सके।
  4. प्रतिरोधक क्षमता कम होती है। भले ही आप आज डेटा को साफ कर दें, यह कल फिर से संदूषित हो सकता है। आपको निरंतर सतर्कता (जैसे वैक्सीन बूस्टर) की आवश्यकता है, न कि केवल एक बार के समाधान की।

संक्षेप में: यदि आप चाहते हैं कि AI स्मार्ट बना रहे, तो आपको उसका आहार स्वच्छ रखना होगा। और ऐसा करने का सबसे अच्छा तरीका यह है कि सिंथेटिक कचरे को खाने से पहले उसे पहचानने में बहुत माहिर हो जाना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →