← नवीनतम पेपर
🤖 machine learning

Criticality in Dissimilar Decomposition and Undersampling of Random Datasets with Anomalies

यह शोध पत्र रेडंडेंसी ग्राफ का उपयोग करके यह जांच करता है कि एआई-जनित विसंगतियां (anomalies) यादृच्छिक डेटासेट को कैसे प्रभावित करती हैं, जो अत्यधिक असंगत अपघटन (strongly dissimilar decompositions) के न्यूनतम आकार में एक चरण संक्रमण (phase transition) को प्रदर्शित करता है, जहाँ डेटासेट की संरचना मुख्य डेटा बिंदुओं से निर्धारित होने के बजाय एक महत्वपूर्ण सीमा तक पहुँचने के बाद विसंगतियों द्वारा नियंत्रित होने लगती है।

मूल लेखक: Ghurumuruhan Ganesan

प्रकाशित 2026-09-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ghurumuruhan Ganesan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक मॉडल की बुद्धिमत्ता की गुणवत्ता उस डेटा की गुणवत्ता से अटूट रूप से जुड़ी होती है जिसका उपयोग उसे सिखाने के लिए किया जाता है। एक छात्र की कल्पना करें जो किसी विषय को सीखने का प्रयास कर रहा है; यदि उसकी पाठ्यपुस्तकें त्रुटियों, विरोधाभासों या दोहराव वाले निरर्थक विवरणों से भरी हैं, तो उसकी समझ दोषपूर्ण होगी। आज, जब हम विशाल भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) को लिखने, तर्क करने और सृजन करने के लिए प्रशिक्षित कर रहे हैं, ये प्रणालियाँ टेक्स्ट और छवियों के विशाल महासागरों का उपभोग कर रही हैं। शोधकर्ताओं के लिए एक बढ़ती चिंता यह है कि इंटरनेट स्वयं आर्टिफिशियल इंटेलिजेंस द्वारा उत्पन्न सामग्री से संतृप्त हो रहा है। यह एक फीडबैक लूप बनाता है जहाँ भविष्य के मॉडल पिछले मॉडलों द्वारा उत्पादित डेटा पर प्रशिक्षित होते हैं। मुख्य चुनौती यह समझना है कि "सिंथेटिक" या एआई-जनित डेटा का यह प्रवाह, जो एक विशिष्ट प्रकार के विसंगति (एनोमली) के रूप में कार्य करता है, सूचना को व्यवस्थित करने और संसाधित करने के हमारे तरीके को कैसे बाधित करता है। विशेष रूप से, वैज्ञानिक यह जानना चाहते हैं कि इन विशाल डेटासेट्स को प्रशिक्षण के लिए छोटे, प्रबंधनीय समूहों में कैसे विभाजित किया जाए, यह सुनिश्चित करते हुए कि प्रत्येक समूह में कुछ नया सिखाने के लिए पर्याप्त विविधता हो, बिना सिंथेटिक डेटा द्वारा पेश किए गए अजीब पैटर्न से अभिभूत हुए।

ब्रिस्टल विश्वविद्यालय की एक शोधकर्ता, घुुरुमुरहन गेनेसन ने इस समस्या का समाधान इस रूप में किया कि डेटासेट को बिंदुओं के एक संग्रह के रूप में देखा जा सकता है जो या तो समान या भिन्न हो सकते हैं, और या तो जुड़े हुए या बिना जुड़े हो सकते हैं। इस संदर्भ में, "समानता" (सिमिलैरिटी) का अर्थ है कि दो डेटा के टुकड़े एक-दूसरे के कितने समान दिखते हैं, जबकि "लिंकेज" (जुड़ाव) उनके बीच एक छिपे हुए संबंध का वर्णन करता है, जो अक्सर उनके स्रोत पर आधारित होता है। उदाहरण के लिए, एआई-जनित टेक्स्ट मानव-लिखित टेक्स्ट से बहुत अलग दिख सकता है, लेकिन यह मानव डेटा से "लिंक्ड" है क्योंकि इसे उसी अंतर्निदम मॉडल का उपयोग करके बनाया गया था। शोधकर्ता ने मानव और एआई डेटा के मिश्रित डेटासेट को ऐसे समूहों में विभाजित करने की जांच की जहाँ प्रत्येक आइटम दूसरों से विशिष्ट है और उनसे जुड़ा हुआ नहीं है। लक्ष्य इस अलगाव को प्राप्त करने के लिए आवश्यक समूहों की न्यूनतम संख्या खोजना था, जो प्रशिक्षण प्रक्रिया की दक्षता निर्धारित करने वाला एक मीट्रिक है।

अध्ययन यह प्रकट करता है कि जैसे-जैसे एआई-जनरेटेड सामग्री की मात्रा बढ़ती है, इन डेटासेट्स के व्यवहार में एक आश्चर्यजनक और तीव्र बदलाव आता है। जब सिंथेटिक विसंगतियों की संख्या कम होती है, तो डेटा को व्यवस्थित करने की कठिनाई लगभग पूरी तरह से मूल, मानव-जनित बिंदुओं द्वारा निर्धारित होती है। प्रणाली इस तरह व्यवहार करती है जैसे विसंगतियाँ लगभग मौजूद ही नहीं हैं, और आवश्यक समूहों की संख्या स्थिर रहती है। हालाँकि, शोध एक विशिष्ट थ्रेशोल्ड (सीमा) की पहचान करता है जहाँ यह गतिशीलता बदल जाती है। एक बार जब विसंगतियों की संख्या इस रेखा को पार कर जाती है, तो डेटा को व्यवस्थित करने का कार्य मौलिक रूप से बदल जाता है। भले ही सिंथेटिक डेटा कुल संग्रह का एक बहुत छोटा हिस्सा ही क्यों न हो, यह अचानक प्रमुख कारक बन जाता है। डेटा को विशिष्ट रखने के लिए आवश्यक समूहों की न्यूनतम संख्या अब मानव डेटा द्वारा निर्धारित नहीं होती है, बल्कि विसंगतियों द्वारा निर्देशित होती है। यह सुझाव देता है कि सिंथेटिक डेटा की एक छोटी मात्रा भी, यदि वह शेष डेटासेट के साथ अत्यधिक जुड़ी हुई है, तो डेटा को संभालने के तरीके में पूर्ण पुनर्गठन करने के लिए मजबूर कर सकती है, जिससे प्रशिक्षण उम्मीद से कहीं अधिक कम कुशल हो सकता है।

इन निष्कर्षों तक पहुँचने के लिए, लेखक ने डेटा को रेखाओं द्वारा जुड़े बिंदुओं के नेटवर्क के रूप में देखने वाली एक विधि का उपयोग किया। यदि दो डेटा बिंदु बहुत अधिक समान या बहुत निकटता से जुड़े हैं, तो एक रेखा उन्हें जोड़ती है। समस्या फिर इन बिंदुओं को ऐसे समूहों में बांटने की बन जाती है जहाँ कोई भी दो बिंदु एक ही समूह में एक रेखा साझा नहीं करते हैं। शोधकर्ता ने विभिन्न स्थितियों के तहत इन समूहों के आकार का अनुमान लगाने के लिए कठोर गणितीय तकनीकों को लागू किया। परिणाम दिखाते हैं कि उन डेटासेट्स के लिए जहाँ संभावित डेटा का कुल स्थान स्वयं डेटासेट की तुलना में बहुत बड़ा है—जो शब्दों या इमेज टैग जैसे श्रेणीबद्ध डेटा के साथ एक सामान्य परिदृश्य है—डेटा संगठन का यह संक्रमण (ट्रांजिशन) अचानक होता है। अध्ययन सटीक सीमाएँ प्रदान करता है कि यह स्विच कब होता है, जिससे यह भविष्यवाणी करने का एक तरीका मिलता है कि कब एक डेटासेट सिंथेटिक लिंक्स से इतना दूषित हो गया है कि उसे विशेष हैंडलिंग के बिना कुशलतापूर्वक संसाधित नहीं किया जा सकता।

पेपर ने यह भी पता लगाया कि क्या होता है जब शोधकर्ता प्रशिक्षण के लिए डेटा के एक छोटे उपसमुच्चय (सबसेट) को यादृच्छिक रूप से चुनते हैं, जिसे 'अंडरसैंपलिंग' के रूप में जाना जाता है। निष्कर्ष संकेत देते हैं कि यदि सैंपल का आकार एक निश्चित महत्वपूर्ण सीमा से नीचे रखा जाता है, तो यादृच्छिक रूप से चुना गया डेटा लगभग निश्चित रूप से विशिष्ट और बिना जुड़ा हुआ रहेगा, जिससे प्रशिक्षण बैच की अखंडता बनी रहेगी। हालाँकि, यदि सैंपल का आकार इस सीमा से आगे बढ़ता है, तो गलती से जुड़े या समान बिंदुओं को शामिल करने की संभावना तेजी से बढ़ जाती है, जिससे बैच अपनी विविधता खो देता है। यह महत्वपूर्ण आकार विसंगतियों की संख्या पर बहुत अधिक निर्भर करता; कुछ विसंगतियाँ भी उस थ्रेशोल्ड को कम कर सकती हैं जिस पर डेटा "अव्यवस्थित" हो जाता है।

अंततः, यह कार्य एआई-जनित सामग्री के युग में डेटा संगठन की नाजुकता को समझने के लिए एक सैद्धांतिक ढांचा प्रदान करता है। यह प्रदर्शित करता है कि विसंगतियों की उपस्थिति केवल मात्रा का मामला नहीं है बल्कि कनेक्टिविटी (जुड़ाव) का मामला है। अत्यधिक जुड़े हुए सिंथेटिक बिंदुओं की एक छोटी संख्या पूरे डेटासेट पर असमान प्रभाव डाल सकती है, जिससे डेटा को विघटित करने के तरीके में एक 'फेज ट्रांजिशन' (अवस्था परिवर्तन) आता है। अगली पीढ़ी का आर्टिफिशियल इंटेलिजेंस बनाने वालों के लिए, ये निष्कर्ष एक चेतावनी के रूप में कार्य करते हैं: एआई-जनित डेटा की मात्र उपस्थिति, भले ही वह कम मात्रा में हो, प्रशिक्षण के गणितीय परिदृश्य को मौलिक रूप से बदल सकती है, जिसके लिए यह सुनिश्चित करने हेतु नई रणनीतियों की आवश्यकता है कि मॉडल एक ऐसी दुनिया से प्रभावी ढंग से सीख सकें जो तेजी से अपने ही प्रकार के अस्तित्व से भरी जा रही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →