← नवीनतम पेपर
💻 computer science

Robust Score-Based Generative Modelling withTsallis–Gaussian Perturbations

यह शोध पत्र हैवी-टेल्ड डेटा और संदूषण के प्रभाव को प्रभावी ढंग से कम करने के साथ-साथ प्रतिस्पर्धी जनरेटिव प्रदर्शन बनाए रखने के लिए टैलिस-गॉसियन (Tsallis–Gaussian) विक्षोभ और एक डुअल-हेड न्यूरल आर्किटेक्चर का उपयोग करके एक सुदृढ़ स्कोर-आधारित जनरेटिव मॉडलिंग फ्रेमवर्क प्रस्तावित करता है।

मूल लेखक: Shenghan Gao, Spiridon Penev, Libo Li

प्रकाशित 2026-07-15
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shenghan Gao, Spiridon Penev, Libo Li

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पेंटिंग करना, शेयर बाजार की गिरावट का पूर्वानुमान लगाना या नए रासायनिक यौगिकों का आविष्कार करना सिखाने की कोशिश कर रहे हैं। रोबोट वास्तविक उदाहरणों को देखकर सीखता है, लेकिन इसकी एक कठिन आदत है: यह "शोर" (noise) या अजीबोगरीब बाहरी डेटा (outliers) से आसानी से भ्रमित हो जाता है। यदि आप इसे एक बिल्ली की तस्वीर दिखाते हैं जिसके बीच में एक विशाल, चमकता हुआ बैंगनी वर्ग (square) है, तो एक मानक रोबोट उस अजीब वर्ग से इतना विचलित हो सकता है कि वह बिल्ली बनाना ही भूल जाए।

यह शोध पत्र इन रोबोट्स को सिखाने का एक नया तरीका पेश करता है, जिसे TSMLD (Tsallis Score-Based Generative Modelling with Langevin Dynamics) कहा जाता है। इसे एक रोबोट को "स्मार्ट नॉइज़-कैंसलिंग हेडफ़ोन" और एक "लचीला रूलर" देने के रूप में समझें, ताकि वह अव्यवस्थित, वास्तविक दुनिया के डेटा से बिना विचलित हुए सीख सके।

समस्या: "गौसियन" (Gaussian) जाल

अधिकांश वर्तमान रोबोट पेंटर्स Gaussian (या "बेल कर्व") शोर पर आधारित एक विधि का उपयोग करते हैं। इस शोर की कल्पना एक हल्की, अनुमानित बारिश के रूप में करें। यदि एक बूंद आपके रोबोट की नाक पर गिरती है, तो यह एक छोटा, प्रबंधनीय स्पर्श है। लेकिन वास्तविक दुनिया में, डेटा हमेशा हल्की बारिश जैसा नहीं होता। कभी-कभी यह ओलावृष्टि होती है, या पहाड़ी से लुढ़कते हुए एक अचानक, विशाल पत्थर जैसा होता है।

वित्तीय डेटा (जैसे शेयर की कीमतें) या अव्यवस्थित वास्तविक दुनिया के डेटासेट में, इन "पत्थरों" को हेवी टेल्स (heavy tails) कहा जाता है। ये दुर्लभ, चरम घटनाएँ हैं—जैसे एक दिन में बाजार का 20% गिर जाना। मानक Gaussian रोबोट इन विशाल पत्थरों को केवल "बहुत बड़ी बारिश की बूंदों" के रूप में देखते हैं। क्योंकि उनका गणित रैखिक (linear) है, एक विशाल पत्थर रोबोट के मस्तिष्क को नियंत्रण से बाहर कर देता है, जिससे वह गलत सबक सीख जाता है। यह एक साइकिल चलाने का अभ्यास करने जैसा है जबकि कोई आप पर भारी एंवल (anvil) फेंक रहा हो; आप एंवल से बचना तो सीख सकते हैं, लेकिन आप साइकिल चलाना कभी नहीं सीख पाएंगे।

समाधान: "त्सालिस" (Tsallis) अपग्रेड

लेखक सुझाव देते हैं कि हल्की बारिश को Tsallis–Gaussian perturbations से बदल दिया जाए।

1. बाउंडेड "रिडिसेन्डिंग" स्कोर (स्मार्ट हेडफ़ोन)
पुरानी विधि में, यदि रोबोट एक बड़ी त्रुटि (एक पत्थर) देखता, तो वह अनंत वॉल्यूम के साथ चिल्लाता, "त्रुटि! त्रुटि!" नई विधि एक Tsallis स्कोर का उपयोग करती है जो बाउंडेड (सीमित) है।

  • उपमा: कल्पना करें कि रोबोट का एरर सिग्नल एक वॉल्यूम नॉब है। पुराने सिस्टम में, एक बड़ी गलती वॉल्यूम नॉब को "MAX" पर कर देती थी और उसे हमेशा के लिए बढ़ाता रहती थी। नए सिस्टम में, वॉल्यूम नॉब पर एक हार्ड स्टॉप है। भले ही एक पत्थर रोबोट से टकरा जाए, वह जो शोर सुनता है वह एक सुरक्षित स्तर पर सीमित रहता है।
  • परिणाम: रोबोट चरम बाहरी घटनाओं (outliers) के चिल्लाते हुए वॉल्यूम को अनदेखा कर देता है। यह एक बड़े वित्तीय संकट या छवि में खराब पिक्सेल को "तेज, लेकिन अनंत नहीं" के रूप में मानता है। यह रोबोट को दुर्लभ, चरम घटनाओं पर अत्यधिक प्रतिक्रिया करने से रोकता है।

2. एडेप्टिव वेट (स्मार्ट फ़िल्टर)
दूसरा तरीका एक डेंसिटी-रेशियो वेट (density-ratio weight) है।

  • उपमा: कल्पना करें कि रोबroट एक कक्षा में है। यदि एक छात्र (डेटा पॉइंट) उस स्थान पर बैठा है जहाँ शिक्षक (मॉडल) एक छात्र की अपेक्षा करता है, तो शिक्षक ध्यान से सुनता है। लेकिन यदि कोई छात्र ऐसी जगह आता है जहाँ किसी के होने की उम्मीद नहीं थी (एक अजीब, असंभावित आउटलियर), तो शिक्षक धीरे से कहता है, "ठीक है, मैं तुम्हें देख रहा हूँ, लेकिन मैं तुम्हारे आधार पर अपनी पूरी पाठ योजना नहीं बदलूँगा।"
  • परिणाम: रोबोट स्वचालित रूप से उन डेटा पॉइंट्स पर वॉल्यूम कम कर देता है जो उसके पैटर्न से मेल नहीं खाते, जबकि उन डेटा पर वॉल्यूम बनाए रखता है जो पैटर्न में फिट बैठते हैं। इसे सैंपल-लेवल रोबस्टनेस कहा जाता है।

प्रयोगों ने क्या दिखाया

लेखकों ने इस नए रोबोट का तीन अलग-अलग मैदानों में परीक्षण किया:

1. सिंथेटिक डेटा (प्रशिक्षण जिम)
उन्होंने नकली डेटा का उपयोग किया जिसमें "करप्शन" (जैसे यादृच्छिक विशेषताओं को शुद्ध शोर से बदलना) शामिल था।

  • निष्कर्ष: जब डेटा साफ था, तो नया रोबोट पुराने वाले के समान ही अच्छा था। लेकिन जब उन्होंने इसमें "शोर" डालना शुरू किया (20%, 30%, यहाँ तक कि 50% डेटा को दूषित किया), तो नया रोबोट शांत रहा।
  • आंकड़े: HAR (Human Activity Recognition) नामक डेटासेट पर, जब 50% डेटा दूषित किया गया, तो पुराने रोबोट की सटीकता लगभग 20.60% गिर गई। नए रोबोट (एक विशिष्ट सेटिंग q=1.35q=1.35 के साथ) में केवल 16.15% की गिरावट आई। इसने अपना आधार बहुत बेहतर तरीके से बनाए रखा।

2. इमेजेस (आर्ट क्लास)
उन्होंने रोबोट को चेहरे और कपड़े (MNIST, Fashion-MNIST, CIFAR-10) बनाना सिखाया।

  • निष्कर्ष: यदि उन्होंने प्रशिक्षण छवियों को यादृच्छिक पिक्सेल को काला या सफेद करके दूषित किया, तो नया रोबोट बहुत अधिक साफ चित्र बनाता था।
  • आंकड़े: Fashion-MNIST पर, जब 40% प्रशिक्षण छवियों को दूषित किया गया, तो पुराने रोबोट का गुणवत्ता स्कोर (FID) बढ़कर 9.69 (खराब) हो गया। नए रोबोट ने इसे 6.77 पर बनाए रखा। चित्र कम "ग्लिच" वाले और असली कपड़ों जैसे दिखे।

3. वित्तीय डेटा (शेयर बाजार)
यहीं पर 'हेवी टेल्स' सबसे अधिक मायने रखते हैं। उन्होंने रोबोट को 1990-2018 के शेयर बाजार के डेटा पर प्रशिक्षित किया और उससे 2020-2024 के संकट काल के दौरान क्या होने वाला है, इसका पूर्वानुमान लगाने को कहा।

  • निष्कर्ष: मानक रोबोट (और यहाँ तक कि कुछ विशेष वित्तीय AI जैसे GANs) बाजार की गिरावट कितनी गंभीर हो सकती है, उसका कम आकलन करने की प्रवृत्ति रखते थे। उन्हें लगा कि बाजार वास्तव में जितना शांत होना चाहिए, उससे अधिक शांत रहेगा। नया रोबोट, सही सेटिंग्स के साथ, "पत्थरों" की उम्मीद करना सीख गया।
  • आंकड़े: FF48 पोर्टफोलियो के लिए, वास्तविक बाजार का "कुर्टोसिस" (Kurtosis - एक माप जो बताता है कि पूंछ कितनी मोटी है) 12.6109 था।
    • पुराने Gaussian रोबोट ने 5.0742 का अनुमान लगाया (बहुत अधिक शांत)।
    • q=1.5q=1.5 वाले नए रोबोट ने 11.3833 का अनुमान लगाया (वास्तविकता के बहुत करीब)।
    • इसने CVaR (सबसे खराब स्थिति के नुकसान का माप) भी वास्तविक संकट मान -4.2470 के बहुत करीब प्राप्त किया, जिसने पुराने रोबोट के -3.0053 के मुकाबले -4.4913 का अनुमान लगाया।

जो पेपर खारिज करता है (क्या "नहीं" करना है)

लेखक इस बारे में बहुत स्पष्ट हैं कि क्या काम नहीं करता है:

  • केवल शोर बदलना पर्याप्त नहीं है: यदि आप केवल हेवी-टेल्ड शोर का उपयोग करते हैं लेकिन पुराने "Gaussian" तरीके से लॉस (loss) की गणना करते हैं (वह गणित जो रोबोट को कैसे सीखना है यह बताता है), तो यह विफल हो जाता है। रोबोट पूंछ (tails) को सीख सकता है, लेकिन वह डेटा के सामान्य हिस्सों के साथ गड़बड़ी कर देगा।
  • केवल वेट बदलना पर्याप्त नहीं है: यदि आप पुराने Gaussian शोर को रखते हैं लेकिन "स्मार्ट वेटिंग" जोड़ने का प्रयास करते हैं, तो भी यह विफल हो जाता है। रोबोट अभी भी चरम "पत्थरों" को उत्पन्न नहीं कर पाएगा क्योंकि शोर स्वयं बहुत कोमल है।
  • बड़ा होना हमेशा बेहतर नहीं होता: उन्होंने पाया कि यदि आप "टेल हेवीनेस" पैरामीटर (qq) को बहुत अधिक (जैसे q=1.6q=1.6) कर देते हैं, तो रोबोट बहुत अधिक चरम घटनाएं बनाने लगता है, भले ही उसे नहीं बनाना चाहिए। यह एक ऐसे रोबोट जैसा है जो सोचता है कि हर दिन एक मार्केट क्रैश है। सही संतुलन आमतौर पर q=1.2q=1.2 से q=1.5q=1.5 के बीच था।

वे कितने आश्वस्त हैं?

लेखक यह दावा नहीं करते कि उन्होंने जेनरेटिव AI को "हल" कर दिया है। वे सुझाव देते हैं कि यह विधि एक रोबस्ट (मजबूत) सुधार है।

  • उन्होंने इन परिणामों को वास्तविक डेटासेट (HAR, CIFAR-10, FF48) पर मापा और भ्रष्टाचार (corruption) को सिमुलेट किया ताकि सीमाओं का परीक्षण किया जा सके।
  • उन्होंने पाया कि यह विधि चरम घटनाओं को संभालने और सामान्य डेटा की सटीकता बनाए रखने के बीच एक बेहतर संतुलन का सुझाव देती है।
  • वे स्वीकार करते हैं कि बहुत ही चरम मामलों में (जहाँ वेरिएंस अनंत है), वर्तमान गणित को और अधिक सुधार की आवश्यकता हो सकती है, लेकिन उनके द्वारा किए गए परीक्षणों के लिए, यह काम कर गया।

मुख्य निष्कर्ष (The Takeaway)

यह पेपर सुझाव देता है कि AI को त्रुटियों को सुनने का एक "बाउंडेड" तरीका और अजीब आउटलियर्स को अनदेखा करने के लिए एक "स्मार्ट फ़िल्टर" देकर, हम ऐसे मॉडल बना सकते हैं जो दुनिया के अस्त-व्यस्त होने पर टूटते नहीं हैं। चाहे वह एक दूषित इमेज फ़ाइल हो या अचानक शेयर बाजार की गिरावट, नया TSMLD रोबोट शांत रहता है, सही सबक सीखता है, और शोर से विचलित नहीं होता है। यह हर चीज़ के लिए जादुई समाधान नहीं है, लेकिन अव्यवस्थित, हेवी-टेल्ड वास्तविक दुनिया के लिए, यह पुराने वाले की तुलना में बहुत अधिक मजबूत उपकरण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →