Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions
यह शोध पत्र यह प्रदर्शित करता है कि वर्तमान लार्ज लैंग्वेज मॉडल्स में निर्दिष्ट संभाव्यता वितरणों (probability distributions) से यादृच्छिक संख्याएँ उत्पन्न करने की क्षमता मौलिक रूप से नहीं है, जो बैच और स्वतंत्र सैंपलिंग दोनों मोड में गंभीर सांख्यिकीय विफलताओं को प्रदर्शित करते हैं जो डाउनस्ट्रीम अनुप्रयोगों में व्यवस्थित पूर्वाग्रहों को प्रसारित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Large Language Models Are Bad Dice Players" शोध पत्र का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें कुछ रचनात्मक उपमाओं का उपयोग किया गया है।
मुख्य विचार: वह "जादुई पासा" जो जादुई नहीं है
कल्पना कीजिए कि आपने एक सुपर-स्मार्ट रोबोट से एक पासा 1,000 बार फेंकने और उसके परिणाम लिखने के लिए कहा। आप उम्मीद करते हैं कि 1 से 6 तक के अंक लगभग समान संख्या में आएंगे (लगभग 166 बार प्रत्येक)। सांख्यिकीविद् इसे यूनिफॉर्म डिस्ट्रीब्यूशन (एकसमान वितरण) कहते हैं।
यह शोध एक सरल लेकिन चौंकाने वाला सवाल पूछता है: क्या आधुनिक AI मॉडल (LLMs) वास्तव में खुद से यह कर सकते हैं?
इसका उत्तर एक जोरदार "नहीं" है। शोधकर्ताओं ने पाया कि हालांकि ये मॉडल कहानियाँ लिखने, कोडिंग करने और बातचीत करने में अद्भुत हैं, लेकिन ये रैंडम (यादृच्छिक) होने में बहुत खराब हैं। उनके अंदर कोई "रैंडमनेस इंजन" नहीं है। इसके बजाय, वे केवल उन पैटर्न के आधार पर अनुमान लगाते हैं जो उन्होंने पहले देखे हैं, जिससे परिणाम अनुमानित और पक्षपाती हो जाते हैं।
रैंडमनेस (यादृच्छिकता) माँगने के दो तरीके
शोधकर्ताओं ने AI का परीक्षण दो अलग-अलग तरीकों से किया, जैसे किसी दोस्त से दो अलग-अलग स्थितियों में पासा फेंकने के लिए कहना:
"बैच" अनुरोध (एक बार में सब कुछ):
- प्रॉम्प्ट (निर्देश): "कृपया एक पासा 1,000 बार फेंकें और सभी नंबरों को एक बड़ी सूची में लिखें।"
- परिणाम: AI ठीक-ठाक काम करता है। यह लगभग 7% वितरणों को सही ढंग से करता है।
- क्यों? जब AI एक लंबी सूची लिखता है, तो वह देख सकता है कि उसने अभी क्या लिखा है। यदि उसने पहले 100 नंबरों में बहुत अधिक "6" निकाल लिए हैं, तो वह सूची को संतुलित करने के लिए बाद में अधिक "1" निकालने की कोशिश कर सकता है। यह एक इंसान की तरह है जो चलते-चलते अपनी गलती को "ठीक" करने की कोशिश करता है।
"स्वतंत्र" अनुरोध (एक-एक करके):
- प्रॉम्प्ट (निर्देश): "एक बार पासा फेंकें। अब, फिर से फेंकें (एक नए चैट में)। अब फिर से..." (इसे 1,000 बार दोहराना)।
- परिणाम: पूर्ण विफलता। 11 में से 10 मॉडल पूरी तरह विफल रहे।
- क्यों? पिछले फेरों को देखने की क्षमता के बिना, AI का आंतरिक पूर्वाग्रह हावी हो जाता है। उसका एक "पसंदीदा नंबर" होता है (जैसे हमेशा 7 चुनना या हमेशा बीच का विकल्प चुनना) और वह खुद को उसे चुनने से रोक नहीं पाता।
उपमा: AI को एक छात्र के रूप में सोचें जो परीक्षा दे रहा है।
- बैच मोड में, छात्र अपने पिछले उत्तर देख सकता है और कह सकता है, "ओह, मैंने 'C' बहुत अधिक बार चुना है, अब मैं 'A' चुनूँगा ताकि संतुलन बना रहे।"
- स्वतंत्र मोड में, छात्र हर प्रश्न के लिए एक अलग कमरे में है। वह अपनी पिछली गलतियों को नहीं देख सकता, इसलिए वह बस अपना पसंदीदा उत्तर, "C," बार-बार चुनता रहता है।
"जटिलता" की समस्या
शोधकर्ताओं ने अलग-अलग प्रकार के "पासे" के साथ AI का परीक्षण किया:
- साधारण पासे: 1 से 10 के बीच एक नंबर चुनना (Uniform)।
- चालाकी भरे पासे: जो बेल कर्व (Gaussian) का पालन करते हैं या जिनका आकार अजीब (Cauchy) होता है।
निष्कर्ष: पासा जितना अधिक जटिल होगा, AI उतना ही खराब होता जाएगा।
- उपमा: कल्पना कीजिए कि AI एक शेफ (रसोइया) है जिसने लाखों साधारण ऑमलेट बनाए हैं। यदि आप उससे एक साधारण ऑमलेट मांगते हैं, तो वह बेहतरीन बनाता है। लेकिन यदि आप उससे एक जटिल, कई परतों वाला 'सुफ़ले' (soufflé) मांगते हैं जिसकी एक विशिष्ट रासायनिक संरचना हो, तो शेफ घबरा जाता है और आपको बस एक जला हुआ ऑमलेट परोस देता है। AI सरल रैंडमनेस की नकल कर सकता है क्योंकि उसने अपने ट्रेनिंग डेटा में इसे देखा है, लेकिन वह जटिल रैंडमनेस के पीछे के गणित को नहीं समझता।
"लंबा होने पर बदतर होना" का विरोधाभास
आमतौर पर, गणित में, यदि आप अधिक नमूने (samples) लेते हैं, तो आपके परिणाम अधिक सटीक होते हैं।
- सामान्य अपेक्षा: "यदि मैं पासा 10,000 बार फेंकता हूँ, तो औसत एकदम सही होगा।"
- AI की वास्तविकता: "यदि मैं AI को पासा 10,000 बार फेंकने के लिए कहता हूँ, तो परिणाम और भी खराब हो जाते हैं।"
उपमा: एक नशे में धुत व्यक्ति की कल्पना करें जो सीधी रेखा में चलने की कोशिश कर रहा है।
- यदि वह 10 कदम लेता है, तो वह ठीक लग सकता है।
- यदि वह 1,000 कदम लेता है, तो वह अंततः रास्ते से मीलों दूर भटक जाएगा।
AI अपने छोटे-छोटे पूर्वाग्रहों को समय के साथ जमा करता जाता है। वह सूची जितनी लंबी होती जाती है, वह वास्तविक रैंडमनेस से उतना ही दूर भटकता जाता है।
आपको इसकी चिंता क्यों करनी चाहिए? (वास्तविक दुनिया का संकट)
आप सोच सकते हैं, "तो AI गणित में बुरा है। इससे किसे फर्क पड़ता है?" लेकिन यह खतरनाक है क्योंकि हम AI का उपयोग वास्तविक दुनिया के उन निर्णयों के लिए करने लगे हैं जिनमें रैंडमनेस (यादृच्छिकता) की आवश्यकता होती है।
1. पक्षपाती टेस्ट मेकर (परीक्षा निर्माता)
- परिदृश्य: स्कूल बहुविकल्पीय प्रश्न (MCQs) बनाने के लिए AI का उपयोग करते हैं।
- नियम: सही उत्तर (A, B, C, या D) रैंडम होना चाहिए ताकि छात्र यह अनुमान लगाकर नकल न कर सकें कि "C" हमेशा सही होता है।
- AI की विफलता: अध्ययन में पाया गया कि भले ही उन्हें रैंडम होने के लिए कहा गया हो, AI ने कुछ खास अक्षरों (जैसे B या C) को बहुत अधिक प्राथमिकता दी।
- परिणाम: छात्र पैटर्न को समझ सकते थे और बिना विषय जाने परीक्षा पास कर सकते थे। परीक्षण अब निष्पक्ष नहीं रहा।
2. अनुचित इमेज जनरेटर (छवि निर्माता)
- परिदृश्य: एक कंपनी विविधता अध्ययन (diversity study) के लिए लोगों की 1,000 छवियां बनाने के लिए AI से कहती है। वे चाहते हैं कि छवियां वास्तविक दुनिया के जनसांख्यिकी (जैसे 50% पुरुष, 50% महिला; विशिष्ट जातीयता के प्रतिशत) से मेल खाती हों।
- AI की विफलता: AI ने निर्देशों को अनदेखा कर दिया। उसने 97% महिलाएं बनाईं, या 0% हिस्पैनिक लोग, या लगभग सभी ने हरे रंग का कोट पहना हुआ था (भले ही उनसे सभी रंगों के लिए पूछा गया था)।
- परिणाम: डेटा पक्षपाती है। यदि कोई डॉक्टर या नीति निर्माता इस डेटा का उपयोग करता है, तो वे एक नकली वास्तविकता के आधार पर निर्णय लेंगे जो वास्तविक लोगों का प्रतिनिधित्व नहीं करती है।
निचोड़ (The Bottom Line)
शोध पत्र निष्कर्ष निकालता है कि LLMs के अंदर कोई कार्यात्मक "रैंडमनेस स्विच" नहीं होता है। वे रैंडमनेस का वर्णन करने में उत्कृष्ट हैं, लेकिन इसे करने में बहुत खराब हैं।
सीख:
यदि आपको किसी भी महत्वपूर्ण चीज़ (जैसे क्रिप्टोग्राफी, निष्पक्ष परीक्षण, या वैज्ञानिक सिमुलेशन) के लिए वास्तविक रैंडमनेस की आवश्यकता है, तो AI से ऐसा करने के लिए न कहें। आपको एक समर्पित रैंडम नंबर जनरेटर (जैसे कंप्यूटर चिप या भौतिक पासा फेंकना) का उपयोग करना चाहिए और AI को केवल उसके आसपास का टेक्स्ट लिखने दें। AI एक बेहतरीन लेखक है, लेकिन एक बहुत बुरा पासा खिलाड़ी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।