← नवीनतम पेपर
💬 NLP

UnpredictaBench: A Benchmark for Evaluating Distributional Randomness in LLMs

यह शोधपत्र UnpredictaBench का परिचय देता है, जो एक नया बेंचमार्क और मीट्रिक (KS@N) है जिसे वास्तविक अंतर्निहित वितरणों से सटीक रूप से नमूने लेने की बड़े भाषा मॉडलों (LLMs) की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल सिमुलेशन में अपने बढ़ते उपयोग के बावजूद वितरण संबंधी यादृच्छिकता (distributional randomness) के साथ काफी संघर्ष करते हैं।

मूल लेखक: Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amirhossein Abaskohi, Amirhossein Dabiriaghdam, Liang Luo, Ellie Dingqiao Wen, Lele Wang, Giuseppe Carenini, Peter West

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पार्टी के लिए खाना बनाने हेतु एक शेफ को काम पर रख रहे हैं। आप केवल एक स्वादिष्ट व्यंजन नहीं चाहते; आप एक ऐसा बुफे चाहते हैं जो पूरे मेनू का सटीक प्रतिनिधित्व करे। यदि मेनू कहता है "50% पास्ता, 30% सलाद, 20% सूप," तो आप उम्मीद करते हैं कि बुफे में लगभग वही अनुपात होगा।

UNPREDICTABENCH यह देखने का एक परीक्षण है कि क्या लार्ज लैंग्वेज मॉडल्स (LLMs) उस शेफ की तरह काम कर सकते हैं। शोधकर्ताओं ने जानना चाहा: क्या ये AI मॉडल उन रैंडम परिणामों (random outcomes) को वास्तव में उत्पन्न कर सकते हैं जो उन्हें दी गई "रेसिपी" (सांख्यिकीय वितरण/statistical distribution) से मेल खाते हों?

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर का विवरण दिया गया है:

1. समस्या: "सुरक्षित" शेफ

लेखकों ने देखा कि हालांकि AI मॉडल तर्क करने (reasoning) में बहुत अच्छे हैं, लेकिन वे वास्तव में रैंडम होने में बहुत खराब हैं।

  • समस्या: जब किसी रैंडम घटना (जैसे पासा फेंकना या शेयर बाजार की गिरावट का अनुकरण करना) को सिम्युलेट करने के लिए कहा जाता है, तो AI "बोर" हो जाता है या "सुरक्षित" खेलने लगता है। वास्तविक दुनिया की अराजकता (chaos) से मेल खाने के लिए अपने उत्तरों को फैलाने के बजाय, वह एक ही, अनुमानित उत्तर पर सिमट जाता है।
  • उपमा: कल्पना कीजिए कि आप AI से 100 सिक्का उछालने (coin flips) का अनुकरण करने के लिए कहते हैं। एक असली सिक्का आपको लगभग 50 हेड्स और 50 टेल्स देगा, जो बेतरतीब ढंग से बिखरे होंगे। हालाँकि, AI शायद लगातार 50 हेड्स दे देगा, या बस हर बार "हेड्स" कहेगा क्योंकि उसे लगता है कि यही सबसे "तार्किक" उत्तर है। वह वास्तविक दुनिया की अनिश्चितता (unpredictability) को पकड़ने में विफल रहता है।

2. परीक्षण: UNPREDICTABENCH

इसे ठीक करने के लिए, शोधकर्ताओं ने UNPREDICTABENCH नामक एक विशाल परीक्षण बनाया।

  • सेटअप: उन्होंने 448 अलग-अलग चुनौतियाँ बनाईं। कुछ सरल गणित की समस्याएं थीं (जैसे "मुझे बेल कर्व (Bell Curve) से एक संख्या दें"), कुछ कोड पहेलियाँ थीं, और कुछ वास्तविक दुनिया के परिदृश्य थे (जैसे "क्या होता है यदि दो कारें एक ही समय में ट्रैफिक लाइट पर पहुँच जाएँ?")।
  • लक्ष्य: उन्होंने AI को प्रत्येक समस्या के लिए 100 सैंपल जेनरेट करने के लिए कहा।
  • स्कोरकार्ड (KS@100): उन्होंने कोलमोगोरोव-स्मिरनोव टेस्ट (Kolmogorov-Smirnov test) नामक एक सांख्यिकीय रूलर का उपयोग किया (इसे "शेप मैचर" या आकार मिलाने वाला समझें)।
    • यदि AI के 100 उत्तर वास्तविक दुनिया के आदर्श आकार की तरह दिखते थे, तो उसे उच्च स्कोर मिला।
    • यदि AI के उत्तर एक जगह सिमटे हुए थे या एक सीधी रेखा की तरह दिखते थे, तो उसे कम स्कोर मिला।
    • परिणाम: किसी भी मॉडल का उच्चतम स्कोर केवल लगभग 32% था। इसका मतलब है कि सबसे स्मार्ट AI भी दो-तिहाई से अधिक समय में वास्तविक रैंडमनेस की नकल करने में विफल रहता है।

3. निष्कर्ष: कौन विफल हुआ और क्यों?

शोधकर्ताओं ने कई अलग-अलग मॉडल्स का परीक्षण किया, छोटे ओपन-सोर्स मॉडल्स से लेकर विशाल, महंगे कॉर्पोरेट मॉडल्स तक।

  • "कोलैप्स" (Collapse): अधिकांश मॉडल्स "मोड कोलैप्स" (mode collapse) से ग्रस्त थे। कल्पना कीजिए कि एक डीजे (DJ) को रॉक, जैज़ और पॉप का मिश्रण बजाना है। इसके बजाय, वे केवल एक ही रॉक गाना बार-बार बजाते हैं क्योंकि उन्हें लगता है कि वही "सबसे अच्छा" गाना है। AI संख्याओं के साथ भी ऐसा ही करता है; वह एक "तर्कसंगत" संख्या चुनता है और उसी पर टिका रहता है।
  • आकार मायने नहीं रखता: बड़े मॉडल्स जरूरी नहीं कि बेहतर हों। कुछ विशाल मॉडल्स छोटे मॉडल्स की तुलना में खराब प्रदर्शन करते हैं।
  • तर्क (Reasoning) से मदद नहीं मिली: शोधकर्ताओं ने AI को जवाब देने से पहले "गहराई से सोचने" (think harder) के लिए कहा। इससे थोड़ी मदद मिली, लेकिन इसने मूल समस्या को ठीक नहीं किया। AI अभी भी संख्याओं का वास्तव में रैंडम फैलाव उत्पन्न करने में सक्षम नहीं था।
  • इंस्ट्रक्शन ट्यूनिंग (Instruction Tuning) ने इसे और खराब बना दिया: जो मॉडल्स "सहायक" और "सुरक्षित" होने के लिए फाइन-ट्यून किए गए थे, वे रैंडम होने में और भी बुरे हो गए। "सहायक" होना AI को एक रैंडम उत्तर देने के बजाय एक एकल, आत्मविश्वासी उत्तर देने के लिए प्रेरित करता प्रतीत होता है।

4. रूपक: टूटा हुआ पासा (The Broken Dice)

एक LLM को एक जादुई पासा फेंकने वाले यंत्र के रूप में सोचें।

  • हम क्या चाहते हैं: एक निष्पक्ष पासा जो समय के साथ 1, 2, 3, 4, 5 और 6 पर समान आवृत्ति के साथ गिरे।
  • AI क्या करता है: वह पासा फेंकता है, "3" देखता है, और निर्णय लेता है, "3 एक बहुत ही उचित संख्या है। मैं फिर से 3 ही लाऊँगा।" और फिर से। और फिर से।
  • परिणाम: यदि आप इस AI का उपयोग किसी बीमारी के प्रकोप या आर्थिक मंदी के सिमुलेशन के लिए करते हैं, तो आपकी भविष्यवाणियाँ गलत होंगी क्योंकि AI उस घटना की अराजकता (chaos) का अनुकरण नहीं कर रहा है; वह केवल एक परिणाम में अपने आत्मविश्वास का अनुकरण कर रहा है।

5. निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि वर्तमान AI मॉडल उन सिमुलेशन के लिए तैयार नहीं हैं जिनमें वास्तविक रैंडमनेस की आवश्यकता होती है (जैसे आर्थिक मॉडलिंग या वैज्ञानिक प्रयोग)। वे बहुत अधिक "डिटरमिनिस्टिक" (अनुमानित) हैं।

शोधकर्ताओं ने यह बेंचमार्क हमें यह दिखाने के लिए बनाया है कि AI कहाँ विफल हो रहा है। जब तक हम इन मॉडल्स को वास्तव में अनप्रेडिक्टेबल होने और वास्तविक रैंडम प्रक्रिया की तरह अपने उत्तरों को फैलाने के लिए नहीं सिखाते, तब तक हम जटिल, अराजक प्रणालियों को सिम्युलेट करने के लिए उन पर भरोसा नहीं कर सकते।

संक्षेप में: AI एक बेहतरीन कहानीकार है, लेकिन एक बुरा जुआरी है। वह खेल के नियमों को जानता है, लेकिन वह वास्तव में रैंडम तरीके से खेल नहीं सकता।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →