StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
यह शोध पत्र StatABench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क है जिसमें क्लोज्ड-फॉर्म प्रश्न और ओपन-एंडेड मॉडलिंग कार्य शामिल हैं, ताकि वर्तमान बड़े भाषा मॉडलों की सांख्यिकीय विश्लेषण क्षमताओं, टूल-ग्राउंडेड रीजनिंग और एंड-टू-एंड मॉडलिंग प्रदर्शन में महत्वपूर्ण सीमाओं का मूल्यांकन और अनावरण किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जटिल प्रोजेक्ट को मैनेज करने में मदद के लिए एक नया असिस्टेंट रख रहे हैं। आप सिर्फ ऐसा व्यक्ति नहीं चाहते जो "प्रोजेक्ट मैनेजमेंट" की डिक्शनरी परिभाषा सुना सके; आप चाहते हैं कि वह वास्तव में सॉफ्टवेयर खोल सके, फाइलों को व्यवस्थित कर सके, गणनाएँ (calculations) कर सके और एक ऐसी रिपोर्ट लिख सके जिसका कोई अर्थ निकलता हो।
यह पेपर, StatABench, अनिवार्य रूप से आर्टिफिशियल इंटेलिजेंस (AI) मॉडल्स के लिए एक कठोर "जॉब इंटरव्यू" है, यह देखने के लिए कि क्या वे वास्तव में सांख्यिकीविद् (statisticians) के रूप में कार्य कर सकते हैं।
यहाँ बताया गया है कि लेखकों ने क्या किया, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. समस्या: "टेक्स्टबुक बनाम टूलबॉक्स" का अंतर
AI के पिछले परीक्षण ऐसे थे जैसे किसी छात्र को कागज पर गणित के सवाल हल करने के लिए कहना। AI अक्सर पैटर्न याद करके या अनुमान लगाकर सही उत्तर दे देता था। लेकिन वास्तविक दुनिया में, एक सांख्यिकीविद् केवल सोचता नहीं है; वे टूल्स (जैसे R या Python) का उपयोग करके वास्तविक डेटा का विश्लेषण करते हैं।
लेखकों ने महसूस किया कि मौजूदा परीक्षण या तो बहुत आसान थे या बहुत कठोर। वे देखना चाहते थे कि क्या AI कर सकता है:
- सिद्धांत को समझना ( "टेक्स्टबुक" ज्ञान)।
- समस्याओं को हल करने के लिए वास्तव में टूल्स का उपयोग करना ("टूलबॉक्स" कौशल)।
- अव्यवस्थित, खुले-अंत वाले वास्तविक दुनिया के परिदृश्यों को संभालना (वास्तविक जीवन की "अराजकता")।
2. समाधान: एक टू-ट्रैक बेंचमार्क (Two-Track Benchmark)
इसे टेस्ट करने के लिए, उन्होंने StatABench बनाया, जिसमें दो अलग-अलग ट्रैक हैं, जैसे कि एक ड्राइविंग टेस्ट जिसमें लिखित परीक्षा और रोड टेस्ट दोनों होते हैं।
ट्रैक A: Stat-Closed (लिखित परीक्षा और लैब)
- यह क्या है: 18 अलग-अलग सांख्यिकीय विषयों (जैसे औसत का अनुमान लगाना, दो समूहों के बीच अंतर का परीक्षण करना, या रुझानों की भविष्यवाणी करना) को कवर करने वाले 404 विशिष्ट प्रश्न।
- ट्विस्ट: AI को केवल अनुमान लगाने की अनुमति नहीं है; इसे उत्तर पाने के लिए एक विशिष्ट "टूलकिट" (35 पूर्व-प्रोग्राम किए गए सांख्यिकीय कार्यों का एक सेट) का उपयोग करना होगा।
- उपमा: कल्पना कीजिए कि एक शेफ को एक रेसिपी दी गई है। वह केवल यह नहीं कह सकता कि "इसका स्वाद अच्छा है।" उसे वास्तव में सही चाकू उठाना होगा, सही सब्जी काटनी होगी और विशिष्ट मसाला जार का उपयोग करना होगा ताकि व्यंजन सही बने।
- परिणाम: यहाँ तक कि सबसे स्मार्ट AI (GPT-5.1) भी इनमें से लगभग 68% सही कर पाया। सबसे अच्छे ओपन-सोर्स AI ने लगभग 60% प्राप्त किया।
- "टूल टैक्स" (The Tool Tax): पेपर में पाया गया कि जब AI को टूल्स का उपयोग करना पड़ा, तो इसके स्कोर में काफी गिरावट आई। यह एक ऐसे कुशल शेफ की तरह है जो रेसिपी को पूरी तरह से जानता है लेकिन चाकू गिरा देता है या गलत मसाले का उपयोग करता है। वे विचार को समझते हैं लेकिन निष्पादन (execution) में संघर्ष करते हैं।
ट्रैक B: Stat-Open (रोड टेस्ट)
- यह क्या है: वास्तविक पेशेवर गणित और सांख्यिकी प्रतियोगिताओं से लिए गए 30 जटिल, वास्तविक दुनिया के प्रश्न। इनके एक एकल "सही" उत्तर नहीं होते हैं।
- कार्य: AI को एक अव्यवस्थित डेटासेट लेना होगा, उसे साफ करना होगा, सही विश्लेषण चुनना होगा, एक मॉडल बनाना होगा और अपने निष्कर्षों की व्याख्या करने वाली एक संरचित रिपोर्ट लिखनी होगी।
- उपमा: यह एक शेफ को रैंडम सामग्री से भरा फ्रिज देने और जैसा कि एक आलोचक के लिए तीन-कोर्स का भोजन बनाने और फिर यह समीक्षा लिखने के लिए कहने जैसा है कि उन्होंने उन सामग्रियों को क्यों चुना।
- ग्रेडिंग: चूंकि इसका कोई एक सही उत्तर नहीं है, इसलिए उन्होंने रिपोर्ट की संरचना, तर्क और व्यावहारिकता के आधार पर ग्रेड देने के लिए एक "जज AI" (एक बहुत ही स्मार्ट AI) का उपयोग किया।
- परिणाम: शीर्ष AI सिस्टम ने औसतन 61.86 में से 100 स्कोर किया। यह सुझाव देता है कि हालांकि AI एक ऐसी रिपोर्ट लिख सकता है जो पेशेवर दिखती है, लेकिन इसमें अक्सर एक मानव विशेषज्ञ की गहरी, विश्वसनीय तर्क क्षमता की कमी होती है।
3. बड़ी खोज: "एग्जीक्यूशन गैप" (The Execution Gap)
पेपर की सबसे महत्वपूर्ण खोज यह है कि AI सांख्यिकी के बारे में बात करने में अच्छा है लेकिन सांख्यिकी करने में बुरा है।
- अवधारणा बनाम क्रिया (Concept vs. Action): AI आपको बता सकता है कि "t-test" क्या है, लेकिन जब इसे एक डेटासेट पर इसे चलाने के लिए कहा जाता है, तो यह अक्सर गलत टूल चुन लेता है, गलत पैरामीटर सेट कर देता है, या परिणाम की गलत व्याख्या करता है।
- "टूल इंटीग्रेशन टैक्स": टूल्स शामिल होने पर प्रदर्शन में गिरावट को पेपर में "टैक्स" कहा गया है। यह उस ड्राइवर की तरह है जो ट्रैफिक नियमों को समझाने में बहुत अच्छा है लेकिन कार को स्टीयर करने की बारी आने पर दुर्घटना कर देता है।
- त्रुटि विश्लेषण (Error Analysis): जब AI विफल हुआ, तो यह आमतौर पर कोड को फॉर्मेट न कर पाने (एक इंजीनियरिंग त्रुटि) के कारण नहीं था; बल्कि यह गलत सांख्यिकीय पद्धति चुनने या डेटा को गलत समझने (एक सांख्यिकीय त्रुटि) के कारण था।
4. निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हम अभी उस बिंदु पर नहीं पहुंचे हैं जहां हम AI पर एक विश्वसनीय सांख्यिकीविद् के रूप में भरोसा कर सकें।
- वर्तमान स्थिति: AI एक बहुत ही जानकार इंटर्न की तरह है जिसने हर टेक्स्टबुक पढ़ी है लेकिन कभी लैब में काम नहीं किया है। वे सिद्धांत जानते हैं लेकिन जब वे उपकरणों को छूते हैं तो उन्हें हाथ पकड़कर गाइड करने के लिए एक इंसान की जरूरत होती है।
- भविष्य की आवश्यकताएं: इसे ठीक करने के लिए, भविष्य के AI सिस्टम को अपने "दिमाग" (तर्क) को अपने "हाथों" (टूल्स) के साथ बेहतर तरीके से जोड़ने की आवश्यकता है। उन्हें न केवल यह सीखने की आवश्यकता है कि क्या करना है, बल्कि यह भी कि एक अव्यवस्थित, वास्तविक दुनिया के वातावरण में इसे विश्वसनीय रूप से कैसे करना है।
संक्षेप में: StatABench एक रिपोर्ट कार्ड है जो दिखाता है कि हालांकि AI स्मार्ट हो रहा है, फिर भी वह अपने सांख्यिकीय ज्ञान को विश्वसनीय, वास्तविक दुनिया के कार्यों में बदलने के लिए संघर्ष करता है। वह एक बहुत अच्छा छात्र है, लेकिन वह अभी तक एक मास्टर प्रैक्टिशनर नहीं बना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।