The CompMath-MCQ Dataset: Are LLMs Ready for Higher-Level Math?
यह शोध पत्र CompMath-MCQ प्रस्तुत करता है, जो स्नातक स्तर की कम्प्यूटेशनल गणित (computational mathematics) को कवर करने वाले 1,500 विशेषज्ञ-लिखित बहुविकल्पीय प्रश्नों का एक नवीन बेंचमार्क डेटासेट है, जिसे उन्नत गणितीय तर्क में लार्ज लैंग्वेज मॉडल्स (Large Language Models) की वर्तमान सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को गणित करना सिखा रहे हैं। लंबे समय से, आपने केवल इसका परीक्षण ऐसी चीजों पर किया है जैसे "यदि मेरे पास 3 सेब हैं और मैं 2 और खरीदता हूँ, तो मेरे पास कितने हैं?" या गणित प्रतियोगिताओं की पेचीदा पहेलियाँ। रोबोट इनमें काफी अच्छा हो गया है।
लेकिन अब, आप जानना चाहते हैं: क्या यह रोबोट वास्तव में एक उन्नत विश्वविद्यालय स्तर की गणित कक्षा को संभाल सकता है? क्या यह उन समस्याओं को हल कर सकता है जिनका सामना एक स्नातक छात्र या शोधकर्ता करता है, जैसे जटिल प्रणालियों को अनुकूलित करना या यह गणना करना कि 3D स्थान में तरल पदार्थ कैसे चलते हैं?
यह पेपर बिल्कुल इसी के बारे में है। लेखकों ने यह देखने के लिए एक नया, अत्यंत कठिन परीक्षण बनाया है जिसे CompMath-MCQ कहा जाता है, कि क्या आज के सबसे स्मार्ट AI रोबots बड़े लीग के लिए तैयार हैं।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल भाषा में:
1. समस्या: रोबोट का परीक्षण "वास्तविक" कठिन चीजों पर नहीं हुआ है
अब तक, AI के लिए अधिकांश गणित परीक्षण ऐसे थे:
- प्रारंभिक विद्यालय का गणित: सरल शब्द समस्याएँ।
- मैथ ओलंपियाड: पेचीदा पहेलियाँ जिनमें निरंतर, चरण-दर-चरण कार्य के बजाय "प्रतिभा की चमक" की आवश्यकता होती है।
- औपचारिक प्रमाण (Formal Proofs): बहुत सख्त, कंप्यूटर-कोड जैसे तर्क।
लेकिन ये परीक्षण बीच के हिस्से को छोड़ देते हैं: स्नातक-स्तरीय कम्प्यूटेशनल गणित (Graduate-level Computational Math)। यह वह चीज़ है जो आप मास्टर डिग्री में सीखते हैं: लीनियर अल्जेब्रा, ऑप्टिमाइज़ेशन, और वास्तविक वैज्ञानिक समस्याओं को हल करने के लिए पायथन (Python) का उपयोग करना।
लेखकों ने महसूस किया कि यदि हम जानना चाहते हैं कि क्या AI वास्तव में गणित में "स्मार्ट" है, तो हमें इसे इस विशिष्ट, उच्च-स्तरीय सामग्री पर परखना होगा।
2. समाधान: एक बिल्कुल नया, "लीक-प्रूफ" परीक्षण
टीम ने 1,500 बिल्कुल नए बहुविकल्पीय प्रश्न (multiple-choice questions) बनाए।
बहुविकल्पीय क्यों?
आमतौर पर, जब आप AI से कोई कठिन प्रश्न पूछते हैं, तो वह एक लंबा, भ्रामक उत्तर दे सकता है जिसे ग्रेड करना कठिन होता है। क्या उसने सही संख्या प्राप्त की लेकिन उसे गलत तरीके से समझाया? क्या उसने सही तर्क दिया लेकिन गलत संख्या?
बहुविकल्पीय (A, B, या C) का उपयोग करके, ग्रेडिंग बिजली के स्विच की तरह स्पष्ट हो जाती है: चालू या बंद। यह निष्पक्ष, तेज़ और बहस करने में असंभव है।
"लीक-प्रूफ" क्यों?
यह सबसे महत्वपूर्ण हिस्सा है। AI मॉडल इंटरनेट से डेटा के विशाल भंडार पर प्रशिक्षित होते हैं। यदि आप उनका परीक्षण उन प्रश्नों पर करते हैं जो पहले से ही ऑनलाइन मौजूद हैं (जैसे पुराने पाठ्यपुस्तक के प्रश्न), तो AI ने केवल उत्तर को "याद" किया होगा, न कि वास्तव में गणित सीखा होगा।
- उपमा: कल्पना कीजिए कि आप एक छात्र को उन प्रश्नों पर परीक्षा दे रहे हैं जिन्हें उन्होंने पहले ही चीट शीट पर देख लिया है। वे 'A' ग्रेड प्राप्त करते हैं, लेकिन उन्होंने कुछ भी सीखा नहीं।
- समाधान: लेखकों ने ये सभी 1,500 प्रश्न स्वयं लिखे। वे प्रोफेसर हैं जो इन विषयों को पढ़ाते हैं। ये प्रश्न पहले कभी इंटरनेट पर नहीं रहे हैं। इसलिए, यदि AI उन्हें सही करता है, तो इसका मतलब है कि उसने वास्तव में गणित को समझा है, न कि केवल उत्तर कुंजी को याद किया है।
3. गुणवत्ता नियंत्रण: "डबल-चेक" प्रणाली
कठिन गणित के प्रश्न लिखना पेचीदा काम है। कभी-कभी कोई प्रश्न भ्रमित करने वाला होता है, या "सही" उत्तर वास्तव में गलत होता है।
इसे ठीक करने के लिए, उन्होंने दो-चरणीय सुरक्षा जाल का उपयोग किया:
- रोबोट जूरी: उन्होंने 8 अलग-अलग AI मॉडलों से उन प्रश्नों के उत्तर देने के लिए कहा। यदि सभी रोबोटों ने एक प्रश्न का गलत उत्तर दिया, या यदि वे सभी भ्रमित थे और एक ही गलत उत्तर चुना, तो मानवों को पता चल गया कि प्रश्न में कुछ गड़बड़ है।
- मानव विशेषज्ञ: प्रोफेसरों ने फिर उन संदिग्ध प्रश्नों की मैन्युअल रूप से समीक्षा की ताकि त्रुटियों को ठीक किया जा सके या शब्दावली को स्पष्ट किया जा सके।
इससे यह सुनिश्चित हुआ कि परीक्षण निष्पक्ष था और उत्तर निश्चित रूप से सही थे।
4. परिणाम: रोबोट अच्छे हैं, लेकिन पूर्ण नहीं हैं
उन्होंने उपलब्ध सबसे स्मार्ट AI मॉडलों (जैसे GPT-5, Claude और विभिन्न ओपन-सोर्स मॉडल) पर यह परीक्षण चलाया। यहाँ उन्होंने क्या पाया:
- "आसान" जीत: AI संभाव्यता (Probability) (संभावनाओं का अनुमान लगाना) और पायथन प्रोग्रामिंग में आश्चर्यजनक रूप से अच्छा था। ऐसा लगता है कि इंटरनेट पर इन विषयों पर इतना अधिक डेटा है कि रोबोटों ने इन्हें लाखों बार देखा है।
- "कठिन" बाधा (Bottleneck): AI सबसे अधिक वेक्टर कैलकुलस (Vector Calculus) (3D स्थान, ग्रेडिएंट और जटिल आकृतियों से संबंधित गणित) में संघर्ष करता है।
- रूपक: इसे ऐसे सोचें: AI एक रेसिपी (प्रोग्रामिंग) का पालन करने या मौसम का अनुमान लगाने (संभाव्यता) में बहुत अच्छा है। लेकिन जब आप उससे पूछते हैं कि 3D स्थान में एक चट्टान के चारों ओर एक नदी कैसे बहती है और हर बिंदु पर सटीक बल की गणना कैसे करें, तो वह भटकने लगता है। वह छोटी संकेत त्रुटियाँ (sign errors) करता है या तर्क की लंबी श्रृंखला में एक चरण भूल जाता है।
- अंतर (The Gap): सबसे उन्नत "क्लोज्ड" मॉडल (जैसे GPT-5 और Claude) ने सबसे अच्छा प्रदर्शन किया, लेकिन वे सबसे कठिन विषयों पर भी केवल 80-90% ही सही थे। वे अभी तक एक मानव पीएचडी छात्र की जगह लेने के लिए पूरी तरह तैयार नहीं हैं।
मुख्य निष्कर्ष
यह पेपर एक चेतावनी है। हम AI को हर दिन स्मार्ट बना रहे हैं, लेकिन जब बात उन्नत, चरण-दर-चरण, कम्प्यूटेशनल गणित की आती है, तो रोबोटों को अभी भी बहुत कुछ सीखने की आवश्यकता है।
वे पहेलियों को हल कर सकते हैं, लेकिन वे अभी भी उस जटिल, वास्तविक दुनिया के गणित में लड़खड़ा रहे हैं जिसका उपयोग वैज्ञानिक और इंजीनियर हर दिन करते हैं। लेखकों ने इस परीक्षण को जनता के लिए जारी किया है ताकि हर कोई प्रगति को ट्रैक कर सके और इन रोबोटों को कठिन चीजें सीखने में मदद कर सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।