U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs
यह शोध पत्र U-MATH को प्रस्तुत करता है, जो छह मुख्य विषयों के 1,100 ओपन-एंडेड विश्वविद्यालय-स्तरीय समस्याओं का एक नवीन बेंचमार्क है जिसमें 20% मल्टीमॉडल सामग्री शामिल है, साथ ही समाधान निर्णय (solution judgment) के मूल्यांकन के लिए -MATH डेटासेट भी है, ताकि वर्तमान LLMs की मल्टीमॉडल तर्क क्षमता और गणितीय समाधानों का सटीक आकलन करने की क्षमता में महत्वपूर्ण सीमाओं को उजागर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विश्वविद्यालय की कक्षा के गणित के होमवर्क का ढेर ग्रेड करने की कोशिश कर रहे एक शिक्षक हैं। लंबे समय तक, आपके द्वारा छात्रों (AI मॉडल्स) को ग्रेड करने के लिए उपयोग किए जाने वाले "टेस्ट" प्राथमिक विद्यालय की क्विज़ की तरह थे: सरल, बहुविकल्पीय प्रश्न जिन्हें सबसे बुद्धिमान बच्चे भी आसानी से हल कर सकते थे। लेकिन अब, छात्र (AI) इन सरल टेस्ट में इतने अच्छे हो गए हैं कि ये टेस्ट अब यह नहीं बता पाते कि कौन वास्तव में प्रतिभाशाली है और कौन केवल अनुमान लगा रहा है।
यहाँ आपने जो पेपर साझा किया है, वह U-MATH और µ-MATH पेश करता है, जो विशेष रूप से विश्वविद्यालय-स्तरीय गणित के लिए डिज़ाइन किया गया एक बिल्कुल नया, बहुत कठिन फाइनल एग्जाम है, साथ ही उत्तरों को निष्पक्ष रूप से ग्रेड करने में मदद करने के लिए एक विशेष "शिक्षक मार्गदर्शिका" भी है।
यहाँ उन्होंने क्या किया, इसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. नया एग्जाम: U-MATH
समस्या: पिछले टेस्ट बहुत आसान या बहुत सीमित थे। वे ज्यादातर हाई स्कूल के विषयों को कवर करते थे या केवल बहुविकल्पीय प्रश्न थे जहाँ AI बिना वास्तव में गणित किए सही उत्तर का अनुमान लगा सकता था। साथ ही, उनमें शायद ही कभी चित्रों या ग्राफों को शामिल किया गया, जबकि वास्तविक गणित में अक्सर ऐसा होता है।
समाधान: लेखकों ने U-MATH बनाया, जो अमेरिका के वास्तविक विश्वविद्यालय पाठ्यक्रमों से सीधे लिए गए 1,100 बिल्कुल नए, अप्रकाशित प्रश्नों का एक संग्रह है।
- कठिनाई: ये साधारण क्विज़ नहीं हैं। ये ओपन-एंडेड (open-ended) हैं, जिसका अर्थ है कि AI को पूरा समाधान लिखना होगा, न कि केवल "A, B, C, या D" चुनना होगा।
- विजुअल्स (Visuals): लगभग 20% समस्याओं में चित्र शामिल हैं, जैसे ग्राफ, ज्यामितीय आकृतियाँ, या डेटा टेबल। यह AI को एक वाक्य पढ़ने के बजाय एक ब्लूप्रिंट को देखते हुए गणित की समस्या हल करने के लिए कहने जैसा है।
- विषय: यह बीजगणित (Algebra) से लेकर कलन (Calculus) तक छह मुख्य विश्वविद्यालय विषयों को कवर करता है।
परिणाम: जब उन्होंने इस नए एग्जाम पर सबसे स्मार्ट AI मॉडल्स का परीक्षण किया:
- केवल टेक्स्ट (Text-only): AI केवल शब्दों वाले प्रश्नों पर काफी अच्छा प्रदर्शन करता है (लगभग 93% सही)।
- विजुअल (Visual): जब चित्रों को शामिल किया गया, तो AI काफी संघर्ष करता है, और इसकी सटीकता गिरकर लगभग 58% रह गई। यह ऐसा है जैसे AI एक रेसिपी को बिना किसी गलती के पढ़ सकता है, लेकिन जब उसे खाना बनाने के लिए सामग्री की तस्वीर देखनी होती है, तो वह भ्रमित हो जाता है।
2. शिक्षक की मार्गदर्शिका: µ-MATH
समस्या: इन ओपन-एंडेड उत्तरों को कैसे ग्रेड करें? यदि एक छात्र x/2 लिखता है और उत्तर कुंजी कहती है 0.5x, तो क्या यह सही है? यदि होमवर्क ग्रेड करने वाला AI गलती करता है, तो हमें कैसे पता चलेगा? आमतौर पर, हम AI को खुद को ग्रेड करने के लिए छोड़ देते हैं, लेकिन पेपर दिखाता है कि AI "जज" अक्सर पक्षपाती या असंगत होते हैं।
समाधान: उन्होंने µ-MATH (उच्चारण: म्यू-मैथ) बनाया। इसे एक शिक्षकों के लिए मेटा-एग्जाम के रूप में समझें।
- उन्होंने U-MATH के कुछ प्रश्नों को लिया और चार अलग-अलग शीर्ष AI मॉडल्स से उत्तर (कुछ सही, कुछ गलत) तैयार करवाए।
- फिर, उन्होंने अन्य AI मॉडल्स को "जज" के रूप में कार्य करने के लिए कहा और उन उत्तरों को ग्रेड करने को कहा।
- महत्वपूर्ण रूप से, उन्होंने मानव विशेषज्ञों से सही उत्तरों को सत्यापित करवाया, ताकि उन्हें पता चल सके कि "जज" AI वास्तव में कितने अच्छे थे। इससे उन्हें यह परीक्षण करने में मदद मिली कि "जज" AI वास्तव में कितने अच्छे थे।
परिणाम:
- ग्रेडिंग करना कठिन है: यहाँ तक कि सर्वश्रेष्ठ AI जज भी लगभग 90% मामलों में सही ग्रेडिंग कर पाते हैं। वे पूर्ण नहीं हैं।
- एक अच्छा छात्र होना आपको एक अच्छा शिक्षक नहीं बनाता: कुछ AI मॉडल गणित के सवालों को हल करने में बेहतरीन थे लेकिन ग्रेडिंग करने में बहुत खराब थे। कुछ इसके विपरीत थे।
- पक्षपात (Bias): जजों के अपने "पसंदीदा" थे। उदाहरण के लिए, कुछ जज कुछ AI मॉडल्स के उत्तरों पर बहुत सख्त थे और दूसरों पर बहुत उदार थे, चाहे गणित वास्तव में सही हो या नहीं।
3. मुख्य निष्कर्ष
- "विजुअल गैप" (The Visual Gap): AI अभी भी गणित को छवियों के साथ जोड़ने में बहुत खराब है। यह एक ऐसे छात्र की तरह है जो मन में गणित तो कर सकता है लेकिन डायग्राम देखते ही जम जाता है।
- विशेषज्ञता मायने रखती है: गणित पर विशेष रूप से प्रशिक्षित छोटे AI मॉडल्स (जैसे एक विशेष ट्यूटर) इन कठिन समस्याओं पर विशाल, सामान्य-उद्देश्य वाले मॉडल्स को हरा देते हैं।
- "जज" की समस्या: हम केवल AI को AI को ग्रेड करने के लिए भरोसा नहीं कर सकते। पेपर दिखाता है कि गणित को जज करना, उसे हल करने से पूरी तरह से अलग कौशल है, और वर्तमान AI जज अभी भी गलतियाँ करने और पक्षपात दिखाने के प्रति प्रवृत्त हैं।
सारांश
लेखकों ने एक विश्वविद्यालय-स्तरीय गणित परीक्षण (U-MATH) बनाया यह देखने के लिए कि AI वास्तव में कितना स्मार्ट है, और एक ग्रेडिंग परीक्षण (µ-MATH) यह देखने के लिए कि AI ग्रेडर्स कितने निष्पक्ष हैं। उन्होंने पाया कि हालांकि AI टेक्स्ट-आधारित गणित में बहुत अच्छा हो रहा है, फिर भी वह विजुअल गणित के लिए संघर्ष करता है, और वह अपने काम को ग्रेड करने के लिए एक पूर्ण शिक्षक के रूप में भरोसेमंद नहीं है। उन्होंने यह सारा डेटा सभी के उपयोग के लिए मुफ्त में उपलब्ध कराया है ताकि शोधकर्ता बेहतर, अधिक ईमानदार AI बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।