← नवीनतम पेपर
💬 NLP

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

यह शोध पत्र U-MATH को प्रस्तुत करता है, जो छह मुख्य विषयों के 1,100 ओपन-एंडेड विश्वविद्यालय-स्तरीय समस्याओं का एक नवीन बेंचमार्क है जिसमें 20% मल्टीमॉडल सामग्री शामिल है, साथ ही समाधान निर्णय (solution judgment) के मूल्यांकन के लिए μ\mu-MATH डेटासेट भी है, ताकि वर्तमान LLMs की मल्टीमॉडल तर्क क्षमता और गणितीय समाधानों का सटीक आकलन करने की क्षमता में महत्वपूर्ण सीमाओं को उजागर किया जा सके।

मूल लेखक: Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

प्रकाशित 2026-02-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Tilga

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विश्वविद्यालय की कक्षा के गणित के होमवर्क का ढेर ग्रेड करने की कोशिश कर रहे एक शिक्षक हैं। लंबे समय तक, आपके द्वारा छात्रों (AI मॉडल्स) को ग्रेड करने के लिए उपयोग किए जाने वाले "टेस्ट" प्राथमिक विद्यालय की क्विज़ की तरह थे: सरल, बहुविकल्पीय प्रश्न जिन्हें सबसे बुद्धिमान बच्चे भी आसानी से हल कर सकते थे। लेकिन अब, छात्र (AI) इन सरल टेस्ट में इतने अच्छे हो गए हैं कि ये टेस्ट अब यह नहीं बता पाते कि कौन वास्तव में प्रतिभाशाली है और कौन केवल अनुमान लगा रहा है।

यहाँ आपने जो पेपर साझा किया है, वह U-MATH और µ-MATH पेश करता है, जो विशेष रूप से विश्वविद्यालय-स्तरीय गणित के लिए डिज़ाइन किया गया एक बिल्कुल नया, बहुत कठिन फाइनल एग्जाम है, साथ ही उत्तरों को निष्पक्ष रूप से ग्रेड करने में मदद करने के लिए एक विशेष "शिक्षक मार्गदर्शिका" भी है।

यहाँ उन्होंने क्या किया, इसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. नया एग्जाम: U-MATH

समस्या: पिछले टेस्ट बहुत आसान या बहुत सीमित थे। वे ज्यादातर हाई स्कूल के विषयों को कवर करते थे या केवल बहुविकल्पीय प्रश्न थे जहाँ AI बिना वास्तव में गणित किए सही उत्तर का अनुमान लगा सकता था। साथ ही, उनमें शायद ही कभी चित्रों या ग्राफों को शामिल किया गया, जबकि वास्तविक गणित में अक्सर ऐसा होता है।

समाधान: लेखकों ने U-MATH बनाया, जो अमेरिका के वास्तविक विश्वविद्यालय पाठ्यक्रमों से सीधे लिए गए 1,100 बिल्कुल नए, अप्रकाशित प्रश्नों का एक संग्रह है।

  • कठिनाई: ये साधारण क्विज़ नहीं हैं। ये ओपन-एंडेड (open-ended) हैं, जिसका अर्थ है कि AI को पूरा समाधान लिखना होगा, न कि केवल "A, B, C, या D" चुनना होगा।
  • विजुअल्स (Visuals): लगभग 20% समस्याओं में चित्र शामिल हैं, जैसे ग्राफ, ज्यामितीय आकृतियाँ, या डेटा टेबल। यह AI को एक वाक्य पढ़ने के बजाय एक ब्लूप्रिंट को देखते हुए गणित की समस्या हल करने के लिए कहने जैसा है।
  • विषय: यह बीजगणित (Algebra) से लेकर कलन (Calculus) तक छह मुख्य विश्वविद्यालय विषयों को कवर करता है।

परिणाम: जब उन्होंने इस नए एग्जाम पर सबसे स्मार्ट AI मॉडल्स का परीक्षण किया:

  • केवल टेक्स्ट (Text-only): AI केवल शब्दों वाले प्रश्नों पर काफी अच्छा प्रदर्शन करता है (लगभग 93% सही)।
  • विजुअल (Visual): जब चित्रों को शामिल किया गया, तो AI काफी संघर्ष करता है, और इसकी सटीकता गिरकर लगभग 58% रह गई। यह ऐसा है जैसे AI एक रेसिपी को बिना किसी गलती के पढ़ सकता है, लेकिन जब उसे खाना बनाने के लिए सामग्री की तस्वीर देखनी होती है, तो वह भ्रमित हो जाता है।

2. शिक्षक की मार्गदर्शिका: µ-MATH

समस्या: इन ओपन-एंडेड उत्तरों को कैसे ग्रेड करें? यदि एक छात्र x/2 लिखता है और उत्तर कुंजी कहती है 0.5x, तो क्या यह सही है? यदि होमवर्क ग्रेड करने वाला AI गलती करता है, तो हमें कैसे पता चलेगा? आमतौर पर, हम AI को खुद को ग्रेड करने के लिए छोड़ देते हैं, लेकिन पेपर दिखाता है कि AI "जज" अक्सर पक्षपाती या असंगत होते हैं।

समाधान: उन्होंने µ-MATH (उच्चारण: म्यू-मैथ) बनाया। इसे एक शिक्षकों के लिए मेटा-एग्जाम के रूप में समझें।

  • उन्होंने U-MATH के कुछ प्रश्नों को लिया और चार अलग-अलग शीर्ष AI मॉडल्स से उत्तर (कुछ सही, कुछ गलत) तैयार करवाए।
  • फिर, उन्होंने अन्य AI मॉडल्स को "जज" के रूप में कार्य करने के लिए कहा और उन उत्तरों को ग्रेड करने को कहा।
  • महत्वपूर्ण रूप से, उन्होंने मानव विशेषज्ञों से सही उत्तरों को सत्यापित करवाया, ताकि उन्हें पता चल सके कि "जज" AI वास्तव में कितने अच्छे थे। इससे उन्हें यह परीक्षण करने में मदद मिली कि "जज" AI वास्तव में कितने अच्छे थे।

परिणाम:

  • ग्रेडिंग करना कठिन है: यहाँ तक कि सर्वश्रेष्ठ AI जज भी लगभग 90% मामलों में सही ग्रेडिंग कर पाते हैं। वे पूर्ण नहीं हैं।
  • एक अच्छा छात्र होना आपको एक अच्छा शिक्षक नहीं बनाता: कुछ AI मॉडल गणित के सवालों को हल करने में बेहतरीन थे लेकिन ग्रेडिंग करने में बहुत खराब थे। कुछ इसके विपरीत थे।
  • पक्षपात (Bias): जजों के अपने "पसंदीदा" थे। उदाहरण के लिए, कुछ जज कुछ AI मॉडल्स के उत्तरों पर बहुत सख्त थे और दूसरों पर बहुत उदार थे, चाहे गणित वास्तव में सही हो या नहीं।

3. मुख्य निष्कर्ष

  • "विजुअल गैप" (The Visual Gap): AI अभी भी गणित को छवियों के साथ जोड़ने में बहुत खराब है। यह एक ऐसे छात्र की तरह है जो मन में गणित तो कर सकता है लेकिन डायग्राम देखते ही जम जाता है।
  • विशेषज्ञता मायने रखती है: गणित पर विशेष रूप से प्रशिक्षित छोटे AI मॉडल्स (जैसे एक विशेष ट्यूटर) इन कठिन समस्याओं पर विशाल, सामान्य-उद्देश्य वाले मॉडल्स को हरा देते हैं।
  • "जज" की समस्या: हम केवल AI को AI को ग्रेड करने के लिए भरोसा नहीं कर सकते। पेपर दिखाता है कि गणित को जज करना, उसे हल करने से पूरी तरह से अलग कौशल है, और वर्तमान AI जज अभी भी गलतियाँ करने और पक्षपात दिखाने के प्रति प्रवृत्त हैं।

सारांश

लेखकों ने एक विश्वविद्यालय-स्तरीय गणित परीक्षण (U-MATH) बनाया यह देखने के लिए कि AI वास्तव में कितना स्मार्ट है, और एक ग्रेडिंग परीक्षण (µ-MATH) यह देखने के लिए कि AI ग्रेडर्स कितने निष्पक्ष हैं। उन्होंने पाया कि हालांकि AI टेक्स्ट-आधारित गणित में बहुत अच्छा हो रहा है, फिर भी वह विजुअल गणित के लिए संघर्ष करता है, और वह अपने काम को ग्रेड करने के लिए एक पूर्ण शिक्षक के रूप में भरोसेमंद नहीं है। उन्होंने यह सारा डेटा सभी के उपयोग के लिए मुफ्त में उपलब्ध कराया है ताकि शोधकर्ता बेहतर, अधिक ईमानदार AI बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →