← नवीनतम पेपर
🤖 AI

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

यह शोध पत्र PyraMathBench प्रस्तुत करता है, जो एक व्यापक पदानुक्रमित (hierarchical) बेंचमार्क है जिसे लार्ज लैंग्वेज मॉडल्स में संख्यात्मक प्रसंस्करण और गणितीय तर्क के एकीकरण का मूल्यांकन करने के लिए डिज़ाइन किया गया है, और यह SOLVE मॉड्यूल और IRPO प्रशिक्षण पद्धति का प्रस्ताव करता है ताकि संख्यात्मक गणना और अमूर्त तर्क की कमजोरियों को दूर करके मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।

मूल लेखक: Zetian Ouyang, Linlin Wang, Gerard de Melo, Liang He

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zetian Ouyang, Linlin Wang, Gerard de Melo, Liang He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) बहुत बुद्धिमान, विद्वान छात्रों की तरह हैं जो कविता लिख सकते हैं और इतिहास की किताबों का सारांश पूरी सटीकता से दे सकते हैं। हालाँकि, जब आप उन्हें गणित की एक शब्द समस्या (word problem) देते हैं, तो वे अक्सर लड़खड़ा जाते हैं। वे कहानी को समझ तो सकते हैं, लेकिन वास्तविक संख्याओं में विफल हो जाते हैं, या वे "हैलुसिनेट" (hallucinate) कर सकते हैं (यानी ऐसी संख्याएँ बना लेते हैं जो वहाँ हैं ही नहीं)।

"PyraMathBench" नामक शोध पत्र इन छात्रों का परीक्षण करने का एक नया तरीका और उन्हें सीखने में मदद करने की एक नई विधि पेश करता है। इसका विवरण सरल शब्दों में यहाँ दिया गया है:

1. समस्या: गणित की विफलता का "ब्लैक बॉक्स" (Black Box)

वर्तमान में, जब हम गणित पर AI का परीक्षण करते हैं, तो हम आमतौर पर केवल अंतिम उत्तर देखते हैं। क्या उन्होंने सही उत्तर दिया? हाँ या नहीं।

  • दोष: यदि उत्तर गलत है, तो हमें यह नहीं पता चलता कि क्यों। क्या AI ने प्रश्न को गलत समझा? क्या वह गणित का कोई नियम भूल गया? या क्या उसने केवल अंकगणित (arithmetic) गलत किया (जैसे कि टूटे हुए बटन वाला कैलकुलेटर)?
  • उपमा: यह एक छात्र के निबंध को केवल अंतिम ग्रेड देखकर ग्रेड करने जैसा है। यदि उसे "C" मिला है, तो आपको नहीं पता कि उसकी लिखावट खराब थी, उसने प्रॉम्प्ट को नहीं समझा था, या उसने वर्तनी (spelling) की गलती की थी। आपको समस्या को ठीक करने के लिए उसके चरणों (steps) को देखने की आवश्यकता है।

2. समाधान: PyraMathBench (द "पिरामिड" टेस्ट)

लेखकों ने PyraMathBench नामक एक विशाल नया बेंचमार्क बनाया है। इसे गणित के कौशल का एक पिरामिड समझें।

  • संरचना: केवल AI को एक कठिन समस्या देने के बजाय, वे इसे तोड़ देते हैं। वे 7,404 वास्तविक दुनिया की गणितीय कहानियों को लेते हैं और उन्हें 32,505 छोटे टुकड़ों (subtasks) में विभाजित करते हैं।
  • परतें (Layers):
    • आधार (संख्यात्मक पार्सिंग - Numerical Parsing): क्या AI टेक्स्ट में संख्याओं को ढूंढ सकता है? क्या वह एक तस्वीर से संख्याएं पढ़ सकता है?
    • मध्य (समझ और गणना - Understanding & Calculation): क्या वह कहानी को गणितीय समीकरण में बदल सकता है? क्या वह वास्तव में जोड़ या समीकरण को हल कर सकता है?
    • शीर्ष (जटिल तर्क - Complex Reasoning): क्या वह मूल कठिन समस्या को हल करने के लिए इन सबको एक साथ जोड़ सकता है?
  • परिणाम: हर परत पर AI का परीक्षण करके, शोधकर्ताओं ने पाया कि कई शीर्ष-स्तरीय AI वास्तव में बुनियादी बातों में बहुत खराब हैं। वे अक्सर चित्रों में संख्याओं को पहचानने में विफल रहते हैं या सरल अंकगणित में भ्रमित हो जाते हैं, भले ही वे तर्क (logic) में स्मार्ट हों।

3. निदान: क्या गलत है?

11 अलग-अलग AI मॉडल (GPT-4, Llama और DeepSeek जैसे बड़े नामों सहित) का परीक्षण करने के बाद, उन्होंने दो मुख्य कमजोरियाँ पाईं:

  1. संख्याओं को "पढ़ने" में खराब: मॉडल अक्सर टेक्स्ट में संख्याओं को मिस कर देते हैं या, और भी बुरा, छवियों (images) में उन्हें मिस कर देते हैं। वे शायद किसी चित्र में घड़ी देख लें लेकिन समय का गलत अनुमान लगा लें, या वे शब्द समस्या में एक महत्वपूर्ण संख्या को अनदेखा कर सकते हैं।
  2. हैलुसिनेशन (Hallucinating): जब उन्हें कोई संख्या नहीं पता होती, तो वे कहानी को आगे बढ़ाने के लिए कभी-कभी खुद से एक संख्या बना लेते हैं।

4. सुधार: SOLVE और IRPO

AI को बेहतर बनाने में मदद करने के लिए, लेखकों ने दो नए उपकरण बनाए हैं, जैसे कि एक स्मार्ट ट्यूटर और एक पर्सनल ट्रेनर

  • SOLVE (स्मार्ट ट्यूटर):

    • समस्या: AI अक्सर बाहरी उपकरणों (जैसे कैलकुलेटर या कोड इंटरप्रेटर) का उपयोग करने की कोशिश करता है लेकिन विफल हो जाता है क्योंकि वह अनुरोध को गलत तरीके से फॉर्मेट करता है (उदाहरण के लिए, गलत कोड सिंटैक्स लिखना)। यह एक छात्र की तरह है जो कैलकुलेटर का उपयोग करने की कोशिश करता है लेकिन बटन गलत क्रम में दबाता है।
    • समाधान: SOLVE एक मॉड्यूल है जो एक अनुवादक (translator) के रूप में कार्य करता है। यह AI को किसी भी अव्यवस्थपूर्ण तरीके से (यहाँ तक कि "हस्तलिखित" शैली में भी) मदद माँगने की अनुमति देता है, और SOLVE उस अनुरोध को साफ करता है और कैलकुलेटर को एक सटीक अनुरोध भेजता है। यह यह भी जानता है कि AI कब इतना स्मार्ट है कि वह एक साधारण समस्या को अपने आप हल कर सके, ताकि वह टूल कॉल करने में समय बर्बाद न करे।
  • IRPO (पर्सनल ट्रेनर):

    • समस्या: मानक प्रशिक्षण विधियाँ AI को केवल अंतिम उत्तर के लिए पुरस्कृत करती हैं। वे AI को प्रक्रिया के दौरान प्रभावी ढंग से कैलकुलेटर का उपयोग करना नहीं सिखाती हैं।
    • समाधान: IRPO एक नई प्रशिक्षण विधि है। यह AI की पूरी विचार प्रक्रिया पर नज़र रखता है। यदि AI सही समय पर कैलकुलेटर कॉल करता है, तो उसे इनाम मिलता है। यदि वह एक ऐसी समस्या के लिए कैलकुलेटर कॉल करता है जिसे वह स्वयं हल कर सकता था, तो उसे दंड (penalty) मिलता है। यह AI को सिखाता है कि कब सोचना है और कब टूल का उपयोग करना है।

5. परिणाम

जब उन्होंने इन सुधारों को Qwen-2.5 मॉडल पर लागू किया:

  • मॉडल का गणित स्कोर 5.0 अंक बढ़ गया।
  • यह यह जानने में बहुत बेहतर हो गया कि कब कैलकुलेटर का उपयोग करना है और कब गणित स्वयं करना है।

सारांश

यह शोध पत्र तर्क देता है कि AI को गणित में बेहतर बनाने के लिए, हम केवल अंतिम स्कोर को नहीं देख सकते। हमें यह देखने के लिए कि AI कहाँ विफल हो रहा है, गणित को सूक्ष्म कौशलों के पिरामिड में तोड़ना होगा। एक बार जब हम दरारें (जैसे खराब संख्या पहचान) देख लेते हैं, तो हम उन्हें ठीक करने के लिए स्मार्ट टूल्स (SOLVE) और बेहतर प्रशिक्षण (IRPO) बना सकते हैं, जिससे एक भ्रमित छात्र एक गणित के उस्ताद में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →