MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese
यह शोध पत्र Math-PT को प्रस्तुत करता है, जो यूरोपीय और ब्राज़ीलियाई पुर्तगाली में मूल प्रतियोगिताओं और परीक्षाओं से लिए गए 1,729 गणितीय समस्याओं का एक नया बेंचमार्क डेटासेट है, जो यह प्रकट करता है कि जहाँ अत्याधुनिक LLMs बहुविकल्पीय प्रश्नों पर अच्छा प्रदर्शन करते हैं, वहीं उनकी क्षमता दृश्य और मुक्त-अंत वाले कार्यों पर घट जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) उन प्रतिभाशाली छात्रों की तरह हैं जिन्होंने दुनिया के लगभग हर पुस्तकालय की किताबें पढ़ ली हैं। वर्षों से, हमने उनकी गणितीय क्षमताओं का परीक्षण केवल अंग्रेजी में लिखे गए परीक्षाओं के माध्यम से किया है। यह एक छात्र को केवल अंग्रेजी में ड्राइविंग टेस्ट देने जैसा है और फिर यह मान लेना कि वह किसी भी भाषा में ड्राइविंग करने में सक्षम है क्योंकि उसने वह एकल परीक्षा पास कर ली है।
MATH-PT नामक शोध पत्र तर्क देता है कि यह दृष्टिकोण एक बहुत बड़ी खामी है। यह एक नया "ड्राइविंग टेस्ट" पेश करता है जो विशेष रूप से पुर्तगाली (यूरोपीय और ब्राजीलियाई दोनों संस्करणों) में लिखा गया है ताकि यह जांचा जा सके कि क्या ये AI छात्र वास्तव में यह संभाल सकते हैं कि जब भाषा बदलती है तो गणित कैसे काम करता है।
यहाँ उनके निष्कर्षों का सरल उपमाओं के साथ विवरण दिया गया है:
1. समस्या: "अंग्रेजी-मात्र" पुस्तकालय
अधिकांश गणितीय बेंचमार्क (जैसे MATH या MathVista) एक ऐसे पुस्तकालय की तरह हैं जहाँ हर किताब अंग्रेजी में लिखी गई है। यहाँ तक कि जब शोधकर्ता अन्य भाषाओं में परीक्षण करने का प्रयास करते हैं, तो वे केवल अंग्रेजी की किताबों का अनुवाद करते हैं। लेखक कहते हैं कि यह अनुचित है, क्योंकि यह हमें यह नहीं बताता कि क्या AI वास्तव में गणितीय अवधारणाओं को समझता है या उसने केवल अंग्रेजी पैटर्न को याद कर लिया है। वे पुर्तगाली में जन्मी गणित की समस्याओं का एक पुस्तकालय बनाना चाहते थे, जो वास्तविक पुर्तगाली और ब्राजीलियाई गणित ओलंपियाड और स्कूली परीक्षाओं से ली गई हों।
2. नया टेस्ट: MATH-PT
टीम ने MATH-PT नाम का एक डेटासेट बनाया जिसमें 1,729 समस्याएं शामिल हैं।
- स्रोत: उन्होंने केवल अनुवाद नहीं किया; बल्कि उन्होंने Olimpíadas Portuguesas da Matemática और ब्राजील के OBMEP जैसी प्रतियोगिताओं के मूल अभिलेखों की गहराई से खोज की।
- विविधता: यह टेस्ट 5वीं कक्षा की पहेलियों से लेकर विश्वविद्यालय अध्ययन से पहले की चुनौतियों तक सब कुछ कवर करता है।
- प्रारूप: इसमें बहुविकल्पीय प्रश्न (एक उत्तर पत्र की तरह) और खुले प्रश्न (जहाँ आपको उत्तर खुद से लिखना होता है) शामिल हैं। महत्वपूर्ण बात यह है कि कई प्रश्नों में आरेख और चित्र (जैसे ज्यामितीय आकृतियाँ) शामिल हैं, जिन्हें टीम ने कोड का उपयोग करके सावधानीपूर्वक संरक्षित किया है ताकि AI उन्हें "देख" सके।
3. परिणाम: "बुद्धिमान वाला" बनाम "संघर्ष करने वाला"
उन्होंने 13 अलग-अलग AI मॉडलों का परीक्षण किया, जिनमें सबसे शक्तिशाली "फ्रंटियर" मॉडल (सुपर-जीनियस) से लेकर छोटे, ओपन-सोर्स मॉडल (औसत छात्र) तक शामिल थे।
- बहुविकल्पीय लाभ: बहुविकल्पीय प्रश्नों को "अंतर ढूंढने" के खेल के रूप में सोचें। AI मॉडल इसमें बहुत अच्छे थे। छोटे मॉडल भी अक्सर सही अक्षर (A, B, C, D, या E) का अनुमान लगाने में सक्षम थे।
- खुले प्रश्नों के साथ संघर्ष: जब टेस्ट बहुविकल्पीय से खुले प्रश्नों (जहाँ AI को स्वयं उत्तर उत्पन्न करना होता है) में बदला, तो स्कोर काफी गिर गया। यह किसी चेहरे को भीड़ में पहचानने और उस चेहरे को याददाश्त से बनाने के बीच के अंतर जैसा है। AI को तब बहुत अधिक कठिनाई हुई जब उसे केवल चुनने के बजाय "सोचना" और उत्तर स्वयं लिखना पड़ा।
- "इमेज" की समस्या: यह सबसे बड़ी बाधा थी। जब किसी प्रश्न में आरेख (एक चित्र) शामिल था, तो AI का प्रदर्शन तेजी से गिर गया। यहाँ तक कि सबसे स्मार्ट मॉडल भी भ्रमित हो गए जब उन्हें टेक्स्ट के साथ एक दृश्य आकृति की व्याख्या करनी पड़ी। यह एक छात्र को आंखों पर पट्टी बांधकर ज्यामिति की समस्या हल करने के लिए कहने जैसा है; वे शब्दों को पढ़ सकते हैं, लेकिन वे आकार को "देख" नहीं सकते।
4. विजेता और हारने वाले
- चैंपियंस: "फ्रंटियर" मॉडल (जैसे GPT-5 और Qwen3-235B) स्पष्ट विजेता थे। उन्होंने पुर्तगाली गणित को अच्छी तरह से संभाला, विशेष रूप से बहुविकल्पीय प्रश्नों को।
- संघर्ष करने वाले: छोटे, ओपन-सोर्स मॉडल (जैसे Llama-3 और Gemma-3) को गणित बहुत कठिन लगा। जैसे ही प्रश्न कठिन हुए या उनमें चित्र शामिल हुए, उनकी सटीकता नाटकीय रूप से गिर गई।
- स्केलिंग प्रभाव: कार्य में पाया गया कि Qwen परिवार के मॉडलों के लिए, मॉडल को बड़ा करना (अधिक "ब्रेनपावर" जोड़ना) बहुत मददगार रहा। यह एक साइकिल से स्पोर्ट्स कार में स्विच करने जैसा है; बड़े मॉडल छोटे मॉडलों की तुलना में जटिल तर्क कार्यों को बेहतर ढंग से संभालते हैं।
निष्कर्ष
यह कार्य निष्कर्ष निकालता है कि जबकि AI गणित में बहुत अच्छा हो रहा है, यह अभी भी एक "भाषा पूर्वाग्रह" प्रदर्शित करता है और संघर्ष करता है जब टेस्ट कठिन (खुले-अंत वाले) या दृश्य (आरेख) हो जाता है। इस पुर्तगाली डेटासेट को जारी करके, लेखक शोधकर्ताओं को एक नया, निष्पक्ष पैमाना प्रदान करते हैं जिससे यह मापा जा सके कि AI वास्तव में अंग्रेजी के अलावा अन्य भाषाओं में कितनी अच्छी तरह सोच सकता है। वे यह नहीं कह रहे हैं कि AI पहले से ही पूर्ण है; वे कह रहे हैं: "यहाँ एक नया टेस्ट है जो हमें दिखाता है कि AI अभी भी कहाँ सीख रहा है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।