ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
यह शोध पत्र ArabicNumBench प्रस्तुत करता है, जो विभिन्न संदर्भों और प्रॉम्प्टिंग रणनीतियों में अरबी संख्या पढ़ने के कार्यों पर 71 लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि हालांकि फ्यू-शॉट चेन-ऑफ-थॉट सटीकता को महत्वपूर्ण रूप से बढ़ाता है, उच्च संख्यात्मक प्रदर्शन अक्सर निरंतर संरचित आउटपुट जनरेशन के साथ सह-संबंध स्थापित करने में विफल रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अरबी दस्तावेजों से नंबरों को ज़ोर से पढ़ने में मदद करने के लिए 71 अलग-अलग रोबोटों की एक टीम को काम पर रखा है। कुछ दस्तावेज़ उन नंबरों का उपयोग करते हैं जिन्हें हम अंग्रेजी में देखते हैं (1, 2, 3), जबकि अन्य पारंपरिक अरबी नंबरों (१, २, ३) का उपयोग करते हैं। आपका लक्ष्य न केवल इन रोबोटों को नंबरों को सही ढंग से पढ़ने के लिए प्रेरित करना है, बल्कि उन्हें एक साफ, व्यवस्थित सूची में लिखने के लिए भी कहना है जिसे आपका कंप्यूटर आसानी से प्रोसेस कर सके।
यह पेपर, ArabicNumBench, उस प्रयोग का रिपोर्ट कार्ड है। यहाँ बताया गया है कि उन्होंने क्या पाया, इसे सरल शब्दों में समझाया गया है:
1. बड़ी समस्या: "सही उत्तर, गलत प्रारूप"
शोधकर्ताओं ने कई सबसे बुद्धिमान रोबोटों में एक अजीब सी गड़बड़ी देखी।
- परिदृश्य: आप एक रोबोट से पूछते हैं, "इस वस्तु की कीमत कितनी है?"
- परिणाम: रोबोट सोचता है, गणना करता है और जानता है कि कीमत ठीक $50 है। वह गणित सही करता है!
- गड़बड़ी: "कीमत $50 है" कहने के बजाय, वह कह सकता है, "खैर, मुझे सोचने दें... वस्तु महंगी है, शायद लगभग पचास डॉलर, वास्तव में यह 50 है, तो हाँ, 50।"
- यह क्यों मायने रखता है: यदि आप एक ऐप बना रहे हैं, तो आपको ज़रूरत है कि रोबोट सिर्फ "50" कहे ताकि आपका कंप्यूटर उसे सेव कर सके। यदि रोबोट बहुत अधिक बोलता है या किसी पैराग्राफ के बीच में नंबर को छिपा देता है, तो आपका कंप्यूटर भ्रमित हो जाता है। रोबोट बुद्धिमान है (वह नंबर जानता है) लेकिन अनाड़ी है (वह "सिर्फ नंबर दें" वाले निर्देश का पालन नहीं कर सकता)।
2. जादू का नुस्खा: "केवल बताओ मत, दिखाओ भी"
टीम ने रोबोट से बात करने के चार अलग-अलग तरीके आज़माए यह देखने के लिए कि कौन सा सबसे अच्छा काम करता है।
- "कोल्ड स्टार्ट" (Zero-Shot): सीधे सवाल पूछना। परिणाम: रोबोट बहुत खराब थे, वे केवल 29% बार ही सही हो पा रहे थे। यह एक छात्र को बिना उदाहरण दिखाए गणित का सवाल हल करने के लिए कहने जैसा था।
- "जादू का नुस्खा" (Few-Shot Chain-of-Thought): शोधकर्ताओं ने पहले रोबोट को तीन उदाहरण दिए। उन्होंने रोबोट को दिखाया: "यहाँ एक प्रश्न है, यहाँ मेरी सोचने की प्रक्रिया है, और यहाँ अंतिम उत्तर है।" फिर उन्होंने असली सवाल पूछा।
- परिणाम: यह एक गेम-चेंजर साबित हुआ। सटीकता उछलकर 80% हो गई। यह एक छात्र को टेस्ट से पहले एक हल किया हुआ उदाहरण दिखाने जैसा है; अचानक, वे खेल के नियम समझ जाते हैं।
3. चौंकाने वाली खोज: "कुलीन" बनाम "अनाड़ी"
"जादू के नुस्खे" के बावजूद, रोबोट दो बहुत अलग समूहों में बंट गए:
- कुलीन समूह (द "ओलंपियंस"): लगभग 6 मॉडल (जैसे Qwen3 Max और Llama 3.1) एकदम परफेक्ट थे। उन्होंने नंबर भी सही बताए और उत्तर को साफ-सुथरे प्रारूप में देने के निर्देशों का भी पालन किया। वे एक पेशेवर शेफ की तरह थे जो न केवल एक बेहतरीन भोजन पकाते हैं बल्कि उसे खूबसूरती से सजाकर भी परोसते हैं।
- अनाड़ी समूह (द "जीनियस विथ बैड पेनमैनशिप"): कई अन्य मॉडल (जैसे Gemini 2.5 Pro) गणित के जीनियस थे। उन्होंने 99% बार नंबर सही बताए! लेकिन, वे प्रारूप (format) बनाने में विफल रहे। वे एक प्रतिभाशाली वैज्ञानिक की तरह थे जो कॉफी के दागों से सने नैपकिन पर समीकरण हल करता है, जिससे लैब असिस्टेंट के लिए उसे पढ़ना असंभव हो जाता है।
4. वास्तविक दुनिया के लिए सबक
पेपर अरबी सॉफ्टवेयर बनाने वाले किसी भी व्यक्ति के लिए एक बहुत ही महत्वपूर्ण चेतावनी के साथ समाप्त होता है:
केवल स्कोर न देखें!
यदि आप किसी रोबोट मॉडल को केवल इसलिए चुनते हैं क्योंकि उसका "सटीकता स्कोर" (वह नंबर जानता है) अधिक है, तो आप एक ऐसा सिस्टम बना सकते हैं जो आपके सॉफ्टवेयर को तोड़ देगा क्योंकि वह सरल फॉर्मेटिंग नियमों का पालन नहीं कर सकता।
मुख्य बातें:
- उन्हें उदाहरण से सिखाएं: हमेशा AI को कुछ उदाहरण दिखाएं कि आप उत्तर कैसे चाहते हैं (Few-Shot)।
- लिखावट की जाँच करें: किसी AI को चुनते समय, केवल यह न पूछें, "क्या आप गणित कर सकते हैं?" पूछें, "क्या आप मुझे एक साफ सूची में उत्तर दे सकते हैं?"
- सही टूल चुनें: केवल कुछ ही "कुलीन" मॉडल गणित और फॉर्मेटिंग दोनों को पूरी तरह से कर सकते हैं। यदि आपको एक विश्वसनीय सिस्टम चाहिए, तो आपको उन विशिष्ट मॉडलों में से एक को चुनना होगा, न कि केवल उसे जिसका गणित स्कोर सबसे अधिक है।
संक्षेप में: बुद्धिमान होना काफी नहीं है; आपको आज्ञाकारी भी होना पड़ता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।