Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results
यह शोध पत्र यह प्रकट करता है कि बहुभाषी LLMs में उच्च-संसाधन और निम्न-संसाधन भाषाओं के बीच दिखने वाला प्रदर्शन अंतराल काफी हद तक MGSM बेंचमार्क में अनुवाद त्रुटियों और असंगत उत्तर निष्कर्षण का एक परिणाम है, जो इन डेटा गुणवत्ता संबंधी समस्याओं को ठीक करने पर समाप्त हो जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो विभिन्न भाषाओं के बोलने वाले छात्रों के लिए एक गणित का टेस्ट ग्रेड कर रहे हैं। आप यह जानना चाहते हैं कि क्या आपके छात्र गणित में समान रूप से अच्छे हैं, चाहे वे अंग्रेजी, फ्रेंच, स्वाहिली या बंगाली बोल रहे हों।
यह पेपर वास्तव में इस बात की एक रिपोर्ट कार्ड है कि हम इन टेस्ट को कैसे ग्रेड कर रहे थे, और यह एक चौंकाने वाली गलती को उजागर करता है: हम छात्रों को एक टूटे हुए टेस्ट पेपर और एक दोषपूर्ण ग्रेडिंग मशीन के आधार पर ग्रेड कर रहे थे।
यहाँ शोधकर्ताओं ने जो पाया है, उसका सरल विवरण दिया गया है:
1. प्रारंभिक (गलत) निष्कर्ष
शोधकर्ताओं ने MGSM नामक एक लोकप्रिय गणित टेस्ट को देखना शुरू किया। यह टेस्ट 250 सरल गणितीय समस्याओं (जैसे, "यदि आपके पास 5 सेब हैं...") को लेता है और उन्हें 10 अलग-अलग भाषाओं में अनुवादित करता है।
जब उन्होंने अपने AI मॉडल (जो "छात्र" हैं) को इस टेस्ट के माध्यम से चलाया, तो परिणाम गैर-अंग्रेजी भाषियों के लिए बहुत खराब दिखे।
- उपमा: यह ऐसा था जैसे एक छात्र जो फ्रेंच बोलता है उसे गणित के टेस्ट में 60% मिला, जबकि अंग्रेजी बोलने वाले छात्र को 98% मिला।
- प्रारंभिक विचार: सभी ने मान लिया कि AI अन्य भाषाओं में गणित करने में उतना "स्मार्ट" नहीं है। उन्हें लगा कि एक बड़ा "भाषाई अंतर" (language gap) है जहाँ AI अन्य भाषाओं में तर्क करने में संघर्ष करता है।
2. जांच: "रुको, टेस्ट पेपर टूटा हुआ है!"
शोधकर्ताओं ने एक जासूस की तरह टेस्ट प्रश्नों का बारीकी से निरीक्षण करने का निर्णय लिया। उन्होंने दो प्रमुख समस्याएं पाईं जो स्कोर को बिगाड़ रही थीं:
समस्या A: "अनुवाद में खो जाने" वाली त्रुटियां (Lost in Translation Errors)
जिन मानव अनुवादकों ने यह टेस्ट बनाया था, उनसे सूक्ष्म गलतियाँ हुईं।
- रूपक: कल्पना कीजिए कि एक गणित की समस्या कहती है, "मंगलवार को, मैं सोमवार की तुलना में 6 गुना अधिक दूर चला।" लेकिन जर्मन अनुवाद ने गलती से "मंगलवार" को बदलकर "गुरुवार" कर दिया।
- परिणाम: AI मॉडल, जो बहुत तार्किक होता है, प्रश्न को देखता है और कहता है, "रुको, दिन मेल नहीं खा रहे हैं! मैं इसे हल नहीं कर सकता!" इसलिए, उसने उत्तर गलत दिया। लेकिन गलती AI के गणित कौशल की नहीं थी; बल्कि टूटे हुए प्रश्न की थी।
समस्या B: "दोषपूर्ण ग्रेडिंग मशीन"
भले ही AI ने सही उत्तर दिया हो, लेकिन उत्तर पढ़ने वाला कंप्यूटर प्रोग्राम बहुत कठोर था।
- रूपक: कल्पना कीजिए कि AI उत्तर लिखता है "2.000" (हजारों के लिए बिंदु का उपयोग करना, जो यूरोप में आम है)। ग्रेडिंग मशीन, जो अंग्रेजी शैली की अपेक्षा करती है, बिंदु को देखती है और सोचती है, "ओह, यह एक दशमलव बिंदु है! यह 2.000... रुको, यह 2 है।" या इससे भी बुरा, वह कॉमा (comma) देखकर भ्रमित हो जाती है।
- परिणाम: AI ने वास्तव में समस्या को सही ढंग से हल किया था, लेकिन "ग्रेडिंग मशीन" ने इसे गलत घोषित कर दिया क्योंकि वह यह नहीं समझ पाई कि अलग-अलग देशों में नंबर लिखने के तरीके अलग होते हैं।
3. समाधान: गंदगी की सफाई
शोधकर्ताओं ने दो काम किए:
- प्रश्नों को ठीक किया: उन्होंने टेस्ट की समीक्षा की, अनुवाद त्रुटियों (जैसे "मंगलवार बनाम गुरुवार" का मिश्रण) को ढूंढा और उन्हें सुधारा।
- ग्रेडर को ठीक किया: उन्होंने कंप्यूटर प्रोग्राम को अपडेट किया ताकि वह नंबरों को पढ़ने में अधिक स्मार्ट हो सके। इसने सीखा कि फ्रेंच में कॉमा एक दशमलव बिंदु हो सकता है, और जर्मन में डॉट (dot) एक हजार विभाजक हो सकता है।
4. नए परिणाम: अंतर गायब हो गया
जब उन्होंने सुधारे हुए प्रश्नों और स्मार्ट ग्रेडर के साथ टेस्ट दोबारा चलाया, तो परिणाम पूरी तरह बदल गए।
- उपमा: यह ऐसा था जैसे यह महसूस करना कि फ्रांसीसी छात्र वास्तव में 98% ही लाया था, लेकिन हम बस उनके पेपर को गलत पढ़ रहे थे।
- परिणाम: अंग्रेजी और अन्य भाषाओं के बीच प्रदर्शन का बड़ा अंतर लगभग समाप्त हो गया। सबसे मजबूत AI मॉडल के लिए, वे फ्रेंच, रूसी या स्वाहिली में भी उतने ही अच्छे थे जितने कि अंग्रेजी में।
बड़ी सीख
पेपर यह निष्कर्ष निकालता है कि सबसे स्मार्ट AI मॉडल के लिए, भाषाओं के बीच कोई वास्तविक "गणित अंतराल" (math gap) नहीं है। मॉडल किसी भी भाषा में गणित को ठीक से कर सकते हैं।
जिस कारण हमें लगा कि एक अंतर है, वह था:
- टेस्ट प्रश्न खराब तरीके से अनुवादित किए गए थे।
- हम उत्तरों को ऐसे टूल के साथ ग्रेड कर रहे थे जो स्थानीय नंबर फॉर्मेट को नहीं समझता था।
मुख्य बात:
AI को अन्य भाषाओं में "गणित में खराब" होने के लिए दोष देने से पहले, हमें यह सुनिश्चित करना होगा कि हमारे टेस्ट वास्तव में निष्पक्ष हैं और हमारे ग्रेडिंग टूल सही ढंग से काम कर रहे हैं। शोधकर्ताओं ने अपना सुधारा हुआ टेस्ट जारी किया है ताकि अन्य सभी लोग भविष्य को मापने के लिए एक निष्पक्ष पैमाने का उपयोग कर सकें।
यह पेपर क्या नहीं कहता:
- यह नहीं कहता कि AI सभी भाषाओं में पूर्ण है (छोटे, कमजोर मॉडल अभी भी थोड़ा संघर्ष करते हैं)।
- यह नहीं कहता कि हमें अन्य भाषाओं में परीक्षण करना बंद कर देना चाहिए।
- यह दावा नहीं करता कि सभी बेंचमार्क टूटे हुए हैं, केवल यह कि इस विशिष्ट बेंचमार्क (MGSM) में ये विशिष्ट समस्याएं थीं।
संक्षेप में: समस्या AI की नहीं थी; टेस्ट की थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।