OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
यह शोध पत्र OMGEval को प्रस्तुत करता है, जो कि पांच भाषाओं में 804 कठोरता से सत्यापित, सांस्कृतिक रूप से स्थानीयकृत मुक्त-अंत वाले प्रश्नों वाला पहला ओपन-सोर्स बहुभाषी जनरेटिव मूल्यांकन बेंचमार्क है, जिसका उद्देश्य बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की बहुभाषी क्षमताओं का आकलन करना और उनमें सुधार करना है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक शानदार, सर्वज्ञानी लाइब्रेरियन बनाया है जो दुनिया की हर भाषा बोल सकता है। आप यह परीक्षण करना चाहते हैं कि क्या यह लाइब्रेरियन वास्तव में सभी संस्कृतियों में बुद्धिमान है, या वह केवल संयुक्त राज्य अमेरिका की संस्कृति को समझने वाला एक "स्थानीय विशेषज्ञ" है।
यह शोध पत्र OMGEval को पेश करता है, जो इन AI लाइब्रेरियन (लार्ज लैंग्वेज मॉडल्स) के लिए मूल रूप से एक बहुसांस्कृतिक "ड्राइविंग लाइसेंस" टेस्ट है।
यहाँ बताया गया है कि लेखकों ने क्या किया, सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "अमेरिकन टीवी" का पूर्वाग्रह
अधिकांश वर्तमान परीक्षण एक ऐसे टीवी शो को देखने की तरह हैं जो केवल अंग्रेजी में प्रसारित होता है और अमेरिकी छुट्टियों, भोजन और इतिहास के बारे में बात करता है।
- समस्या: यदि आप एक AI से पूछते हैं, "थैंक्सगिविंग के लिए पारंपरिक भोजन क्या है?" तो वह सही ढंग से कहेगा "टर्की।" लेकिन यदि आप एक चीनी वक्ता से पूछते हैं, "ड्रैगन बोट फेस्टिवल के लिए पारंपरिक भोजन क्या है?" तो एक AI जो केवल अमेरिकी डेटा पर प्रशिक्षित है, भ्रमित हो सकता है या गलत उत्तर दे सकता है क्योंकि वह स्थानीय संस्कृति को नहीं समझता है।
- शोध पत्र का दावा: मौजूदा अधिकांश परीक्षण अंग्रेजी पर बहुत अधिक केंद्रित हैं। वे यह जांच नहीं करते हैं कि क्या AI समझता है कि रूस में, ईस्टर में विशिष्ट केक शामिल होते हैं, या स्पेन में, ऑल सेंट्स डे के लिए विशिष्ट मिठाइयाँ होती हैं।
2. समाधान: OMGEval (एक "लोकल टूर गाइड" टेस्ट)
लेखकों ने OMGEval नामक एक नया परीक्षण बनाया। केवल अंग्रेजी प्रश्नों का अन्य भाषाओं में अनुवाद करने के बजाय (जो रूसी फिल्म पर अंग्रेजी सबटाइटल लगाने जैसा है), उन्होंने प्रश्नों को स्थानीय संस्कृति के अनुरूप फिर से लिखा।
- उपमा: कल्पना कीजिए कि "समर वेकेशन" (गर्मी की छुट्टियां) के बारे में एक परीक्षण प्रश्न है।
- पुराना तरीका (अनुवाद): "अमेरिकी गर्मी की छुट्टियों के लिए कहाँ जाते हैं?" (उत्तर: हवाई)।
- OMGEval का तरीका (स्थानीयकरण): "चीनी लोग गर्मी की छुट्टियों के लिए कहाँ जाते हैं?" (उत्तर: सान्या)।
- यह क्यों मायने रखता है: दोनों प्रश्न "समर वेकेशन स्पॉट्स" के बारे में पूछते हैं, लेकिन सांस्कृतिक संदर्भ अलग है। OMGEval यह सुनिश्चित करता है कि AI कहानी के स्थानीय संस्करण को जानता हो, न कि केवल अमेरिकी संस्करण को।
3. उन्होंने इसे कैसे बनाया
टीम ने केवल चीजों को अनुवादित करने के लिए रोबोट का उपयोग नहीं किया; उन्होंने भाषाई विशेषज्ञों की एक टीम का उपयोग किया जो सांस्कृतिक संपादकों के रूप में कार्य करते थे।
- प्रक्रिया: उन्होंने 804 ओपन-एंडेड प्रश्न (जैसे पहेलियाँ, तथ्य या रचनात्मक लेखन प्रॉम्प्ट) लिए और उन्हें 5 भाषाओं के लिए अनुकूलित किया: चीनी, रूसी, फ्रेंच, स्पेनिश और अरबी।
- "मानवीय स्पर्श": यदि किसी प्रश्न में किसी विशिष्ट अमेरिकी हस्ती का उल्लेख था, तो उन्होंने उसे एक प्रसिद्ध स्थानीय व्यक्तित्व से बदल दिया। यदि किसी प्रश्न में किसी विशिष्ट अमेरिकी अवकाश का उल्लेख था, तो उन्होंने उसे स्थानीय उत्सव से बदल दिया। उन्होंने यह सुनिश्चित करने के लिए ऐसा किया कि AI को केवल शब्दों के अनुवाद की क्षमता पर नहीं, बल्कि इस क्षमता पर परखा जाए कि वह उस विशिष्ट संस्कृति को समझता है या नहीं।
4. उन्होंने AI को कैसे ग्रेड किया
चूंकि मनुष्य तुरंत पांच भाषाओं में हजारों उत्तर नहीं पढ़ सकते, इसलिए उन्होंने एक रेफरी के रूप में GPT-4 (एक बहुत ही उन्नत AI) का उपयोग किया।
- खेल: उन्होंने AI मॉडल्स को प्रश्नों के उत्तर देने के लिए कहा। फिर, उन्होंने GPT-4 से दो उत्तरों को अगल-बगल देखने और यह तय करने के लिए कहा कि कौन सा बेहतर है।
- जांच: उन्होंने यह सुनिश्चित करने के लिए कि "AI रेफरी" निष्पक्ष है या नहीं, वास्तविक मनुष्यों से एक छोटा नमूना ग्रेड करवाया। परिणामों ने दिखाया कि AI रेफरी मनुष्यों के साथ बहुत सटीक था (लग लगभग 90% सहमति)।
5. परिणाम: कौन पास हुआ?
उन्होंने कई अलग-अलग AI मॉडल्स का परीक्षण किया, जिनमें बड़े व्यावसायिक मॉडल (जैसे GPT-4) और ओपन-सोर्स मॉडल (मुफ्त मॉडल जिन्हें कोई भी डाउनलोड कर सकता है) शामिल थे।
- विजेता: GPT-4 एकमात्र मॉडल था जिसने लगातार 50% से ऊपर स्कोर किया (यानी इसने आधे से अधिक बार बेसलाइन को हराया)। वह "स्टार स्टूडेंट" था।
- संघर्ष: ओपन-सोर्स मॉडल (जैसे Guanaco, Phoenix, और अन्य) काफी संघर्ष करते हैं।
- अंतर: जबकि GPT-4 सांस्कृतिक बारीकियों को अच्छी तरह से संभाल सकता था, ओपन-सोर्स मॉडल्स अक्सर तथ्यात्मक गलतियाँ करते थे या सांस्कृतिक संदर्भ को मिस कर देते थे। उदाहरण के लिए, जब एक प्रसिद्ध चीनी निर्देशक की पहली फिल्म के बारे में पूछा गया, तो कुछ ओपन-सोर्स मॉडल्स ने गलत वर्ष या गलत फिल्म का शीर्षक दिया, जबकि GPT-4 ने सही उत्तर दिया।
- निष्कर्ष: सांस्कृतिक बारीकियों को समझने के मामले में शीर्ष-स्तरीय वाणिज्यिक मॉडल्स और ओपन-सोर्स मॉडल्स के बीच एक बड़ा अंतर है। ओपन-सोर्स मॉडल्स उन छात्रों की तरह हैं जिन्होंने पाठ्यपुस्तक तो पढ़ी लेकिन स्थानीय बोली को समझने में विफल रहे।
सारांश
OMGEval एक नया, अधिक निष्पक्ष परीक्षण है जो यह जांचता है कि क्या AI मॉडल दुनिया की विविध संस्कृतियों को समझते हैं, न कि केवल दुनिया के अमेरिकी संस्करण को। शोध पत्र दिखाता है कि जबकि सबसे अच्छा AI (GPT-4) इसमें काफी अच्छा है, कई अन्य मॉडल्स अभी भी विभिन्न भाषाओं और संस्कृतियों के स्थानीय "स्वाद" को समझने के लिए संघर्ष कर रहे हैं। लेखक आशा करते हैं कि यह परीक्षण समुदाय को भविष्य में बेहतर, अधिक सांस्कृतिक रूप से जागरूक AI बनाने में मदद करेगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।