← नवीनतम पेपर
💬 NLP

OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models

यह शोध पत्र OMGEval को प्रस्तुत करता है, जो कि पांच भाषाओं में 804 कठोरता से सत्यापित, सांस्कृतिक रूप से स्थानीयकृत मुक्त-अंत वाले प्रश्नों वाला पहला ओपन-सोर्स बहुभाषी जनरेटिव मूल्यांकन बेंचमार्क है, जिसका उद्देश्य बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) की बहुभाषी क्षमताओं का आकलन करना और उनमें सुधार करना है।

मूल लेखक: Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

प्रकाशित 2026-02-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Liu, Meng Xu, Shuo Wang, Liner Yang, Haoyu Wang, Zhenghao Liu, Cunliang Kong, Yun Chen, Yang Liu, Maosong Sun, Erhong Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार, सर्वज्ञानी लाइब्रेरियन बनाया है जो दुनिया की हर भाषा बोल सकता है। आप यह परीक्षण करना चाहते हैं कि क्या यह लाइब्रेरियन वास्तव में सभी संस्कृतियों में बुद्धिमान है, या वह केवल संयुक्त राज्य अमेरिका की संस्कृति को समझने वाला एक "स्थानीय विशेषज्ञ" है।

यह शोध पत्र OMGEval को पेश करता है, जो इन AI लाइब्रेरियन (लार्ज लैंग्वेज मॉडल्स) के लिए मूल रूप से एक बहुसांस्कृतिक "ड्राइविंग लाइसेंस" टेस्ट है।

यहाँ बताया गया है कि लेखकों ने क्या किया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "अमेरिकन टीवी" का पूर्वाग्रह

अधिकांश वर्तमान परीक्षण एक ऐसे टीवी शो को देखने की तरह हैं जो केवल अंग्रेजी में प्रसारित होता है और अमेरिकी छुट्टियों, भोजन और इतिहास के बारे में बात करता है।

  • समस्या: यदि आप एक AI से पूछते हैं, "थैंक्सगिविंग के लिए पारंपरिक भोजन क्या है?" तो वह सही ढंग से कहेगा "टर्की।" लेकिन यदि आप एक चीनी वक्ता से पूछते हैं, "ड्रैगन बोट फेस्टिवल के लिए पारंपरिक भोजन क्या है?" तो एक AI जो केवल अमेरिकी डेटा पर प्रशिक्षित है, भ्रमित हो सकता है या गलत उत्तर दे सकता है क्योंकि वह स्थानीय संस्कृति को नहीं समझता है।
  • शोध पत्र का दावा: मौजूदा अधिकांश परीक्षण अंग्रेजी पर बहुत अधिक केंद्रित हैं। वे यह जांच नहीं करते हैं कि क्या AI समझता है कि रूस में, ईस्टर में विशिष्ट केक शामिल होते हैं, या स्पेन में, ऑल सेंट्स डे के लिए विशिष्ट मिठाइयाँ होती हैं।

2. समाधान: OMGEval (एक "लोकल टूर गाइड" टेस्ट)

लेखकों ने OMGEval नामक एक नया परीक्षण बनाया। केवल अंग्रेजी प्रश्नों का अन्य भाषाओं में अनुवाद करने के बजाय (जो रूसी फिल्म पर अंग्रेजी सबटाइटल लगाने जैसा है), उन्होंने प्रश्नों को स्थानीय संस्कृति के अनुरूप फिर से लिखा

  • उपमा: कल्पना कीजिए कि "समर वेकेशन" (गर्मी की छुट्टियां) के बारे में एक परीक्षण प्रश्न है।
    • पुराना तरीका (अनुवाद): "अमेरिकी गर्मी की छुट्टियों के लिए कहाँ जाते हैं?" (उत्तर: हवाई)।
    • OMGEval का तरीका (स्थानीयकरण): "चीनी लोग गर्मी की छुट्टियों के लिए कहाँ जाते हैं?" (उत्तर: सान्या)।
    • यह क्यों मायने रखता है: दोनों प्रश्न "समर वेकेशन स्पॉट्स" के बारे में पूछते हैं, लेकिन सांस्कृतिक संदर्भ अलग है। OMGEval यह सुनिश्चित करता है कि AI कहानी के स्थानीय संस्करण को जानता हो, न कि केवल अमेरिकी संस्करण को।

3. उन्होंने इसे कैसे बनाया

टीम ने केवल चीजों को अनुवादित करने के लिए रोबोट का उपयोग नहीं किया; उन्होंने भाषाई विशेषज्ञों की एक टीम का उपयोग किया जो सांस्कृतिक संपादकों के रूप में कार्य करते थे।

  • प्रक्रिया: उन्होंने 804 ओपन-एंडेड प्रश्न (जैसे पहेलियाँ, तथ्य या रचनात्मक लेखन प्रॉम्प्ट) लिए और उन्हें 5 भाषाओं के लिए अनुकूलित किया: चीनी, रूसी, फ्रेंच, स्पेनिश और अरबी।
  • "मानवीय स्पर्श": यदि किसी प्रश्न में किसी विशिष्ट अमेरिकी हस्ती का उल्लेख था, तो उन्होंने उसे एक प्रसिद्ध स्थानीय व्यक्तित्व से बदल दिया। यदि किसी प्रश्न में किसी विशिष्ट अमेरिकी अवकाश का उल्लेख था, तो उन्होंने उसे स्थानीय उत्सव से बदल दिया। उन्होंने यह सुनिश्चित करने के लिए ऐसा किया कि AI को केवल शब्दों के अनुवाद की क्षमता पर नहीं, बल्कि इस क्षमता पर परखा जाए कि वह उस विशिष्ट संस्कृति को समझता है या नहीं।

4. उन्होंने AI को कैसे ग्रेड किया

चूंकि मनुष्य तुरंत पांच भाषाओं में हजारों उत्तर नहीं पढ़ सकते, इसलिए उन्होंने एक रेफरी के रूप में GPT-4 (एक बहुत ही उन्नत AI) का उपयोग किया।

  • खेल: उन्होंने AI मॉडल्स को प्रश्नों के उत्तर देने के लिए कहा। फिर, उन्होंने GPT-4 से दो उत्तरों को अगल-बगल देखने और यह तय करने के लिए कहा कि कौन सा बेहतर है।
  • जांच: उन्होंने यह सुनिश्चित करने के लिए कि "AI रेफरी" निष्पक्ष है या नहीं, वास्तविक मनुष्यों से एक छोटा नमूना ग्रेड करवाया। परिणामों ने दिखाया कि AI रेफरी मनुष्यों के साथ बहुत सटीक था (लग लगभग 90% सहमति)।

5. परिणाम: कौन पास हुआ?

उन्होंने कई अलग-अलग AI मॉडल्स का परीक्षण किया, जिनमें बड़े व्यावसायिक मॉडल (जैसे GPT-4) और ओपन-सोर्स मॉडल (मुफ्त मॉडल जिन्हें कोई भी डाउनलोड कर सकता है) शामिल थे।

  • विजेता: GPT-4 एकमात्र मॉडल था जिसने लगातार 50% से ऊपर स्कोर किया (यानी इसने आधे से अधिक बार बेसलाइन को हराया)। वह "स्टार स्टूडेंट" था।
  • संघर्ष: ओपन-सोर्स मॉडल (जैसे Guanaco, Phoenix, और अन्य) काफी संघर्ष करते हैं।
    • अंतर: जबकि GPT-4 सांस्कृतिक बारीकियों को अच्छी तरह से संभाल सकता था, ओपन-सोर्स मॉडल्स अक्सर तथ्यात्मक गलतियाँ करते थे या सांस्कृतिक संदर्भ को मिस कर देते थे। उदाहरण के लिए, जब एक प्रसिद्ध चीनी निर्देशक की पहली फिल्म के बारे में पूछा गया, तो कुछ ओपन-सोर्स मॉडल्स ने गलत वर्ष या गलत फिल्म का शीर्षक दिया, जबकि GPT-4 ने सही उत्तर दिया।
  • निष्कर्ष: सांस्कृतिक बारीकियों को समझने के मामले में शीर्ष-स्तरीय वाणिज्यिक मॉडल्स और ओपन-सोर्स मॉडल्स के बीच एक बड़ा अंतर है। ओपन-सोर्स मॉडल्स उन छात्रों की तरह हैं जिन्होंने पाठ्यपुस्तक तो पढ़ी लेकिन स्थानीय बोली को समझने में विफल रहे।

सारांश

OMGEval एक नया, अधिक निष्पक्ष परीक्षण है जो यह जांचता है कि क्या AI मॉडल दुनिया की विविध संस्कृतियों को समझते हैं, न कि केवल दुनिया के अमेरिकी संस्करण को। शोध पत्र दिखाता है कि जबकि सबसे अच्छा AI (GPT-4) इसमें काफी अच्छा है, कई अन्य मॉडल्स अभी भी विभिन्न भाषाओं और संस्कृतियों के स्थानीय "स्वाद" को समझने के लिए संघर्ष कर रहे हैं। लेखक आशा करते हैं कि यह परीक्षण समुदाय को भविष्य में बेहतर, अधिक सांस्कृतिक रूप से जागरूक AI बनाने में मदद करेगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →