TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models
यह शोध पत्र TARAZ प्रस्तुत करता है, जो एक नवीन फारसी लघु-उत्तर बेंचमार्क और हाइब्रिड मूल्यांकन ढांचा है जो रूपात्मक सामान्यीकरण (morphological normalization) और अर्थ संबंधी समानता स्कोरिंग के माध्यम से बड़े भाषा मॉडलों की सांस्कृतिक सक्षमता का अधिक सटीक रूप से आकलन करने के लिए मौजूदा बहुविकल्पीय और सटीक-मिलान मेट्रिक्स की सीमाओं को दूर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को मानव संस्कृति को समझना सिखाने की कोशिश कर रहे हैं। आप उसे एक टेस्ट देते हैं, लेकिन टेस्ट उस भाषा में लिखा गया है जिसे रोबोट अच्छी तरह जानता है (अंग्रेजी), और प्रश्न सरल "हाँ/नहीं" या "बहुविकल्पीय" प्रारूप में हैं। रोबोट तथ्यों को रटकर उच्च स्कोर प्राप्त कर सकता है, लेकिन वह वास्तव में संस्कृति के 'वाइब' (vibe), हास्य या अलिखित नियमों को नहीं समझ पाता है।
यह शोध पत्र, TARAZ, एक नया, बहुत कठिन और बहुत निष्पक्ष टेस्ट है जिसे विशेष रूप से फारसी (Persian/Farsi) बोलने वालों के लिए डिज़ाइन किया गया है ताकि यह देखा जा सके कि क्या AI मॉडल वास्तव में उनकी संस्कृति को समझते हैं।
यहाँ शोधकर्ताओं द्वारा किए गए कार्यों का विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों के माध्यम से समझाया गया है:
1. समस्या: "बहुविकल्पीय" (Multiple Choice) का जाल
कल्पना कीजिए कि आप एक छात्र के अमेरिकी फुटबॉल के ज्ञान का परीक्षण कर रहे हैं।
- पुराना तरीका (बहुविकल्पीय): आप पूछते हैं, "2020 में सुपर बाउल किसने जीता?" छात्र "A" चुनता है। वह सही उत्तर देता है। लेकिन क्या वह खेल को समझता है? नहीं। उसने बस एक तथ्य रट लिया है।
- फारसी के साथ समस्या: फारसी संस्कृति के लिए अधिकांश AI टेस्ट ऐसे ही थे। वे बहुविकल्पीय प्रश्नों (MCQs) का उपयोग करते थे और यह देखते थे कि उत्तर डेटाबेस के सटीक शब्द (exact string) से मेल खाता है या नहीं।
- फारसी का ट्विस्ट: फारसी एक "रूप बदलने वाली" (shape-shifting) भाषा है। "रोटी" (bread) शब्द को औपचारिक, अनौपचारिक, अलग लहजों के साथ, या अलग नंबरों (अरबी बनाम फारसी अंक) का उपयोग करके लिखा जा सकता है। यदि एक रोबोट "bread" कहता है और उत्तर कुंजी में "bread (informal)" लिखा है, तो एक सख्त कंप्यूटर कहेगा, "गलत!" भले ही अर्थ बिल्कुल समान हो। पुराने टेस्ट ऐसे थे जैसे कोई शिक्षक किसी छात्र को "color" को "colour" लिखने के लिए फेल कर दे।
2. समाधान: "लघु उत्तर" वाली बातचीत
शोधकर्ताओं ने TARAZ बनाया, जो एक नया ढांचा है जो AI के साथ एक इंसान की तरह बातचीत करता है, न कि एक मशीन की तरह जो केवल गोले भर रही है।
- टेस्ट का प्रारूप: A, B, C, या D चुनने के बजाय, AI को एक मुक्त-रूप (free-form) उत्तर लिखना होता है।
- उदाहरण: "एक यात्रा से पहले ईरानी हवाई अड्डे पर लोग आमतौर पर क्या करते हैं?"
- AI का उत्तर: "वे क्षमा मांगते हैं।"
- पुराना टेस्ट: यदि यह डेटाबेस के सटीक वाक्यांश से मेल नहीं खाता, तो इसे फेल कर देता।
- TARAZ: यह समझता है कि "क्षमा मांगना" सही सांस्कृतिक व्यवहार है, भले ही शब्दों का चयन थोड़ा अलग क्यों न हो।
3. "जादुई अनुवादक" (Post-Processing)
फारसी पेचीदा है क्योंकि इसके कई रूप हैं। इसे ठीक करने के लिए, टीम ने एक डिजिटल अनुवादक बनाया है जो ग्रेड देने से पहले एक सुपर-स्मार्ट संपादक की तरह काम करता है।
- उपमा: कल्पना कीजिए कि आप एक छात्र के निबंध को ग्रेड दे रहे हैं, लेकिन छात्र "56" लिखता है जबकि उत्तर कुंजी में "۵۶" (फारसी अंक) लिखा है, या वह "और" के लिए एक फैंसी शब्द का उपयोग करता है जबकि कुंजी में एक साधारण शब्द का उपयोग किया गया है।
- TARAZ क्या करता है: ग्रेड देने से पहले, यह सब कुछ सामान्य (normalize) कर देता है। यह सभी नंबरों को एक ही प्रारूप में बदल देता है, अनावश्यक लहजे (accents) हटा देता है, और लंबे वाक्यों को तार्किक हिस्सों में विभाजित कर देता है। यह एक शिक्षक की तरह है जो कहता है, "ठीक है, मैं देख सकता हूँ कि तुम्हारा मतलब '56' और 'और' से था, चलो फोंट के अंतर को अनदेखा करते हैं और अर्थ पर ध्यान देते हैं।"
4. तीन "सांस्कृतिक जिमनाज़ियम" (डेटासेट्स)
AI का पूरी तरह से परीक्षण करने के लिए, उन्होंने तीन अलग-अलग प्रकार के "जिम" (डेटासेट्स) का उपयोग किया:
- BLEnD (रोजमर्रा का ज्ञान): यह एक ट्रिविया नाइट की तरह है। "बच्चों के लिए आम नाश्ता क्या है?" (फल, सैंडविच, आदि)।
- PerCul-SAQ (कहानी का समय): AI एक सांस्कृतिक स्थिति के बारे में एक छोटी कहानी पढ़ता है और उसे अनुमान लगाना होता है कि आगे क्या होगा या किस वस्तु का उपयोग किया जा रहा है। यह एक रहस्यमय उपन्यास को पढ़ने और सांस्कृतिक सुराग को सुलझाने जैसा है।
- ISN-SAQ (सामाजिक नियम): यह "अलिखित नियमों" का परीक्षण करता है। "भीड़भाड़ वाले बाज़ार में विनम्रता से क्या करना चाहिए?" (उत्तर: मोलभाव करना)। यह सबसे कठिन टेस्ट है क्योंकि इसके लिए केवल तथ्यों की नहीं, बल्कि सामाजिक बारीकियों (nuance) की समझ की आवश्यकता होती है।
5. परिणाम: टेस्ट किसने पास किया?
शोधकर्ताओं ने 15 अलग-अलग AI मॉडल का परीक्षण किया (कुछ प्रसिद्ध जैसे GPT-5 और Claude, और कुछ छोटे, फारसी-विशिष्ट मॉडल)।
- बड़े विजेता: विशाल, क्लोज्ड-सोर्स मॉडल (जैसे GPT-5 और Claude Opus) सबसे अच्छा प्रदर्शन करते हैं। वे AI के "ओलंपिक एथलीटों" की तरह हैं—उन्होंने इतना अधिक डेटा देखा है कि वे सांस्कृतिक बारीकियों को सहजता से समझ लेते हैं।
- आश्चर्य: कुछ छोटे, ओपन-सोर्स मॉडल (जैसे Gemma-2) ने आश्चर्यजनक रूप से अच्छा प्रदर्शन किया, लगभग दिग्गजों के करीब पहुँच गए।
- संघर्ष: विशेष रूप से फारसी के लिए "फाइन-ट्यून" किए गए मॉडल दिग्गजों की तुलना में बदतर प्रदर्शन करते हैं।
- क्यों? यह उस छात्र की तरह है जिसने डिक्शनरी रट ली लेकिन वास्तव में लोगों से कभी बात नहीं की। वे शब्दों को जानते थे लेकिन संस्कृति को नहीं समझते थे। शोधकर्ताओं का सुझाव है कि इन मॉडलों को केवल भाषा अनुवाद की नहीं, बल्कि अधिक वास्तविक दुनिया के सांस्कृतिक प्रशिक्षण की आवश्यकता है।
6. "इंसान बनाम रोबोट" जज
अंत में, उन्होंने पूछा: "कौन बेहतर ग्रेडर है, इंसान या AI?"
- उन्होंने एक नए AI ग्रेडर (जिसे Maux कहा जाता है) का उपयोग किया जो ऊपर बताए गए "जादुई अनुवादक" का उपयोग करता है।
- परिणाम: नया AI ग्रेडर मानव न्यायाधीशों के साथ 95% बार सहमत हुआ।
- निष्कर्ष: पुराना "सटीक मिलान" (exact match) वाला तरीका एक कठोर नियम पुस्तिका वाले रोबोट जैसा था। नया TARAZ तरीका एक मानव शिक्षक की तरह है जो संदर्भ, स्लैंग और एक ही बात को कहने के विभिन्न तरीकों को समझता है।
सारांश
TARAZ यह परीक्षण करने का एक नया, अधिक निष्पक्ष तरीका है कि क्या AI फारसी संस्कृति को समझता है। यह AI को सटीक उत्तर रटकर नकल करने से रोकता है और उसे शब्दों के पीछे के अर्थ को वास्तव में समझने के लिए मजबूर करता है। इसने पाया कि हालांकि बड़े AI मॉडल इसमें अच्छे होते जा रहे हैं, लेकिन विशेष रूप से बनाए गए फारसी मॉडलों को भाषा के मानवीय पक्ष को वास्तव में समझने के लिए अभी भी बहुत कुछ सीखने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।