PARSE: An Open-Domain Reasoning Question Answering Benchmark for Persian
यह शोध पत्र PARSE को प्रस्तुत करता है, जो 10,800 कठोरता से सत्यापित प्रश्नों वाला पहला ओपन-डोमेन फारसी रीजनिंग प्रश्न-उत्तर बेंचमार्क है, जो कम-संसाधन वाली भाषाओं के लिए संसाधनों की कमी को संबोधित करता है और यह प्रदर्शित करता है कि अनुकूलित प्रॉम्प्टिंग और फाइन-ट्यूनिंग फारसी LLMs में रीजनिंग प्रदर्शन में महत्वपूर्ण सुधार करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप बहुत बुद्धिमान, बहुभाषी रोबोटों के एक समूह को केवल याद करना नहीं, बल्कि सोचना सिखाने की कोशिश कर रहे हैं। आपके पास अंग्रेजी में परीक्षण प्रश्नों का एक विशाल पुस्तकालय है, लेकिन वे एक विशिष्ट भाषा में संघर्ष कर रहे हैं: फारसी (जो लगभग 13 करोड़ लोगों द्वारा बोली जाती है)। अब तक, यह जांचने के लिए कि क्या ये रोबोट वास्तव में किसी समस्या पर तर्क (reasoning) कर सकते हैं या वे केवल अनुमान लगा रहे हैं, फारसी में कोई अच्छा "जिम" या "प्रशिक्षण मैदान" नहीं था।
यह शोध पत्र Parse को पेश करता है, जो फारसी तर्क (Persian reasoning) के लिए पहला व्यापक जिम है।
लेखकों ने क्या किया है, इसका विवरण सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:
1. समस्या: एक गायब टूलबॉक्स
लार्ज लैंग्वेज मॉडल्स (LLMs) को प्रतिभाशाली छात्रों के रूप में सोचें। अंग्रेजी में, इन छात्रों के पास अभ्यास परीक्षाओं (benchmarks) का एक बड़ा संग्रह है जो उनकी तर्क पहेलियों को हल करने, विभिन्न तथ्यों के बीच संबंध जोड़ने और पेचीदा सवालों को संभालने की क्षमता का परीक्षण करते हैं।
हालाँकि, फारसी बोलने वालों के लिए, टूलबॉक्स खाली था। मौजूदा फारसी परीक्षण ऐसे थे जैसे आपके पास केवल कुछ गणित के वर्कशीट हों लेकिन विज्ञान या इतिहास की परीक्षा न हो। वे या तो बहुत सरल थे, केवल एक विशिष्ट विषय (जैसे चिकित्सा) पर केंद्रित थे, या उनमें "तर्क" (reasoning) का परीक्षण ही नहीं किया गया था। लेखकों ने महसूस किया कि यह वास्तव में जानने के लिए कि क्या एक रोबोट फारसी समझता है, उन्हें एक ऐसा परीक्षण चाहिए जो सब कुछ कवर करे।
2. समाधान: "Parse" का निर्माण
टीम ने Parse बनाया, जो 10,800 प्रश्नों का एक विशाल संग्रह है। इसे एक निष्पक्ष परीक्षण बनाने के लिए, उन्होंने केवल यादृच्छिक प्रश्न नहीं लिखे; उन्होंने चुनौतियों का एक संरचित "मेन्यू" बनाया:
- फॉर्मेट (Formats): उन्होंने तीन प्रकार के प्रश्न बनाए, जैसे अलग-अलग गेम मोड:
- बुलियन (Boolean - हाँ/नहीं): एक क्लब के बाउंसर की तरह जो पूछता है, "क्या यह सच है या झूठ?"
- बहुविकल्पीय (Multiple-Choice): एक ट्रिविया गेम की तरह जहाँ आप चार विकल्पों में से सही उत्तर चुनते हैं।
- फैक्टॉइड (Factoid): "Jeopardy!" शैली के प्रश्न की तरह जहाँ आपको विशिष्ट चीजों के नाम बताने होते हैं (जैसे, "पृथ्वी से सूर्य के अधिक निकट स्थित दो ग्रहों के नाम बताएं")।
- कठिनाई (Difficulty): एक वीडियो गेम की तरह, प्रश्न "आसान" (दरवाजे से गुजरने जैसा) से लेकर "कठिन" (पहाड़ चढ़ने जैसा) तक होते हैं। कुछ के लिए केवल याद रखने की आवश्यकता होती है, जबकि अन्य के लिए मल्टी-हॉप रीजनिंग (Multi-hop reasoning) की आवश्यकता होती है—जो एक खजाने की खोज की तरह है जहाँ आपको सुराग A ढूंढना होगा, उसका उपयोग सुराग B खोजने के लिए करना होगा, और फिर उत्तर ढूंढना होगा।
- गुणवत्ता नियंत्रण (Quality Control): उन्होंने केवल एक AI से ये प्रश्न लिखने के लिए नहीं कहा और काम खत्म नहीं किया। वे सख्त संपादकों की तरह काम कर रहे थे। उन्होंने सुनिश्चित करने के लिए कि फारसी स्वाभाविक है, तथ्य सही हैं और कठिनाई वास्तविक है, हर प्रश्न की जांच के लिए मनुष्यों का उपयोग किया। उन्होंने यह भी जांचा कि "कठिन" प्रश्न इसलिए कठिन थे क्योंकि वे सोचने में पेचीदा थे, न कि इसलिए कि व्याकरण भ्रमित करने वाला था।
3. प्रयोग: रोबोट रेस
एक बार जब परीक्षण तैयार हो गया, तो लेखकों ने विभिन्न AI मॉडलों ( "छात्रों") की क्षमताओं का परीक्षण किया। उन्होंने बड़े, प्रसिद्ध बहुभाषी मॉडलों (जैसे LLaMA और Qwen) और फारसी पर विशेष रूप से प्रशिक्षित एक मॉडल (जिसे Dorna कहा जाता है) का परीक्षण किया।
उन्होंने रोबोटों से बात करने के तीन अलग-अलग तरीके आजमाए:
- ज़ीरो-शॉट (Zero-Shot): बस बिना किसी तैयारी के प्रश्न पूछना।
- फ्यू-शॉट (Few-Shot): रोबोट को पहले कुछ उदाहरण देना (जैसे एक नया सवाल हल करने से पहले उन्हें एक गणित की समस्या दिखाना)।
- चेन-ऑफ-थॉट (Chain-of-Thought - CoT): रोबोट को उत्तर देने से पहले अपने चरणों को समझाने और अपना काम दिखाने के लिए कहना।
उन्होंने क्या पाया:
- भाषा मायने रखती है: रोबोटों ने अंग्रेजी के बजाय फारसी में प्रश्नों और निर्देशों के साथ काफी बेहतर प्रदर्शन किया। यह अपनी मातृभाषा में कहानी सुनाने जैसा है; आप सूक्ष्म अंतर को बहुत बेहतर समझते हैं।
- रणनीति मायने रखती है: तर्क पहेलियों (हाँ/नहीं और बहुविकल्पीय) के लिए, रोबोट को "चरण-दर-चरण सोचने" (Chain-of-Thought) के लिए कहना सबसे अच्छा काम करता है। सरल तथ्य प्रश्नों के लिए, उदाहरण देना (Few-Shot) सबसे अच्छा काम करता है।
- प्रशिक्षण का फल मिलता है: जब उन्होंने एक मानक रोबोट को Parse डेटासेट के साथ "पढ़ाया" (fine-tuning), तो वह बहुत स्मार्ट हो गया। फारसी-विशेषज्ञ रोबोट (Dorna) प्रशिक्षण के बाद चैंपियन बन गया, जिससे साबित हुआ कि यह डेटासेट रोबोटों को फारसी में सोचना सिखाने के लिए एक शक्तिशाली उपकरण है।
निचोड़
Parse एक मील का पत्थर है। यह एक उच्च-गुणवत्ता वाला, विविध और कठोर परीक्षण प्रदान करके AI अनुसंधान की दुनिया में एक बड़े शून्य को भरता है। यह साबित करता है कि फारसी बोलने वालों के लिए AI को वास्तव में उपयोगी बनाने के लिए, हमें उनके लिए विशिष्ट उपकरण बनाने की आवश्यकता है, न कि केवल अंग्रेजी उपकरणों का अनुवाद करने की। यह शोध पत्र दिखाता है कि सही प्रशिक्षण डेटा के साथ, AI फारसी में भी उतना ही तर्क कर सकता है जितना कि वह अंग्रेजी में करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।