Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
यह शोध पत्र नामह (Naamah) को प्रस्तुत करता है, जो 1 लाख से अधिक वाक्यों का एक बड़े पैमाने पर सिंथेटिक संस्कृत नामधारी इकाई पहचान (Named Entity Recognition) कॉर्पस है, जिसे DBpedia इकाई निष्कर्षण को 24B पैरामीटर वाले हाइब्रिड रीजनिंग मॉडल के साथ संयोजित करके निर्मित किया गया है, जिसका उपयोग फिर बहुभाषी और इंडिक-विशिष्ट ट्रांसफॉर्मर आर्किटेक्चर के बेंचमार्किंग के लिए किया जाता है।