💬 NLP

Confidence-Driven Multi-Scale Model Selection for Cost-Efficient Inference

यह शोध पत्र एक कॉन्फिडेंस-ड्रिवन मल्टी-स्केल मॉडल चयन रणनीति प्रस्तावित करता है जो अनुमानित सटीकता के आधार पर कार्यों को छोटे या बड़े मॉडलों में गतिशील रूप से रूट करती है, जिससे सबसे बड़े मॉडलों के तुलनीय प्रदर्शन प्राप्त होता है और साथ ही कंप्यूटिंग लागत और API टोकन उपयोग में काफी कमी आती है।

Bo-Wei Chen, Chung-Chi Chen, An-Zi Yen2026-02-26
💬 NLP

IndicIFEval: A Benchmark for Verifiable Instruction-Following Evaluation in 14 Indic Languages

यह शोध पत्र IndicIFEval को प्रस्तुत करता है, जो LLMs की निर्देश-अनुपालन क्षमताओं का मूल्यांकन करने के लिए 14 भारतीय भाषाओं में 800 मानव-सत्यापित उदाहरणों वाला एक बेंचमार्क है, जो यह प्रकट करता है कि जहाँ मॉडल स्वरूपण बाधाओं (formatting constraints) का अच्छी तरह से पालन करते हैं, वहीं वे शाब्दिक और क्रॉस-लिंगुअल कार्यों में अंग्रेजी के प्रदर्शन से काफी पीछे हैं।

Thanmay Jayakumar, Mohammed Safi Ur Rahman Khan, Raj Dabre, Ratish Puduppully, Anoop Kunchukuttan2026-02-26
💬 NLP

When AI Writes, Whose Voice Remains? Quantifying Cultural Marker Erasure Across World English Varieties in Large Language Models

यह अध्ययन "सांस्कृतिक घोस्टिंग" (Cultural Ghosting) की अवधारणा प्रस्तुत करता है ताकि यह मापा जा सके कि कैसे लार्ज लैंग्वेज मॉडल्स (Large Language Models) भारतीय, सिंगापुर और नाइजीरियाई अंग्रेजी जैसी गैर-मूल अंग्रेजी विविधताओं से भाषाई निशानों को व्यवस्थित रूप से मिटा देते हैं, जो एक ऐसे विरोधाभास को प्रकट करता है जहाँ अर्थ सुरक्षित रहता है जबकि सांस्कृतिक पहचान खो जाती है, हालांकि स्पष्ट प्रॉम्प्ट्स इस विलोपन को महत्वपूर्ण रूप से कम कर सकते हैं।

Satyam Kumar Navneet, Joydeep Chandra, Yong Zhang2026-02-26
💬 NLP

LiCQA : A Lightweight Complex Question Answering System

यह शोध पत्र LiCQA को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड (unsupervised), लाइटवेट प्रश्न-उत्तर प्रणाली है जो जटिल प्रश्नों को संबोधित करते समय सटीकता और लेटेंसी (latency) दोनों में अत्याधुनिक मॉडलों से काफी बेहतर प्रदर्शन करने के लिए कॉर्पस साक्ष्य का लाभ उठाती है।

Sourav Saha, Dwaipayan Roy, Mandar Mitra2026-02-26
💬 NLP

SumTablets: A Transliteration Dataset of Sumerian Tablets

यह शोध पत्र SumTablets प्रस्तुत करता है, जो आधुनिक एनएलपी (NLP) अनुप्रयोगों को सक्षम करने के लिए 91,606 सुमेरियन कीललिपि पट्टिकाओं (cuneiform tablets) को उनके Oracc लिप्यंतरणों (transliterations) के साथ जोड़ने वाला एक व्यापक डेटासेट है, जो यह प्रदर्शित करता है कि फाइन-ट्यून किए गए ऑटोरेग्रेसिव लैंग्वेज मॉडल्स लिप्यंतरण प्रक्रिया को स्वचालित करने में उच्च सटीकता (97.55 chrF) प्राप्त कर सकते हैं।

Cole Simmons, Richard Diehl Martinez, Dan Jurafsky2026-02-26
💬 NLP

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

यह शोध पत्र "रिकवर्ड इन ट्रांसलेशन" (Recovered in Translation) को प्रस्तुत करता है, जो एक स्वचालित ढांचा है जो यूनिवर्सल सेल्फ-इम्प्रूवमेंट (Universal Self-Improvement) जैसी टेस्ट-टाइम कंप्यूट स्केलिंग रणनीतियों और एक नवीन T-RANK पद्धति का लाभ उठाकर बेंचमार्क के आठ पूर्वी और दक्षिणी यूरोपीय भाषाओं में उच्च-गुणवत्ता वाले, अर्थ-संरक्षित अनुवाद उत्पन्न करता है, जिससे मौजूदा संसाधनों की सीमाओं को दूर किया जा सके और अधिक विश्वसनीय बहुभाषी LLM मूल्यांकन को सक्षम बनाया जा सके।

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev2026-02-26
💬 NLP

Augmenting Lateral Thinking in Language Models with Humor and Riddle Data for the BRAINTEASER Task

यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो पार्श्व सोच (lateral thinking) में सुधार के लिए हास्य और पहेली डेटा के साथ DeBERTaV3 को फाइन-ट्यून करके SemEval 2024 BRAINTEASER कार्य पर इसके प्रदर्शन को बढ़ाती है, जो यह प्रदर्शित करती है कि ऐसा संवर्धन (augmentation) वाक्य पहेलियों पर सटीकता को महत्वपूर्ण रूप से बढ़ाता है और कार्य को बहुविकल्पीय (multiple-choice) के रूप में फ्रेम करने से अनुक्रम वर्गीकरण (sequence classification) की तुलना में पर्याप्त लाभ मिलता है।

Mina Ghashami, Soumya Smruti Mishra2026-02-25
💬 NLP

Causal Claims in Economics

यह शोध पत्र 1980 से 2023 तक के 44,852 अर्थशास्त्र के शोध पत्रों में कारण संबंधी (causal) और गैर-कारण संबंधी (non-causal) संबंधों को मैप करने के लिए साक्ष्य-एनोटेटेड क्लेम ग्राफ (evidence-annotated claim graphs) प्रस्तुत करता है, जो समय के साथ कारण संबंधी दावों में उल्लेखनीय वृद्धि को प्रकट करता है और यह प्रदर्शित करता है कि मजबूत कारण नैरेटिव संरचना और नवीनता वाले शोध पत्रों के शीर्ष जर्नल्स में प्रकाशित होने और दीर्घकालिक उद्धरण प्राप्त करने की संभावना अधिक होती है।

Prashant Garg, Thiemo Fetzer2026-02-25
💬 NLP

Bridging Gaps in Natural Language Processing for Yorùbá: A Systematic Review of a Decade of Progress and Prospects

यह व्यवस्थित साहित्य समीक्षा योरूबा प्राकृतिक भाषा प्रसंस्करण (Yorùbá Natural Language Processing) पर एक दशक के शोध (2014-2024) का विश्लेषण करती है ताकि डेटा की कमी और टोनल जटिलता जैसी महत्वपूर्ण चुनौतियों की पहचान की जा सके, साथ ही इस और अन्य कम संसाधन वाले अफ्रीकी भाषाओं के लिए भविष्य की प्रगति का मार्गदर्शन करने हेतु उभरते संसाधनों और तकनीकों को रेखांकित किया जा सके।

Toheeb Aduramomi Jimoh, Tabea De Wille, Nikola S. Nikolov2026-02-25
💬 NLP

ICE-ID: A Novel Historical Census Dataset for Longitudinal Identity Resolution

यह शोध पत्र ICE-ID प्रस्तुत करता है, जो 220 वर्षों के आइसलैंडिक जनगणना डेटा से लगभग दस लाख रिकॉर्ड का एक नवीन बेंचमार्क डेटासेट है, जिसे पैट्रोनिमिक नेमिंग (पितृनाम पद्धति) और टेम्पोरल ड्रिफ्ट (सामयिक विचलन) जैसी अनुदैर्ध्य पहचान समाधान (लॉन्जिट्यूडिनल आइडेंटिटी रेजोल्यूशन) की अनूठी चुनौतियों को संबोधित करने के लिए डिज़ाइन किया गया है, साथ ही यह व्यापक विश्लेषण आर्टिफैक्ट्स और एक परिनियोजन-सत्य मूल्यांकन प्रोटोकॉल भी प्रदान करता है।

Gonçalo Hora de Carvalho, Lazar S. Popov, Sander Kaatee, Mário S. Correia, Kristinn R. Thórisson, Tangrui Li, Pétur Húni (…)2026-02-25