💬 NLP

SumTablets: A Transliteration Dataset of Sumerian Tablets

यह शोध पत्र SumTablets प्रस्तुत करता है, जो आधुनिक एनएलपी (NLP) अनुप्रयोगों को सक्षम करने के लिए 91,606 सुमेरियन कीललिपि पट्टिकाओं (cuneiform tablets) को उनके Oracc लिप्यंतरणों (transliterations) के साथ जोड़ने वाला एक व्यापक डेटासेट है, जो यह प्रदर्शित करता है कि फाइन-ट्यून किए गए ऑटोरेग्रेसिव लैंग्वेज मॉडल्स लिप्यंतरण प्रक्रिया को स्वचालित करने में उच्च सटीकता (97.55 chrF) प्राप्त कर सकते हैं।

Cole Simmons, Richard Diehl Martinez, Dan Jurafsky2026-02-26
💬 NLP

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

यह शोध पत्र "रिकवर्ड इन ट्रांसलेशन" (Recovered in Translation) को प्रस्तुत करता है, जो एक स्वचालित ढांचा है जो यूनिवर्सल सेल्फ-इम्प्रूवमेंट (Universal Self-Improvement) जैसी टेस्ट-टाइम कंप्यूट स्केलिंग रणनीतियों और एक नवीन T-RANK पद्धति का लाभ उठाकर बेंचमार्क के आठ पूर्वी और दक्षिणी यूरोपीय भाषाओं में उच्च-गुणवत्ता वाले, अर्थ-संरक्षित अनुवाद उत्पन्न करता है, जिससे मौजूदा संसाधनों की सीमाओं को दूर किया जा सके और अधिक विश्वसनीय बहुभाषी LLM मूल्यांकन को सक्षम बनाया जा सके।

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev2026-02-26
💬 NLP

Augmenting Lateral Thinking in Language Models with Humor and Riddle Data for the BRAINTEASER Task

यह शोध पत्र एक ऐसी प्रणाली प्रस्तुत करता है जो पार्श्व सोच (lateral thinking) में सुधार के लिए हास्य और पहेली डेटा के साथ DeBERTaV3 को फाइन-ट्यून करके SemEval 2024 BRAINTEASER कार्य पर इसके प्रदर्शन को बढ़ाती है, जो यह प्रदर्शित करती है कि ऐसा संवर्धन (augmentation) वाक्य पहेलियों पर सटीकता को महत्वपूर्ण रूप से बढ़ाता है और कार्य को बहुविकल्पीय (multiple-choice) के रूप में फ्रेम करने से अनुक्रम वर्गीकरण (sequence classification) की तुलना में पर्याप्त लाभ मिलता है।

Mina Ghashami, Soumya Smruti Mishra2026-02-25
💬 NLP

Causal Claims in Economics

यह शोध पत्र 1980 से 2023 तक के 44,852 अर्थशास्त्र के शोध पत्रों में कारण संबंधी (causal) और गैर-कारण संबंधी (non-causal) संबंधों को मैप करने के लिए साक्ष्य-एनोटेटेड क्लेम ग्राफ (evidence-annotated claim graphs) प्रस्तुत करता है, जो समय के साथ कारण संबंधी दावों में उल्लेखनीय वृद्धि को प्रकट करता है और यह प्रदर्शित करता है कि मजबूत कारण नैरेटिव संरचना और नवीनता वाले शोध पत्रों के शीर्ष जर्नल्स में प्रकाशित होने और दीर्घकालिक उद्धरण प्राप्त करने की संभावना अधिक होती है।

Prashant Garg, Thiemo Fetzer2026-02-25
💬 NLP

Bridging Gaps in Natural Language Processing for Yorùbá: A Systematic Review of a Decade of Progress and Prospects

यह व्यवस्थित साहित्य समीक्षा योरूबा प्राकृतिक भाषा प्रसंस्करण (Yorùbá Natural Language Processing) पर एक दशक के शोध (2014-2024) का विश्लेषण करती है ताकि डेटा की कमी और टोनल जटिलता जैसी महत्वपूर्ण चुनौतियों की पहचान की जा सके, साथ ही इस और अन्य कम संसाधन वाले अफ्रीकी भाषाओं के लिए भविष्य की प्रगति का मार्गदर्शन करने हेतु उभरते संसाधनों और तकनीकों को रेखांकित किया जा सके।

Toheeb Aduramomi Jimoh, Tabea De Wille, Nikola S. Nikolov2026-02-25
💬 NLP

ICE-ID: A Novel Historical Census Dataset for Longitudinal Identity Resolution

यह शोध पत्र ICE-ID प्रस्तुत करता है, जो 220 वर्षों के आइसलैंडिक जनगणना डेटा से लगभग दस लाख रिकॉर्ड का एक नवीन बेंचमार्क डेटासेट है, जिसे पैट्रोनिमिक नेमिंग (पितृनाम पद्धति) और टेम्पोरल ड्रिफ्ट (सामयिक विचलन) जैसी अनुदैर्ध्य पहचान समाधान (लॉन्जिट्यूडिनल आइडेंटिटी रेजोल्यूशन) की अनूठी चुनौतियों को संबोधित करने के लिए डिज़ाइन किया गया है, साथ ही यह व्यापक विश्लेषण आर्टिफैक्ट्स और एक परिनियोजन-सत्य मूल्यांकन प्रोटोकॉल भी प्रदान करता है।

Gonçalo Hora de Carvalho, Lazar S. Popov, Sander Kaatee, Mário S. Correia, Kristinn R. Thórisson, Tangrui Li, Pétur Húni (…)2026-02-25
💬 NLP

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

यह शोध पत्र प्रोग्रामिंग बाय बैकप्रॉप (PBB) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण शासन (training regime) है जो बड़े भाषा मॉडलों को घोषणात्मक निर्देशों (declarative instructions) से पुन: प्रयोज्य प्रक्रियात्मक व्यवहारों (reusable procedural behaviors) को कुशलतापूर्वक प्राप्त करने में सक्षम बनाता है, जिससे केवल प्रदर्शन उदाहरणों (demonstration examples) से सीखने की तुलना में 100 गुना अधिक सैंपल दक्षता प्राप्त होती है।

Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis2026-02-25
💬 NLP

RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility

RHYTHM एक एकीकृत ढांचा है जो बहु-स्तरीय आवधिक निर्भरताओं (multi-scale periodic dependencies) को कैप्चर करने के लिए एक फ्रोजन लार्ज लैंग्वेज मॉडल को पदानुक्रमित टेम्पोरल टोकनाइज़ेशन (hierarchical temporal tokenization) के साथ जोड़कर मानव गतिशीलता की कुशलतापूर्वक भविष्यवाणी करता है, जिससे अत्याधुनिक तरीकों की तुलना में सटीकता और प्रशिक्षण गति में महत्वपूर्ण सुधार प्राप्त होता है।

Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang2026-02-25
💬 NLP

LD-MoLE: Learnable Dynamic Routing for Mixture of LoRA Experts

LD-MoLE, Mixture of LoRA Experts के लिए एक सीखने योग्य (learnable), अवकलनीय (differentiable) डायनेमिक रूटिंग तंत्र पेश करता है जो बिना हाइपरपैरामीटर ट्यूनिंग के प्रति टोकन और परत (layer) के सक्रिय विशेषज्ञों की संख्या को अनुकूल रूप से निर्धारित करता है, और LLM बेंचमार्क पर अत्याधुनिक (state-of-the-art) प्रदर्शन प्राप्त करता है।

Yuan Zhuang, Yi Shen, Yuexin Bian, Qing Su, Shihao Ji, Yuanyuan Shi, Fei Miao2026-02-25
💬 NLP

Hearing the Order: Investigating Position Bias in Large Audio-Language Models

यह शोध पत्र लार्ज ऑडियो-लैंग्वेज मॉडल्स में पोजीशन बायस (स्थिति पूर्वाग्रह) की पहली व्यवस्थित जांच प्रस्तुत करता है, जो व्यापक प्रयोगों के माध्यम से यह प्रदर्शित करता है कि उत्तर के विकल्पों का क्रम प्रदर्शन और विश्वसनीयता को महत्वपूर्ण रूप से प्रभावित करता है, साथ ही यह भी दिखाता है कि क्रमपरिवर्तन-आधारित रणनीतियाँ इस समस्या को प्रभावी ढंग से कम कर सकती हैं।

Yu-Xiang Lin, Chen-An Li, Sheng-Lun Wei, Po-Chun Chen, Hsin-Hsi Chen, Hung-yi Lee2026-02-25