💬 NLP

Who and What? Using Linguistic Features and Annotator Characteristics to Analyze Annotation Variation

यह शोध पत्र हानिकारक भाषा का पता लगाने वाले चार डेटासेट के पहले बड़े पैमाने के विश्लेषण को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि एनोटेटर (अंशों) की विशेषताओं और भाषाई गुणों के बीच की अंतःक्रियाएं एनोटेशन भिन्नता को समझने के लिए महत्वपूर्ण हैं, जबकि यह भी प्रकट करता है कि प्रभाव के पैटर्न विभिन्न डेटासेट में काफी भिन्न होते हैं, जो व्यापक सामान्यीकरण के विरुद्ध चेतावनी देता है।

Maximilian Maurer, Maximilian Linde, Gabriella Lapesa2026-05-08
💬 NLP

Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs

यह शोध पत्र LATTE को प्रस्तुत करता है, जो एक साझा, विकसित होते कार्य ग्राफ (task graph) के माध्यम से लार्ज लैंग्वेज मॉडल टीमों को समन्वित करने के लिए एक ढांचा है ताकि संरचनात्मक निरंतरता और अनुकूलनशीलता के बीच गतिशील रूप से संतुलन बनाया जा सके, जिससे मौजूदा स्थिर या असंरचित दृष्टिकोणों की तुलना में सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए संसाधन खपत और समन्वय विफलताओं को कम किया जा सके।

Elizabeth Mieczkowski, Alexander Ku, Tiwalayo Eisape, Dilip Arumugam, John Matters, Katherine M. Collins, Ilia Sucholuts (…)2026-05-08
💬 NLP

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

यह शोध पत्र ओपन-वेट (open-weight) LLMs में मूल्यांकन-संदर्भ विचलन (evaluation-context divergence) को मापने के लिए एक युग्मित-प्रॉम्ट प्रोटोकॉल (paired-prompt protocol) प्रस्तुत करता है, जो यह प्रकट करता है कि अलाइनमेंट पाइपलाइन्स विषम व्यवहारिक बदलावों को प्रेरित करती हैं जहाँ कुछ मॉडल मूल्यांकन फ्रेमिंग के तहत अधिक सतर्क हो जाते हैं जबकि अन्य कम सतर्क हो जाते हैं, एक ऐसा पैटर्न जो विशिष्ट मॉडल परिवार और निर्णय के लिए उपयोग किए गए सुरक्षा क्लासिफायर के आधार पर महत्वपूर्ण रूप से भिन्न होता है।

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
💬 NLP

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

यह शोध पत्र MANTRA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्राकृतिक भाषा वाले प्रक्रियात्मक मैनुअल (procedural manuals) से प्रतीकात्मक विश्व मॉडल (symbolic world models) और SMT-सत्यापित ट्रेस-स्तरीय जाँच (trace-level checks) उत्पन्न करके, टूल-उपयोग करने वाले LLM एजेंटों के लिए स्वचालित रूप से संश्लेषित और औपचारिक रूप से मान्य, स्केलेबल, मशीन-जांच योग्य अनुपालन बेंचमार्क का संश्लेषण करता है।

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck2026-05-08
💬 NLP

Is Escalation Worth It? A Decision-Theoretic Characterization of LLM Cascades

यह योगदान LLM कैस्केड्स के लागत-गुणवत्ता सीमा वक्रों (cost-quality frontier curves) को चित्रित करने के लिए एक निर्णय-सैद्धांतिक ढांचे को प्रस्तुत करता है और यह प्रदर्शित करता है कि मध्यवर्ती चरणों की कमी के बजाय, शुरुआती सस्ते मॉडल जनरेशन के लिए भुगतान करने से जुड़ी संरचनात्मक लागतें, सरल रूटिंग रणनीतियों की तुलना में मल्टी-स्टेज कैस्केड्स के प्रदर्शन लाभों को मौलिक रूप से सीमित करती हैं।

Dylan Bouchard2026-05-08
💬 NLP

GATHER: Convergence-Centric Hyper-Entity Retrieval for Zero-Shot Cell-Type Annotation

यह शोध पत्र GATHER का प्रस्ताव करता है, जो एक अभिसरण-केंद्रित (convergence-centric) रिट्रीवल विधि है जो हाइपर-एंटिटी क्वेरीज़ के लिए ज़ीरो-शॉट सिंगल-सेल सेल-टाइप एनोटेशन को कुशलतापूर्वक सक्षम करने के लिए एक जैविक ज्ञान ग्राफ (biological knowledge graph) में टोपोलॉजिकल अभिसरण बिंदुओं की पहचान करता है, जो बिना पुनरावृत्तिपूर्ण (iterative) LLM रीजनिंग के, सटीकता में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करते हुए गणनात्मक लागत को नाटकीय रूप से कम करता है।

Zhonghui Zhang, Feng Jiang, Shaowei Qin, Jiahao Zhao, Min Yang2026-05-08
💬 NLP

MiA-Signature: Approximating Global Activation for Long-Context Understanding

ग्लोबल इग्निशन के संज्ञानात्मक सिद्धांतों से प्रेरित होकर, यह शोधपत्र माइंडस्केप एक्टिवेशन सिग्नेचर (MiA-Signature) प्रस्तुत करता है, जो ग्लोबल एक्टिवेशन पैटर्न का एक कम्प्यूटेशनल रूप से कुशल, सबमॉड्यूलर-आधारित संकुचित प्रतिनिधित्व है जो LLMs, RAG और एजेंटिक प्रणालियों में लॉन्ग-कॉन्टेक्स्ट समझ को बढ़ाता है।

Yuqing Li, Jiangnan Li, Mo Yu, Zheng Lin, Weiping Wang, Jie Zhou2026-05-08
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

यह शोध पत्र एक स्केलेबल, मॉड्यूलर पाइपलाइन प्रस्तुत करता है जो 527 मिलियन रेडिट पोस्ट को प्रोसेस करने के लिए नियम-आधारित फ़िल्टरिंग और LLM वर्गीकरण को जोड़ता है, जो सफलतापूर्वक 124.6 मिलियन अद्वितीय टोकन को 1,021 नवोन्मेषी शब्द (neologism) उम्मीदवारों तक सीमित करता है, जिनमें से 58.7% को मैन्युअल सत्यापन के माध्यम से वास्तविक शाब्दिक नवाचारों के रूप में पुष्टि की गई है।

Diego Rossini, Lonneke van der Plas2026-05-08
💬 NLP

Litespark Inference on Consumer CPUs: Custom SIMD Kernels for Ternary Neural Networks

यह शोध पत्र Litespark-Inference को प्रस्तुत करता है, जो एक pip-installable फ्रेमवर्क है जो मैट्रिक्स गुणन (matrix multiplication) को पूर्णांक जोड़ और घटाव (integer addition and subtraction) से बदलकर उपभोक्ता CPUs पर टेनरी न्यूरल नेटवर्क इन्फरेंस को त्वरित करने के लिए कस्टम SIMD कर्नेल का लाभ उठाता है, जिससे मानक PyTorch कार्यान्वयन की तुलना में महत्वपूर्ण गति वृद्धि और मेमोरी में कमी प्राप्त होती है।

Nii Osae Osae Dade, Tony Morri, Moinul Hossain Rahat, Sayandip Pal2026-05-08
💬 NLP

Cubit: Token Mixer with Kernel Ridge Regression

यह शोध पत्र Cubit को प्रस्तुत करता है, जो एक नवीन डीप लर्निंग आर्किटेक्चर है जो एक मजबूत गणितीय आधार प्रदान करने और बेहतर लंबी-अनुक्रम मॉडलिंग क्षमताओं को प्रदर्शित करने के लिए ट्रांसफॉर्मर के अटेंशन मैकेनिज्म को कर्नेल रिज रिग्रेशन (Kernel Ridge Regression) से बदल देता है।

Chuanyang Zheng, Jiankai Sun, Yihang Gao, Yuehao Wang, Liangchen Tan, Mac Schwager, Anderson Schneider, Yuriy Nevmyvaka (…)2026-05-08