💬 NLP

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG

LatentRAG एक अभिनव ढांचा है जो एजेंटिक RAG तर्क और पुनर्प्राप्ति (retrieval) को विविक्त भाषा स्थान (discrete language space) से निरंतर लेटेंट स्पेस (continuous latent space) में स्थानांतरित करता है, जिससे एंड-टू-एंड संयुक्त अनुकूलन सक्षम होता है और स्पष्ट बहु-चरणीय विधियों के तुलनीय प्रदर्शन बनाए रखते हुए अनुमान विलंबता (inference latency) को लगभग 90% तक कम किया जाता है।

Yijia Zheng, Marcel Worring2026-05-08
💬 NLP

MultiLinguahah : A New Unsupervised Multilingual Acoustic Laughter Segmentation Method

यह शोध पत्र MultiLinguahah का प्रस्ताव करता है, जो एक अनसुपरवाइज्ड (unsupervised) बहुभाषी हँसी विभाजन पद्धति है जो हँसी को एक विसंगति (anomaly) के रूप में पहचानने के लिए BYOL-A ऑडियो रिप्रजेंटेशन पर आइसोलेशन फॉरेस्ट (Isolation Forest) का उपयोग करती है, और मौजूदा सुपरवाइज्ड, अंग्रेजी-केंद्रित अत्याधुनिक एल्गोरिदम की तुलना में गैर-अंग्रेजी संदर्भों में बेहतर प्रदर्शन प्रदर्शित करती है।

Callejas Sofia, Gomez Nahuel, Pelachaud Catherine, Ravenet Brian, Barriere Valentin2026-05-08
💬 NLP

Who and What? Using Linguistic Features and Annotator Characteristics to Analyze Annotation Variation

यह शोध पत्र हानिकारक भाषा का पता लगाने वाले चार डेटासेट के पहले बड़े पैमाने के विश्लेषण को प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि एनोटेटर (अंशों) की विशेषताओं और भाषाई गुणों के बीच की अंतःक्रियाएं एनोटेशन भिन्नता को समझने के लिए महत्वपूर्ण हैं, जबकि यह भी प्रकट करता है कि प्रभाव के पैटर्न विभिन्न डेटासेट में काफी भिन्न होते हैं, जो व्यापक सामान्यीकरण के विरुद्ध चेतावनी देता है।

Maximilian Maurer, Maximilian Linde, Gabriella Lapesa2026-05-08
💬 NLP

Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs

यह शोध पत्र LATTE को प्रस्तुत करता है, जो एक साझा, विकसित होते कार्य ग्राफ (task graph) के माध्यम से लार्ज लैंग्वेज मॉडल टीमों को समन्वित करने के लिए एक ढांचा है ताकि संरचनात्मक निरंतरता और अनुकूलनशीलता के बीच गतिशील रूप से संतुलन बनाया जा सके, जिससे मौजूदा स्थिर या असंरचित दृष्टिकोणों की तुलना में सटीकता को बनाए रखते हुए या उसमें सुधार करते हुए संसाधन खपत और समन्वय विफलताओं को कम किया जा सके।

Elizabeth Mieczkowski, Alexander Ku, Tiwalayo Eisape, Dilip Arumugam, John Matters, Katherine M. Collins, Ilia Sucholuts (…)2026-05-08
💬 NLP

Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity

यह शोध पत्र ओपन-वेट (open-weight) LLMs में मूल्यांकन-संदर्भ विचलन (evaluation-context divergence) को मापने के लिए एक युग्मित-प्रॉम्ट प्रोटोकॉल (paired-prompt protocol) प्रस्तुत करता है, जो यह प्रकट करता है कि अलाइनमेंट पाइपलाइन्स विषम व्यवहारिक बदलावों को प्रेरित करती हैं जहाँ कुछ मॉडल मूल्यांकन फ्रेमिंग के तहत अधिक सतर्क हो जाते हैं जबकि अन्य कम सतर्क हो जाते हैं, एक ऐसा पैटर्न जो विशिष्ट मॉडल परिवार और निर्णय के लिए उपयोग किए गए सुरक्षा क्लासिफायर के आधार पर महत्वपूर्ण रूप से भिन्न होता है।

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
💬 NLP

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

यह शोध पत्र MANTRA को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो प्राकृतिक भाषा वाले प्रक्रियात्मक मैनुअल (procedural manuals) से प्रतीकात्मक विश्व मॉडल (symbolic world models) और SMT-सत्यापित ट्रेस-स्तरीय जाँच (trace-level checks) उत्पन्न करके, टूल-उपयोग करने वाले LLM एजेंटों के लिए स्वचालित रूप से संश्लेषित और औपचारिक रूप से मान्य, स्केलेबल, मशीन-जांच योग्य अनुपालन बेंचमार्क का संश्लेषण करता है।

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck2026-05-08
💬 NLP

Is Escalation Worth It? A Decision-Theoretic Characterization of LLM Cascades

यह योगदान LLM कैस्केड्स के लागत-गुणवत्ता सीमा वक्रों (cost-quality frontier curves) को चित्रित करने के लिए एक निर्णय-सैद्धांतिक ढांचे को प्रस्तुत करता है और यह प्रदर्शित करता है कि मध्यवर्ती चरणों की कमी के बजाय, शुरुआती सस्ते मॉडल जनरेशन के लिए भुगतान करने से जुड़ी संरचनात्मक लागतें, सरल रूटिंग रणनीतियों की तुलना में मल्टी-स्टेज कैस्केड्स के प्रदर्शन लाभों को मौलिक रूप से सीमित करती हैं।

Dylan Bouchard2026-05-08
💬 NLP

GATHER: Convergence-Centric Hyper-Entity Retrieval for Zero-Shot Cell-Type Annotation

यह शोध पत्र GATHER का प्रस्ताव करता है, जो एक अभिसरण-केंद्रित (convergence-centric) रिट्रीवल विधि है जो हाइपर-एंटिटी क्वेरीज़ के लिए ज़ीरो-शॉट सिंगल-सेल सेल-टाइप एनोटेशन को कुशलतापूर्वक सक्षम करने के लिए एक जैविक ज्ञान ग्राफ (biological knowledge graph) में टोपोलॉजिकल अभिसरण बिंदुओं की पहचान करता है, जो बिना पुनरावृत्तिपूर्ण (iterative) LLM रीजनिंग के, सटीकता में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करते हुए गणनात्मक लागत को नाटकीय रूप से कम करता है।

Zhonghui Zhang, Feng Jiang, Shaowei Qin, Jiahao Zhao, Min Yang2026-05-08
💬 NLP

MiA-Signature: Approximating Global Activation for Long-Context Understanding

ग्लोबल इग्निशन के संज्ञानात्मक सिद्धांतों से प्रेरित होकर, यह शोधपत्र माइंडस्केप एक्टिवेशन सिग्नेचर (MiA-Signature) प्रस्तुत करता है, जो ग्लोबल एक्टिवेशन पैटर्न का एक कम्प्यूटेशनल रूप से कुशल, सबमॉड्यूलर-आधारित संकुचित प्रतिनिधित्व है जो LLMs, RAG और एजेंटिक प्रणालियों में लॉन्ग-कॉन्टेक्स्ट समझ को बढ़ाता है।

Yuqing Li, Jiangnan Li, Mo Yu, Zheng Lin, Weiping Wang, Jie Zhou2026-05-08
💬 NLP

From 124 Million Tokens to 1,021 Neologisms: A Large-Scale Pipeline for Automatic Neologism Detection

यह शोध पत्र एक स्केलेबल, मॉड्यूलर पाइपलाइन प्रस्तुत करता है जो 527 मिलियन रेडिट पोस्ट को प्रोसेस करने के लिए नियम-आधारित फ़िल्टरिंग और LLM वर्गीकरण को जोड़ता है, जो सफलतापूर्वक 124.6 मिलियन अद्वितीय टोकन को 1,021 नवोन्मेषी शब्द (neologism) उम्मीदवारों तक सीमित करता है, जिनमें से 58.7% को मैन्युअल सत्यापन के माध्यम से वास्तविक शाब्दिक नवाचारों के रूप में पुष्टि की गई है।

Diego Rossini, Lonneke van der Plas2026-05-08