💬 NLP

Improving Neural Argumentative Stance Classification in Controversial Topics with Emotion-Lexicon Features

यह शोध पत्र एक न्यूरल स्टेंस क्लासिफिकेशन मॉडल का प्रस्ताव करता है जिसे DistilBERT एम्बेडिंग्स से प्राप्त एक विस्तारित, संदर्भ-जागरूक इमोशन लेक्सिकॉन (eNRC) द्वारा उन्नत किया गया है, जो बेसलाइन, मूल लेक्सिकॉन और LLM-आधारित दृष्टिकोणों की तुलना में पांच विविध विवादास्पद विषय डेटासेट्स पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Mohammad Yeghaneh Abkenar, Weixing Wang, Manfred Stede, Davide Picca, Mark A. Finlayson, Panagiotis Ioannidis2026-02-27
💬 NLP

Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

यह शोध पत्र ReMix का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त ढांचा (training-free framework) है जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स में सिमेंटिक विसंगतियों को हल करने के लिए एक निरंतर मिश्रण अवस्था (continuous mixing state) और एक रिजेक्शन मैकेनिज्म पेश करता है, जिससे जनरेशन की गुणवत्ता से समझौता किए बिना 2–8× इन्फरेंस स्पीडअप प्राप्त होता है।

Yushi Ye, Feng Hong, Huangjie Zheng, Xu Chen, Zhiyong Chen, Yanfeng Wang, Jiangchao Yao2026-02-27
💬 NLP

Test-Time Scaling with Diffusion Language Models via Reward-Guided Stitching

यह शोध पत्र "स्टिचिंग नॉइजी डिफ्यूजन थॉट्स" (Stitching Noisy Diffusion Thoughts) प्रस्तावित करता है, जो एक प्रशिक्षण-मुक्त ढांचा है जो एक मास्क्ड डिफ्यूजन मॉडल के माध्यम से विविध मध्यवर्ती चरणों को नमूना बनाकर, एक प्रोसेस रिवॉर्ड मॉडल के माध्यम से उन्हें स्कोर करके, और उच्चतम गुणवत्ता वाले चरणों को एक समग्र तर्क में पुनर्संयोजित करके एक ऑटोरेग्रेसिव सॉल्वर को निर्देशित करने के लिए जटिल गणित और कोडिंग कार्यों पर तर्क क्षमता को बढ़ाता है, जिससे मौजूदा विधियों की तुलना में महत्वपूर्ण सटीकता लाभ और विलंबता में कमी प्राप्त होती है।

Roy Miles, Aysim Toker, Andreea-Maria Oncescu, Songcen Xu, Jiankang Deng, Ismail Elezi2026-02-27
💬 NLP

Frequency-Ordered Tokenization for Better Text Compression

यह शोध पत्र फ्रीक्वेंसी-ऑर्डर्ड टोकनाइजेशन (frequency-ordered tokenization) को प्रस्तुत करता है, जो एक सरल प्रीप्रोसेसिंग तकनीक है जो बीपीई (BPE) शब्दावली को टोकन आवृत्ति के आधार पर पुनर्व्यवस्थित करती है ताकि विभिन्न एल्गोरिदम और भाषाओं में लॉसलेस टेक्स्ट कंप्रेशन अनुपात में उल्लेखनीय सुधार किया जा सके और संपीड़न गति को तेज किया जा सके।

Maximilian Kalcher2026-02-27
💬 NLP

Toward Automatic Filling of Case Report Forms: A Case Study on Data from an Italian Emergency Department

यह शोध पत्र एक नए इतालवी आपातकालीन विभाग (Emergency Department) डेटासेट को पेश करके, कार्य और मूल्यांकन मेट्रिक्स को परिभाषित करके, और यह प्रदर्शित करके कि जबकि अत्याधुनिक लार्ज लैंग्वेज मॉडल्स (LLMs) ज़ीरो-शॉट सेटिंग में इस कार्य को करने में सक्षम हैं, उनके आउटपुट को अत्यधिक सावधानी जैसे अंतर्निहित पूर्वाग्रहों के लिए सुधार की आवश्यकता होती है, स्वचालित केस रिपोर्ट फॉर्म (CRF) भरने के लिए एनोटेटेड डेटा की कमी को संबोधित करता है।

Gabriela Anna Kaczmarek, Pietro Ferrazzi, Lorenzo Porta, Vicky Rubini, Bernardo Magnini2026-02-27
⚡ electrical engineering

Make It Hard to Hear, Easy to Learn: Long-Form Bengali ASR and Speaker Diarization via Extreme Augmentation and Perfect Alignment

यह शोध पत्र 882-घंटे के लिपि-घोर-882 (Lipi-Ghor-882) डेटासेट को पेश करके लंबी अवधि के बंगाली भाषण संसाधनों की कमी को संबोधित करता है और यह प्रदर्शित करता है कि सिंथेटिक डिग्रेडेशन (synthetic degradation) के साथ लक्षित फाइन-ट्यूनिंग एएसआर (ASR) प्रदर्शन को अनुकूलित करती है, जबकि स्पीकर डायराइजेशन (speaker diarization) के लिए बेसलाइन मॉडल का ह्यूरिस्टिक पोस्ट-प्रोसेसिंग (heuristic post-processing), रिट्रेनिंग की तुलना में अधिक प्रभावी सिद्ध होता है, जो सामूहिक रूप से ~0.019 रियल-टाइम फैक्टर (Real-Time Factor) के साथ एक अत्यधिक कुशल दोहरी पाइपलाइन स्थापित करता है।

Sanjid Hasan, Risalat Labib, A H M Fuad, Bayazid Hasan2026-02-27
💬 NLP

Quantity Convergence, Quality Divergence: Disentangling Fluency and Accuracy in L2 Mandarin Prosody

यह अध्ययन प्रकट करता है कि जहाँ मंदारिन सीखने वाले उन्नत वियतनामी शिक्षार्थी मेजर फ्रेज़ स्तर पर नेटिव-लाइक प्रोसोडिक बाउंड्रीज़ की मात्रा प्राप्त करते हैं, वहीं वे सब्जेक्ट-वर्ब और वर्ब-ऑब्जेक्ट इंटरफेस के बीच नेटिव प्रोसोडिक पदानुक्रम को उलटकर संरचनात्मक मैपिंग में एक निरंतर, गैर-रैखिक विचलन प्रदर्शित करते हैं, जिससे वे सिंटैक्टिक सटीकता के बजाय प्रवाह को प्राथमिकता देते हैं।

Yuqi Shi, Hao Yang, Xiyao Lu, Jinsong Zhang2026-02-27
💬 NLP

Assessing Deanonymization Risks with Stylometry-Assisted LLM Agent

यह शोध पत्र SALA को प्रस्तुत करता है, जो एक स्टाइलोमेट्री-सहायता प्राप्त (stylometry-assisted) LLM एजेंट फ्रेमवर्क है, जो समाचार लेखों में लेखक के अनामिकता निवारण (authorship deanonymization) के जोखिमों का मूल्यांकन करता है और इन जोखिमों को प्रभावी ढंग से कम करने के साथ-साथ पाठ्य अर्थ को संरक्षित करने के लिए एक निर्देशित पुनर्संरचना (guided recomposition) रणनीति प्रस्तावित करता है।

Boyang Zhang, Yang Zhang2026-02-27
💬 NLP

AgentDropoutV2: Optimizing Information Flow in Multi-Agent Systems via Test-Time Rectify-or-Reject Pruning

AgentDropoutV2 एक टेस्ट-टाइम फ्रेमवर्क है जो रिट्रीवल-ऑगमेंटेड करेक्शन और फेल्योर-ड्रिवन इंडिकेटर्स का उपयोग करके त्रुटिपूर्ण एजेंट आउटपुट्स को गतिशील रूप से बीच में रोककर या उन्हें सुधारकर या हटाकर मल्टी-एजेंट सिस्टम के प्रदर्शन को अनुकूलित करता है, जिससे मॉडल को पुन: प्रशिक्षित किए बिना जटिल तर्क कार्यों पर सटीकता को महत्वपूर्ण रूप से बढ़ाया जाता है।

Yutong Wang, Siyuan Xiong, Xuebo Liu, Wenkang Zhou, Liang Ding, Miao Zhang, Min Zhang2026-02-27
💬 NLP

Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems

यह शोध पत्र डिस्कोर्स-अवेयर ड्यूल-ट्रैक स्ट्रीमिंग रिस्पॉन्स (DDTSR) फ्रेमवर्क का प्रस्ताव करता है, जो स्पोकन डायलॉग सिस्टम्स के लिए एक लो-लेटेंसी आर्किटेक्चर है जो समानांतर सुनने, सोचने और बोलने को सक्षम करने के लिए कनेक्टिव-गाइडेड मॉडल सिनर्जी, स्ट्रीमिंग क्रॉस-मोडल कोलैबोरेशन और करिकुलम लर्निंग का उपयोग करता है, जिससे डिस्कोर्स की गुणवत्ता बनाए रखते हुए रिस्पॉन्स लेटेंसी को 19%-51% तक कम किया जा सकता है।

Siyuan Liu, Jiahui Xu, Feng Jiang, Kuang Wang, Zefeng Zhao, Chu-Ren Huang, Jinghang Gu, Changqing Yin, Haizhou Li2026-02-27