💬 NLP

Computational Analysis of Semantic Connections Between Herman Melville Reading and Writing

यह अध्ययन हर्मन मेलविल के लेखन पर उनके पठन के प्रभाव की जांच करने के लिए BERTScore का उपयोग करते हुए कम्प्यूटेशनल सिमेंटिक सिमिलरिटी विश्लेषण नियोजित करता है, जो यह प्रदर्शित करता है कि यह पद्धति ज्ञात साहित्यिक संबंधों की प्रभावी ढंग से पहचान करती है और गुणात्मक परीक्षण के लिए नए अंशों को रेखांकित करती है।

Nudrat Habib, Elisa Barney Smith, Steven Olsen Smith2026-03-17
💬 NLP

Towards Next-Generation LLM Training: From the Data-Centric Perspective

यह शोध पत्र दो प्रमुख दिशाओं का प्रस्ताव करते हुए अगली पीढ़ी के एलएलएम (LLM) प्रशिक्षण की वकालत करता है: स्वचालित, सुदृढ़ डेटा तैयारी वर्कफ़्लो के लिए एजेंट-आधारित प्रणालियों का विकास, और प्रदर्शन को अनुकूलित करने के लिए गतिशील डेटा चयन, मिश्रण और पुन: भारण (reweighting) को सक्षम करने वाले एकीकृत प्रशिक्षण ढांचे का निर्माण।

Hao Liang, Zhengyang Zhao, Zhaoyang Han, Meiyi Qiang, Xiaochen Ma, Bohan Zeng, Qifeng Cai, Zhiyu Li, Linpeng Tang, Weina (…)2026-03-17
💬 NLP

Beyond Creed: A Non-Identity Safety Condition A Strong Empirical Alternative to Identity Framing in Low-Data LoRA Fine-Tuning

यह शोध पत्र यह प्रदर्शित करता है कि कम-डेटा वाले LoRA सुरक्षा फाइन-ट्यूनिंग में, एक गैर-पहचान (non-identity) पर्यवेक्षण स्थिति, विभिन्न मॉडल परिवारों में सामान्य क्षमताओं से समझौता किए बिना, क्रीड-शैली (creed-style) पहचान फ्रेमिंग और संवैधानिक नियमों की तुलना में काफी बेहतर प्रदर्शन करती है, जो प्रभावी सुरक्षा संरेखण के लिए स्पष्ट पहचान भाषा की आवश्यकता को चुनौती देती है।

Xinran Zhang2026-03-17
💬 NLP

Information Asymmetry across Language Varieties: A Case Study on Cantonese-Mandarin and Bavarian-German QA

यह शोध पत्र एक नवीन QA डेटासेट प्रस्तुत करता है यह प्रदर्शित करने के लिए कि लार्ज लैंग्वेज मॉडल्स अपने मानक समकक्षों (मैंडरिन और जर्मन) की तुलना में स्थानीय भाषा विविधताओं (कैंटोनीज़ और बवेरियन) से संबंधित ज्ञान पर आधारित प्रश्नों के उत्तर देने में संघर्ष करते हैं, जो महत्वपूर्ण सूचना विषमताओं और एआई में बेहतर सांस्कृतिक समावेशिता की अनिवार्य आवश्यकता को रेखांकित करता है।

Renhao Pei, Siyao Peng, Verena Blaschke, Robert Litschko, Barbara Plank2026-03-17
💬 NLP

The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatments

यह शोध पत्र इस बात की जांच करता है कि कैसे कोविड-19 उपचारों के बारे में पुनर्प्राप्त वैचारिक पाठ (ideological texts) एक रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) ढांचे के भीतर लार्ज लैंग्वेज मॉडल के आउटपुट को प्रभावित करते हैं, यह प्रदर्शित करते हुए कि ऐसा बाहरी ज्ञान मॉडल की प्रतिक्रियाओं को विशिष्ट विचारधाराओं के साथ महत्वपूर्ण रूप से संरेखित करता है और उन्नत प्रॉम्प्टिंग इस प्रभाव को और अधिक बढ़ा देती है, जिससे RAG सिस्टम में वैचारिक पूर्वाग्रहों और हेरफेर के जोखिमों को पहचानने और कम करने की महत्वपूर्ण आवश्यकता पर प्रकाश पड़ता है।

Elmira Salari (Wichita State University), Maria Claudia Nunes Delfino (Pontifícia Universidade Católica de São Paulo), H (…)2026-03-17
💬 NLP

ContiGuard: A Framework for Continual Toxicity Detection Against Evolving Evasive Perturbations

यह शोध पत्र कॉन्टीगार्ड (ContiGuard) को प्रस्तुत करता है, जो निरंतर विषाक्तता पहचान (continual toxicity detection) के लिए एक नवीन ढांचा है, जो विकसित होते और अर्थ-विकृत करने वाले अपयवी व्यवधानों (semantics-distorting evasive perturbations) के विरुद्ध लचीलापन बनाए रखने और पहचान क्षमताओं को गतिशील रूप से अपडेट करने के लिए एक एलएलएम-संचालित अर्थ संवर्धन रणनीति (LLM-powered semantic enriching strategy) और एक विभेदन-संचालित विशेषता शिक्षण दृष्टिकोण (discriminability-driven feature learning approach) का लाभ उठाता है।

Hankun Kang, Xin Miao, Jianhao Chen, Jintao Wen, Mayi Xu, Weiyu Zhang, Wenpeng Lu, Tieyun Qian2026-03-17
💬 NLP

Shopping Companion: A Memory-Augmented LLM Agent for Real-World E-Commerce Tasks

यह शोध पत्र एक नए बेंचमार्क और "शॉपिंग कंपैनियन" (Shopping Companion) को पेश करते हुए दीर्घकालिक प्राथमिकता-जागरूक खरीदारी की चुनौतियों का समाधान करता है, जो एक एकीकृत मेमोरी-ऑगमेंटेड एलएलएम (LLM) एजेंट है जिसे एक दोहरे-पुरस्कार सुदृढीकरण लर्निंग (dual-reward reinforcement learning) रणनीति के साथ प्रशिक्षित किया गया है और जो उपयोगकर्ता की प्राथमिकताओं को समझने और जटिल ई-कॉमर्स कार्यों को निष्पादित करने में अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।

Zijian Yu, Kejun Xiao, Huaipeng Zhao, Tao Luo, Xiaoyi Zeng2026-03-17
💬 NLP

Developing an English-Efik Corpus and Machine Translation System for Digitization Inclusion

यह अध्ययन एक समुदाय-क्यूरेटेड समानांतर संग्रह (parallel corpus) विकसित करके और यह प्रदर्शित करके एनएलपी (NLP) में कम-संसाधन वाली एफिक (Efik) भाषा के अल्प-प्रतिनिधित्व को संबोधित करता है कि इस डेटासेट पर एनएलबी-200 (NLLB-200) मॉडल को फाइन-ट्यून करने से एमटी5 (mT5) की तुलना में बेहतर अंग्रेजी-एफिक मशीन अनुवाद प्रदर्शन प्राप्त होता है, जिससे समावेशी और न्यायसंगत डिजिटल भाषा संरक्षण को बढ़ावा मिलता है।

Offiong Bassey Edet, Mbuotidem Sunday Awak, Emmanuel Oyo-Ita, Benjamin Okon Nyong, Ita Etim Bassey2026-03-17
⚡ electrical engineering

Modeling and Benchmarking Spoken Dialogue Rewards with Modality and Colloquialness

यह शोध पत्र SDiaReward प्रस्तुत करता है, जो एक नवीन डेटासेट पर प्रशिक्षित एक एंड-टू-एंड मल्टी-टर्न रिवॉर्ड मॉडल है, जिसका उद्देश्य स्पोकन डायलॉग सिस्टम में मोडैलिटी और बोलचाल के अंतर को पाटना है, साथ ही ESDR-Bench बेंचमार्क भी पेश करता है, जो प्रोसोडी, इमोशन और नेचुरल स्पीच एक्सप्रेसिवनेस के मूल्यांकन में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

Jingyu Lu, Yuhan Wang, Fan Zhuo, Xize Cheng, Changhao Pan, Xueyi Pu, Yifu Chen, Chenyuhao Wen, Tianle Liang, Zhou Zhao2026-03-17
💬 NLP

LLMs as Signal Detectors: Sensitivity, Bias, and the Temperature-Criterion Analogy

यह पूर्व-पंजीकृत अध्ययन सिग्नल डिटेक्शन थ्योरी (Signal Detection Theory) को लार्ज लैंग्वेज मॉडल्स पर लागू करता है, जो यह प्रकट करता है कि तापमान एक शुद्ध क्राइटेरियन शिफ्ट के बजाय संवेदनशीलता और पूर्वाग्रह दोनों के दोहरे-मॉड्यूलेटर के रूप में कार्य करता है, और यह प्रदर्शित करता है कि पूर्ण पैरामीट्रिक एसडीटी फ्रेमवर्क उन महत्वपूर्ण नैदानिक अंतरों को उजागर करता है जिन्हें पारंपरिक कैलिब्रेशन मेट्रिक्स पकड़ने में विफल रहते हैं।

Jon-Paul Cacioli2026-03-17