💬 NLP

SecureBreak -- A dataset towards safe and secure models

यह शोध पत्र SecureBreak को प्रस्तुत करता है, जो एक मैन्युअल रूप से एनोटेट किया गया डेटासेट है जिसे अवशिष्ट सुरक्षा संरेखण कमजोरियों (residual security alignment weaknesses) के परिणामस्वरूप होने वाले हानिकारक LLM आउटपुट का पता लगाने के लिए डिज़ाइन किया गया है, जिससे यह जनरेशन के बाद की फ़िल्टरिंग के लिए एक मजबूत उपकरण के रूप में और भविष्य के मॉडल सुरक्षा सुधारों के मार्गदर्शन के रूप में कार्य करता है।

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera2026-03-24
💬 NLP

Retrieving Climate Change Disinformation by Narrative

यह शोध पत्र SpecFi का प्रस्ताव करता है, जो एक रिट्रीवल-आधारित ढांचा है जो पूर्व-निर्धारित लेबल के बिना उभरते जलवायु परिवर्तन दुष्प्रचार नैरेटिव्स (disinformation narratives) का पता लगाने के लिए काल्पनिक दस्तावेज़ उत्पन्न करता है, जो मानक रिट्रीवल विधियों की तुलना में नैरेटिव परिवर्तनशीलता के विरुद्ध बेहतर मजबूती प्रदर्शित करता है।

Max Upravitelev, Veronika Solopova, Charlott Jakob, Premtim Sahitaj, Vera Schmitt2026-03-24
💬 NLP

Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatch

यह शोध पत्र विषम टोकनाइज़र वाले बड़े भाषा मॉडलों के डिस्टिलेशन के लिए अत्याधुनिक DSKD-CMA पद्धति की सीमाओं का विश्लेषण करता है और की-क्वेरी (key-query) वितरण को संरेखित करने के लिए जनरेटिव एडवरसेरियल लर्निंग का उपयोग करने वाला एक नया DSKD-CMA-GA दृष्टिकोण प्रस्तावित करता है, जिसके परिणामस्वरूप टेक्स्ट जनरेशन की गुणवत्ता में निरंतर सुधार होता है।

Stella Eva Tsiapali, Cong-Thanh Do, Kate Knill2026-03-24
💬 NLP

Autoregressive vs. Masked Diffusion Language Models: A Controlled Comparison

यह शोध पत्र एक नियंत्रित अनुभवजन्य तुलना प्रस्तुत करता है जो दर्शाता है कि जहाँ ऑटोरेग्रेसिव लैंग्वेज मॉडल्स तेजी से अभिसरण (converge) करते हैं और अधिक प्रवाहपूर्ण टेक्स्ट उत्पन्न करते हैं, वहीं मास्क्ड डिफ्यूजन मॉडल्स समान प्रशिक्षण स्थितियों के तहत श्रेष्ठ नैरेटिव विविधता प्राप्त करते हैं और शीघ्र ओवरफिटिंग से बचते हैं, जो दोनों प्रतिमानों (paradigms) के बीच एक विशिष्ट विविधता-प्रवाह व्यापार-संबंध (diversity-fluency trade-off) को प्रकट करता है।

Caio Vicentino2026-03-24
💬 NLP

Multiperspectivity as a Resource for Narrative Similarity Prediction

यह शोध पत्र नैरेटिव मल्टीपर्सपेक्टिविटी (कथात्मक बहु-परिप्रेक्ष्यता) को एक चुनौती के रूप में मानने के बजाय उसे अपनाने के लिए 31 विविध LLM व्यक्तित्वों (पर्सोना) के एक समूह (एन्सेम्बल) का लाभ उठाने का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि ऐसा दृष्टिकोण SemEval-2026 टास्क 4 डेटासेट पर समानता भविष्यवाणी की सटीकता में सुधार करता है और वर्तमान एकल-सत्य (सिंगल-ग्राउंड-ट्रुथ) मूल्यांकन ढाँचों की सीमाओं को उजागर करता है।

Max Upravitelev, Veronika Solopova, Jing Yang, Charlott Jakob, Premtim Sahitaj, Ariana Sahitaj, Vera Schmitt2026-03-24
💬 NLP

The Semantic Ladder: A Framework for Progressive Formalization of Natural Language Content for Knowledge Graphs and AI Systems

यह शोध पत्र 'सिमेंटिक लैडर' (Semantic Ladder) को प्रस्तुत करता है, जो एक ऐसा वास्तुशिल्प ढांचा है जो बढ़ती हुई अर्थपूर्ण स्पष्टता के स्तरों में निरूपणों को व्यवस्थित करके प्राकृतिक भाषा को मशीन-सक्षम ज्ञान ग्राफ़ (knowledge graphs) में स्केलेबल और ट्रैसेबल प्रगतिशील औपचारिकीकरण की सुविधा प्रदान करता है।

Lars Vogt2026-03-24
💬 NLP

Enhancing Document-Level Machine Translation via Filtered Synthetic Corpora and Two-Stage LLM Adaptation

यह शोध पत्र दस्तावेज़-स्तरीय मशीन अनुवाद में बड़े भाषा मॉडलों (LLMs) के लिए एक दो-चरणीय फाइन-ट्यूनिंग रणनीति प्रस्तावित करता है जो डेटा की कमी को दूर करने और जनरेशन मतिभ्रम (hallucinations) को कम करने के लिए LLM-संवर्धित और कठोरता से फ़िल्टर किए गए सिंथेटिक कॉर्पोरा का लाभ उठाता है।

Ireh Kim, Tesia Sker, Chanwoo Kim2026-03-24
💬 NLP

SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection

यह शोध पत्र SPA (स्केलिंग प्रॉम्प्ट-इंजीनियर्ड ऑग्मेंटेशन) का प्रस्ताव करता है, जो एक सरल लेकिन अत्यधिक प्रभावी बेसलाइन है जो ज्ञान इंजेक्शन (knowledge injection) के लिए बड़े पैमाने पर सिंथेटिक डेटा उत्पन्न करने हेतु सावधानीपूर्वक डिज़ाइन किए गए प्रॉम्प्ट्स का लाभ उठाता है, और जटिल RL-आधारित एवं बहु-चरणीय प्रॉम्प्टिंग विधियों को पीछे छोड़ते हुए उनकी स्केलेबिलिटी और विविधता की सीमाओं से बचता है।

Kexian Tang, Jiani Wang, Shaowen Wang, Kaifeng Lyu2026-03-24
💬 NLP

Gumbel Distillation for Parallel Text Generation

यह शोध पत्र गंबेल डिस्टिलेशन (Gumbel Distillation) को प्रस्तुत करता है, जो एक नवीन, मॉडल-अज्ञेय (model-agnostic) तकनीक है जो गंबेल-मैक्स ट्रिक का लाभ उठाकर समानांतर डिकोडर्स (parallel decoders) को ऑटोरिग्रेसिव शिक्षकों के जटिल संयुक्त टोकन वितरणों को प्रभावी ढंग से सीखने में सक्षम बनाती है, जिससे जनरेशन की गुणवत्ता में महत्वपूर्ण सुधार होता है और समानांतर एवं अनुक्रमिक (sequential) भाषा मॉडलों के बीच प्रदर्शन के अंतर को कम किया जाता है।

Chi Zhang, Xixi Hu, Bo Liu, Qiang Liu2026-03-24
💬 NLP

Dyadic: A Scalable Platform for Human-Human and Human-AI Conversation Research

यह शोध पत्र Dyadic को प्रस्तुत करता है, जो एक मॉड्यूलर, वेब-आधारित प्लेटफॉर्म है जिसे मल्टी-मोडल इंटरेक्शन, रियल-टाइम मॉनिटरिंग, AI सहायता और कोडिंग विशेषज्ञता की आवश्यकता के बिना एकीकृत सर्वेक्षण परिनियोजन जैसी विशेषताओं के माध्यम से मानव-मानव और मानव-AI बातचीत पर स्केलेबल अनुसंधान को सुगम बनाने के लिए डिज़ाइन किया गया है।

David M. Markowitz2026-03-24