💬 NLP

T^\star: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning

यह शोध पत्र TT^\star को प्रस्तुत करता है, जो एक TraceRL-आधारित प्रशिक्षण पाठ्यक्रम है जो मास्क किए गए डिफ्यूजन लैंग्वेज मॉडल्स को छोटे से बड़े डिकोडिंग ब्लॉक्स तक प्रगतिशील रूप से स्केल करने में सक्षम बनाता है, जिससे गणितीय तर्क कार्यों पर न्यूनतम प्रदर्शन हानि के साथ उच्च-समानांतरता (high-parallelism) डिकोडिंग प्राप्त होती है।

Hanchen Xia, Baoyou Chen, Yutang Ge, Guojiang Zhao, Siyu Zhu2026-03-30
💬 NLP

CitiLink: Enhancing Municipal Transparency and Citizen Engagement through Searchable Meeting Minutes

CitiLink एक प्रदर्शन मंच है जो बड़े भाषा मॉडलों (Large Language Models) का लाभ उठाकर असंरचित नगरपालिका बैठक के विवरणों को संरचित, खोजने योग्य डेटा में बदल देता है, जिससे पुर्तगाली नगरपालिका अभिलेखों पर परीक्षण किए गए एक उपयोगकर्ता के अनुकूल इंटरफ़ेस के माध्यम से सरकारी पारदर्शिता और नागरिक जुड़ाव को बढ़ाया जा सकता है।

Rodrigo Silva, José Evans, José Isidro, Miguel Marques, Afonso Fonseca, Ricardo Morais, João Canavilhas, Arian Pasquali (…)2026-03-30
💬 NLP

Formula-One Prompting: Equation-First Reasoning For Applied Mathematics

यह शोध पत्र फॉर्मूला-वन प्रॉम्प्टिंग (F-1) को पेश करता है, जो एक दो-चरणीय तर्क पद्धति है जो एक समाधान रणनीति चुनने से पहले गवर्निंग इक्वेशंस (शासी समीकरणों) को स्पष्ट रूप से एक मध्यवर्ती चरण के रूप में तैयार करके, लागू गणित में लार्ज लैंग्वेज मॉडल के प्रदर्शन में सुधार करती है, जिससे यह कई बेंचमार्क में मौजूदा चेन-ऑफ-थॉट और प्रोग्राम-ऑफ-थॉट दृष्टिकोणों से बेहतर प्रदर्शन करती है।

Natapong Nitarach, Pittawat Taveekitworachai, Kunat Pipatanakul2026-03-30
💬 NLP

ClaimPT: A Portuguese Dataset of Annotated Claims in News Articles

यह शोध पत्र ClaimPT को प्रस्तुत करता है, जो LUSA न्यूज़ एजेंसी के 1,308 समाचार लेखों का एक उच्च-गुणवत्ता वाला यूरोपीय पुर्तगाली डेटासेट है जिसमें 6,875 एनोटेटेड तथ्यात्मक दावे शामिल हैं, जिसे कम संसाधन वाली भाषाओं के लिए स्वचालित तथ्य-जांच (ऑटोमेटेड फैक्ट-चेकिंग) हेतु संसाधनों की कमी को दूर करने और दावा पहचान (क्लेम डिटेक्शन) के लिए आधारभूत बेंचमार्क स्थापित करने के लिए डिज़ाइन किया गया है।

Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António B (…)2026-03-30
💬 NLP

AI and My Values: User Perceptions of LLMs' Ability to Extract, Embody, and Explain Human Values from Casual Conversations

यह शोध पत्र 'वैल्यू-अलाइनमेंट परसेप्शन टूलकिट' (VAPT) को प्रस्तुत करता है जो यह मूल्यांकन करता है कि उपयोगकर्ता LLMs की अपने मूल्यों को निकालने, उन्हें आत्मसात करने और समझाने की क्षमता को कैसे देखते हैं, जिससे यह पता चलता है कि हालांकि कई प्रतिभागी AI की समझ के प्रति आश्वस्त हो गए, लेकिन यह घटना "हथियारबंद सहानुभूति" (weaponized empathy) के बारे में गंभीर चिंताएं पैदा करती है और भविष्य के AI डिज़ाइन में पारदर्शी सुरक्षा उपायों की आवश्यकता को रेखांकित करती है।

Bhada Yun, Renn Su, April Yi Wang2026-03-30
💬 NLP

MiNER: A Two-Stage Pipeline for Metadata Extraction from Municipal Meeting Minutes

यह शोध पत्र MiNER को प्रस्तुत करता है, जो विषम नगरपालिका बैठक विवरणों से मेटाडेटा निकालने के लिए प्रश्न उत्तर और ट्रांसफॉर्मर-आधारित मॉडलों को संयोजित करने वाला एक दो-चरणीय पाइपलाइन है, जो क्रॉस-नगरपालिका सामान्यीकरण की चुनौतियों के बावजूद मजबूत इन-डोमेन प्रदर्शन प्रदर्शित करता है और इस कार्य के लिए पहला बेंचमार्क स्थापित करता है।

Rodrigo Batista, Luís Filipe Cunha, Purificação Silvano, Nuno Guimarães, Alípio Jorge, Evelin Amorim, Ricardo Campos2026-03-30
💬 NLP

CitiLink-Minutes: A Multilayer Annotated Dataset of Municipal Meeting Minutes

यह शोध पत्र CitiLink-Minutes प्रस्तुत करता है, जो 120 यूरोपीय पुर्तगाली नगर पालिका बैठक के विवरणों से एक मिलियन से अधिक टोकन वाला एक बहुस्तरीय एनोटेटेड डेटासेट है, जिसमें स्थानीय शासन के लिए प्राकृतिक भाषा प्रसंस्करण और सूचना पुनर्प्राप्ति में अनुसंधान को आगे बढ़ाने के लिए संरचित मेटाडेटा, चर्चा के विषय और मतदान के परिणाम शामिल हैं।

Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Is (…)2026-03-30
💬 NLP

Quantization-Robust LLM Unlearning via Low-Rank Adaptation

यह शोध पत्र लो-रैंक अडैप्टेशन (LoRA) का उपयोग करते हुए एक क्वांटाइजेशन-रोबस्ट अनलर्निंग विधि प्रस्तावित करता है जो आक्रामक 4-बिट पोस्ट-ट्रेनिंग क्वांटाइजेशन के तहत अनलर्निंग अपडेट को सुरक्षित रखने के लिए बेस मॉडल को फ्रीज करता है, जिससे मानक फुल-पैरामीटर फाइन-ट्यूनिंग की तुलना में उपयोगिता (utility) में उल्लेखनीय सुधार होता है और गोपनीयता रिसाव (privacy leakage) कम होता है।

João Vitor Boer Abitante, Joana Meneguzzo Pasquali, Luan Fonseca Garcia, Ewerton de Oliveira, Thomas da Silva Paula, Rod (…)2026-03-30
💬 NLP

LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models

यह शोध पत्र NileTTS प्रस्तुत करता है, जो इस व्यापक रूप से बोली जाने वाली बोली के लिए संसाधनों की कमी को दूर करने हेतु पहला सार्वजनिक रूप से उपलब्ध मिस्र अरबी टेक्स्ट-टू-स्पीच डेटासेट और एक पुनरुत्पादक सिंथेटिक डेटा पाइपलाइन है, जो लार्ज लैंग्वेज मॉडल्स और XTTS v2 मॉडल को फाइन-ट्यून करके विविध भाषण के माध्यम से 38 घंटे का डेटा उत्पन्न करता है।

Ahmed Khaled Khamis, Hesham Ali2026-03-30
💬 NLP

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

यह शोधपत्र मल्टीमॉडल कन्वर्सेशन इमोशन रिकग्निशन के लिए एक रिलेशन-अवेयर डिनोइजिंग और डिफ्यूजन अटेंशन फ्यूजन मॉडल प्रस्तावित करता है जो ऑडियो और वीडियो में शोर को कम करने के लिए एक डिफरेंशियल ट्रांसफॉर्मर का उपयोग करता है, वक्ता-निर्भर भावनात्मक निर्भरताओं को कैप्चर करने के लिए रिलेशन सबग्राफ का उपयोग करता है, और मजबूत, सिमेंटिक रूप से संरेखित मल्टीमॉडल फ्यूजन प्राप्त करने के लिए एक टेक्स्ट-गाइडेड डिफ्यूजन मैकेनिज्म का लाभ उठाता है।

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li2026-03-30