💬 NLP

Instruction-Guided Poetry Generation in Arabic and Its Dialects

यह शोध पत्र आधुनिक मानक अरबी और उसकी बोलियों में एक बड़े पैमाने के, निर्देश-आधारित डेटासेट का परिचय देता है जो लार्ज लैंग्वेज मॉडल्स को शैली और तुकबंदी जैसी विशिष्ट उपयोगकर्ता आवश्यकताओं के अनुसार कविता को नियंत्रित रूप से उत्पन्न करने, संशोधित करने और विश्लेषण करने में सक्षम बनाता है।

Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov (…)2026-05-01
💬 NLP

How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews

यह अनुभवजन्य अध्ययन गूगल सर्च, एआई ओवरव्यूज़ और जेमिनी की तुलना करके यह विश्लेषण करता है कि कैसे जनरेटिव एआई पारंपरिक वेब खोज को बाधित कर रहा है, जो स्रोत चयन, कम निरंतरता और एआई क्रॉलर्स को ब्लॉक करने वाली साइटों के लिए कम दृश्यता में महत्वपूर्ण अंतर को प्रकट करता है, जबकि पारिस्थितिकी तंत्र को समर्थन देने के लिए टिकाऊ राजस्व ढांचे का आह्वान करता है।

Riley Grossman, Songjiang Liu, Michael K. Chen, Mike Smith, Cristian Borcea, Yi Chen2026-05-01
💬 NLP

ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

ZipCCL एक नवीन लॉसलेस कंप्रेशन लाइब्रेरी है जो सैद्धांतिक रूप से आधारित एक्सपोनेंट कोडिंग, GPU-अनुकूलित कर्नेल और अनुकूलन रणनीतियों के माध्यम से संचार डेटा के नियर-गॉसियन वितरण का लाभ उठाकर LLM प्रशिक्षण को तेज़ करती है, जिससे मॉडल की गुणवत्ता से समझौता किए बिना संचार समय को 1.35x तक कम करने और एंड-टू-एंड स्पीडअप को 1.18x तक प्राप्त करने में मदद मिलती है।

Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu2026-05-01
💬 NLP

Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health

यह शोध पत्र एक तीन-स्तरीय कथा ढांचे (narrative framework) को प्रस्तुत करता है और यह प्रदर्शित करता है कि कथा संरचना का मैक्रो-स्तरीय एलएलएम (LLM) मूल्यांकन, 830 चीनी चिकित्सीय ग्रंथों में मानसिक स्वास्थ्य अवस्थाओं की भविष्यवाणी करने में पारंपरिक शाब्दिक और सिमेंटिक एम्बेडिंग विशेषताओं की तुलना में काफी बेहतर प्रदर्शन करता है, जो शब्द-स्तरीय सांख्यिकी के बजाय वैश्विक विमर्श संगठन (global discourse organization) के महत्वपूर्ण भविष्य कहनेवाला मूल्य को रेखांकित करता है।

Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu2026-05-01
💬 NLP

Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems

यह शोध पत्र एक यूनिमोडल टेस्ट-टाइम रीजनिंग दृष्टिकोण प्रस्तावित करता है जो विस्तृत ऑब्जेक्ट मेटाडेटा और संवाद इतिहास का विश्लेषण करने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, यह प्रदर्शित करते हुए कि यह विधि SIMMC 2.1 डेटासेट पर जनरलाइजेशन और क्रॉस-डोमेन मूल्यांकन में सुपरवाइज्ड मॉडल्स से बेहतर प्रदर्शन करके टास्क-आधारित डायलॉग सिस्टम में कोरेफरेंस रेजोल्यूशन में महत्वपूर्ण सुधार करती है।

Oier Ijurco, Oier Lopez de Lacalle2026-05-01
💬 NLP

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

ट्विनगेट (TwinGate) एक स्टेटफुल, लो-लेटेंसी डिफेंस फ्रेमवर्क है जो एसिमेट्रिक कॉन्ट्रास्टिव लर्निंग का उपयोग करके अनट्रेसेबल एलएलएम (LLM) ट्रैफिक में डिकंपोजिशनल जेलब्रेक्स का प्रभावी ढंग से पता लगाने के लिए दुर्भावनापूर्ण इरादे के अंशों को क्लस्टर करता है और फॉल्स पॉजिटिव्स को दबाता है, जो 3.6 मिलियन से अधिक निर्देशों के एक नए निर्मित बड़े पैमाने के डेटासेट पर मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करता है।

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao2026-05-01
💬 NLP

Geometry-Calibrated Conformal Abstention for Language Models

यह शोधपत्र ज्योमेट्री-कैलिब्रेटेड कॉन्फॉर्मल एब्स्टेंशन (Geometry-Calibrated Conformal Abstention) का प्रस्ताव देता है, जो एक पोस्ट-हॉक फ्रेमवर्क है जो प्रेडिक्शन कॉन्फिडेंस को कैलिब्रेट करने के लिए रिप्रेजेंटेशन ज्योमेट्री का लाभ उठाता है और भाषा मॉडलों को भागीदारी दरों और प्रतिक्रिया की शुद्धता दोनों पर परिमित-नमूना गारंटी (finite-sample guarantees) के साथ प्रश्नों का उत्तर देने से चुनिंदा रूप से बचने में सक्षम बनाता है, जिससे बिना पुन: प्रशिक्षण (retraining) के प्रभावी रूप से मतिभ्रम (hallucinations) को कम किया जा सकता है।

Rui Xu, Yi Chen, Sihong Xie, Hui Xiong2026-05-01
💬 NLP

Reliable Answers for Recurring Questions: Boosting Text-to-SQL Accuracy with Template Constrained Decoding

यह शोध पत्र TeCoD को प्रस्तुत करता है, जो पुनरावृत्ति होने वाले क्वेरी पैटर्न का लाभ उठाकर पुन: प्रयोज्य टेम्पलेट्स का चयन करने और व्याकरण-बाधित डिकोडिंग के माध्यम से उन्हें लागू करके Text-to-SQL सटीकता में सुधार करता है और विलंबता (latency) को कम करता है।

Smit Jivani, Sarvam Maheshwari, Sunita Sarawagi2026-05-01
💬 NLP

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

यह शोधपत्र DriftBench प्रस्तुत करता है, जो एक ऐसा बेंचमार्क है जो यह प्रदर्शित करता है कि बड़े भाषा मॉडल (LLMs) मल्टी-टर्न वैज्ञानिक विचार-मंथन (scientific ideation) के दौरान अक्सर मूल बाधाओं का उल्लंघन करते हैं, बावजूद इसके कि वे उन्हें सटीक रूप से याद रखते हैं, जो एक महत्वपूर्ण "जानता-है-पर-उल्लंघन-करता-है" (knows-but-violates) विसंगति को प्रकट करता है जो चेकपॉइंटिंग के साथ भी बनी रहती है और LLM जजों द्वारा कम पहचाना जाता है।

Garvin Kruthof2026-05-01
💬 NLP

Measuring research data reuse in scholarly publications using generative artificial intelligence: Open Science Indicator development and preliminary results

PLOS और DataSeer ने एक नया LLM-आधारित संकेतक विकसित किया है जो विद्वत्तापूर्ण प्रकाशनों में 43% अनुसंधान डेटा पुन: उपयोग दर को प्रकट करता है, जो यह प्रदर्शित करता है कि जनरेटिव एआई बड़े पैमाने पर ओपन साइंस प्रभावों को माप सकता है और यह सुझाव देता है कि डेटा साझाकरण के सकारात्मक प्रभावों को वर्तमान में कम करके आंका जा रहा है।

Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines2026-05-01