💬 NLP

WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

यह शोध पत्र WARDEN को प्रस्तुत करता है, जो एक दो-चरणीय प्रणाली है जो सुंडानी (Sundanese) से फोनीम-ट्रांसफर इनिशियलाइजेशनलाइज़ेशन का उपयोग करके और एक लार्ज लैंग्वेज मॉडल के साथ एक डोमेन-विशिष्ट शब्दकोश का लाभ उठाकर केवल 6 घंटे के प्रशिक्षण डेटा का उपयोग करके लुप्तप्राय वार्डमन (Wardaman) भाषा को अंग्रेजी में सफलतापूर्वक ट्रांसक्राइब और अनुवाद करती है, जिससे यह अत्यंत कम-संसाधन वाले परिवेश में बड़े एकीकृत मॉडलों से बेहतर प्रदर्शन करती है।

Ziheng Zhang, Yunzhong Hou, Naijing Liu, Liang Zheng2026-05-14
💬 NLP

Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction

यह शोध पत्र एक नवीन मल्टीमॉडल रिव्यू हेल्पफुलनेस प्रेडिक्शन फ्रेमवर्क प्रस्तावित करता है जो पारंपरिक FCNNs और पेयरवाइज लॉस की सीमाओं को दूर करने के लिए एक लिस्टवाइज अटेंशन नेटवर्क, एक लिस्टवाइज ऑप्टिमाइज़ेशन ऑब्जेक्टिव और एक ग्रेडिएंट-बूस्टेड डिसीजन ट्री स्कोर प्रेडिक्टर को संयोजित करता है, जिससे बड़े पैमाने के बेंचमार्क पर अत्याधुनिक प्रदर्शन और बेहतर सामान्यीकरण प्राप्त होता है।

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Anh Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing2026-05-13
💬 NLP

DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding

यह शोध पत्र DemaFormer को प्रस्तुत करता है, जो एक नवीन ट्रांसफॉर्मर-आधारित आर्किटेक्चर है जो मोमेंट-क्वेरी वितरणों को प्रभावी ढंग से सीखने और टेम्पोरल लैंग्वेज ग्राउंडिंग कार्यों में अत्याधुनिक विधियों से बेहतर प्रदर्शन करने के लिए एक ऊर्जा-आधारित मॉडलिंग ढांचे को डैम्प्ड एक्सपोनेंशियल मूविंग एवरेज तंत्र के साथ जोड़ता है।

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan2026-05-13
💬 NLP

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

यह शोध पत्र READ प्रस्तुत करता है, जो एक पैरामीटर-कुशल ट्रांसफर लर्निंग फ्रेमवर्क है जो टेम्पोरल मॉडलिंग के लिए एक नवीन रिकरेंट एडेप्टर को आंशिक वीडियो-लैंग्वेज अलाइनमेंट ऑब्जेक्टिव के साथ जोड़ता है ताकि लो-रिसोर्स वीडियो-लैंग्वेज कार्यों पर मौजूदा फाइन-ट्यूनिंग रणनीतियों से काफी बेहतर प्रदर्शन किया जा सके।

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan2026-05-13
💬 NLP

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

यह शोध पत्र ICER को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स फ्रेमवर्क है जो टेक्स्ट-टू-इमेज मॉडल्स की रेड-टीमिंग के लिए कुशल, प्रवाहपूर्ण और अर्थ-संरक्षण करने वाले एडवरसेरियल प्रॉम्प्ट्स उत्पन्न करने के लिए एक LLM-आधारित रीराइटर और इन-कॉन्टेक्स्ट एक्सपीरियंस रिप्ले का लाभ उठाता है, जो मौजूदा बेसलाइन्स की तुलना में विभिन्न सुरक्षा तंत्रों के बीच बेहतर प्रदर्शन और ट्रांसफ़रेबिलिटी प्रदर्शित करता है।

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz2026-05-13
💬 NLP

Modeling Narrative Structure in Latin Epic Poetry with Automatically Generated Story Grammars

यह शोध पत्र लैटिन महाकाव्य कविता के लिए 'स्टोरी ग्रामर' लेबल स्वचालित रूप से उत्पन्न करने हेतु 'फ्यू-शॉट लर्निंग' का उपयोग करते हुए एक व्याख्यात्मक, एलएलएम-आधारित पद्धति प्रस्तुत करता है, जिससे कथा संरचना की समझ और शैली विश्लेषण को बढ़ाने के लिए कम्प्यूटेशनल विश्लेषण और मानविकी विद्वत्ता के बीच के अंतर को पाटा जा सके।

Abigail Swenor, John James, Neil Coffee, Walter Scheirer2026-05-13
💬 NLP

Toxicity Detection Should Measure Contextual Harm, Not Text-Intrinsic Badness

यह स्थिति पत्र (position paper) तर्क देता है कि विषाक्तता का पता लगाने की प्रक्रिया को विषाक्तता को अलग-थलग पाठ के एक अंतर्निहित गुण के रूप में मानने के बजाय इसे एक प्रासंगिक संचार संबंधी हानि (contextual communicative harm) के रूप में मापने की ओर स्थानांतरित होना चाहिए, जो यह बेहतर ढंग से पकड़ सके कि कैसे कथित मानदंड उल्लंघन और सामाजिक संदर्भ वास्तविक व्यवधान उत्पन्न करते हैं, जिसके लिए 'कॉन्टेक्स्टुअल स्ट्रेस फ्रेमवर्क' (CSF) और 'CSF-Eval' पेश किए गए हैं।

Sergei Berezin, Reza Farahbakhsh, Noel Crespi2026-05-13✓ Author reviewed
💬 NLP

Synthetic Function Demonstrations Improve Generation in Low-Resource Programming Languages

यह शोध पत्र कम-संसाधन वाली प्रोग्रामिंग भाषाओं पर LLMs को फाइन-ट्यून करने के लिए भाषा दस्तावेज़ीकरण से सिंथेटिक, पाठ्यपुस्तक-गुणवत्ता वाले प्रशिक्षण डेटा को उत्पन्न करने की एक नवीन विधि प्रस्तावित करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण मानक रिट्रीवल-ऑगमेंटेड जनरेशन की तुलना में एक्सेल फ़ॉर्मूला कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है।

Nick McKenna, Xinnuo Xu, Jack Williams, Nick Wilson, Benjamin Van Durme, Christian Poelitz2026-05-13
💬 NLP

Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis

यह शोध पत्र मेडिकल केस रिपोर्ट्स से क्लिनिकल निष्कर्षों को निकालने और उन्हें समयबद्ध करने के लिए लार्ज लैंग्वेज मॉडल्स का उपयोग करने वाले एक पाइपलाइन को प्रस्तुत करता है, जिसके परिणामस्वरूप सेप्सिस-3 (Sepsis-3) के लिए एक ओपन-एक्सेस टेक्स्टुअल टाइम सीरीज़ कॉर्पस प्राप्त होता है जो चिकित्सक के एनोटेशन की तुलना में इवेंट रिकवरी और टेम्पोरल ऑर्डरिंग में उच्च सटीकता प्रदर्शित करता है।

Shahriar Noroozizadeh, Jeremy C. Weiss2026-05-13
💬 NLP

Learning Adapter Rank via Symmetry Breaking

यह शोध पत्र लो-रैंक वेरिएशनल ड्रॉपआउट (LRVD) प्रस्तुत करता है, जो एक ऐसा बेयसियन ढांचा है जो वेरिएशनल इन्फरेंस के माध्यम से LoRA की रोटेशनल सिमिट्री को तोड़ता है ताकि न्यूनतम पैरामीटर ओवरहेड के साथ प्रभावी एडैप्टर रैंक और प्रेडिक्टिव अनसर्टेन्टी को स्वचालित रूप से निर्धारित किया जा सके।

Cooper Doyle, Andy Hu, Rebecca Chan, Anna Leontjeva2026-05-13