💬 NLP

Beyond Semantic Relevance: Counterfactual Risk Minimization for Robust Retrieval-Augmented Generation

यह शोध पत्र CoRM-RAG प्रस्तुत करता है, जो एक ऐसा ढांचा है जो काउंटरफैक्चुअल रिस्क मिनिमाइजेशन और एक कॉग्निटिव परटर्बेशन प्रोटोकॉल का उपयोग करके एक एविडेंस क्रिटिक को प्रशिक्षित करता है, जो 'रेलेवेंस-रोबस्टनेस गैप' को संबोधित करता है और निर्णय सुरक्षा को सिमेंटिक समानता पर प्राथमिकता देता है, जिससे बायस्ड क्वेरीज़ के कारण होने वाले मतिभ्रम (hallucinations) को कम किया जा सके।

Peiyang Liu, Qiang Yan, Ziqiang Cui, Di Liang, Xi Wang, Wei Ye2026-05-05
💬 NLP

Enhancing Game Review Sentiment Classification on Steam Platform with Attention-Based BiLSTM

यह शोध पत्र प्रदर्शित करता है कि एक अटेंशन-आधारित बिडायरेक्शनल लॉन्ग शॉर्ट-टर्म मेमोरी (BiLSTM) मॉडल स्टीम गेम समीक्षाओं की भावनाओं को वर्गीकृत करने में पारंपरिक मशीन लर्निंग बेसलाइन से बेहतर प्रदर्शन करता है, जो 83% सटीकता और 85% वेटेड F1-स्कोर प्राप्त करता है और साथ ही गेम डेवलपर्स की सहायता के लिए भावना-युक्त शब्दों के व्याख्यात्मक विज़ुअलाइज़ेशन प्रदान करता है।

Abit Ahmad Oktarian, Fadhil Fitra Wijaya, Dhafin Razaqa Luthfi, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima M (…)2026-05-05
💬 NLP

Sentiment Analysis of Mobile Legends App Reviews Using Machine Learning and LSTM-Based Deep Learning Models

यह शोध पत्र प्रदर्शित करता है कि एक LSTM-आधारित डीप लर्निंग मॉडल ने मोबाइल लीजेंड्स ऐप की समीक्षाओं का विश्लेषण करने में पारंपरिक मशीन लर्निंग दृष्टिकोणों को पीछे छोड़ दिया है, जिसने अनौपचारिक उपयोगकर्ता टेक्स्ट के अनुक्रमिक और प्रासंगिक सूक्ष्मताओं को प्रभावी ढंग से कैप्चर करके 92% सटीकता प्राप्त की है।

Vira Putri Maharani, Kharisa Harvanny, Daris Samudra, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Manullang2026-05-05
💬 NLP

Benchmarking LightGBM and BiLSTM for Sentiment Analysis on Indonesian E-Commerce Reviews

यह अध्ययन एक इंडोनेशियाई ई-कॉमर्स सेंटीमेंट एनालिसिस डेटासेट पर मशीन लर्निंग और डीप लर्निंग दृष्टिकोणों का बेंचमार्किंग करता है, जिसमें यह पाया गया कि एक BiLSTM मॉडल 98.87% सटीकता के साथ LightGBM और अन्य ML एल्गोरिदम से बेहतर प्रदर्शन करता है, हालांकि LightGBM एक अत्यधिक कुशल विकल्प बना हुआ है।

Lidia Natasyah Marpaung, Vania Claresta, Iqfina Haula Halika, Luluk Muthoharoh, Ardika Satria, Martin Clinton Tosima Man (…)2026-05-05
💬 NLP

Creating and Evaluating Figurative Language Dataset for Sindhi

यह शोध पत्र SiNFluD प्रस्तुत करता है, जो विविध स्रोतों से निर्मित और मूल भाषियों द्वारा एनोटेट किया गया सिंधी आलंकारिक भाषा वर्गीकरण के लिए एक नया बेंचमार्क डेटासेट है, साथ ही विभिन्न प्री-ट्रेंड मॉडलों का एक मूल्यांकन भी प्रस्तुत करता है जहाँ XLM-RoBERTa-XL ने सर्वश्रेष्ठ प्रदर्शन किया।

Wazir Ali, Adeeb Noor, Saifullah Tumrani2026-05-05
💬 NLP

A Multi-View Media Profiling Suite: Resources, Evaluation, and Analysis

यह शोध पत्र MBFC-2025 डेटासेट और एक मल्टी-व्यू मीडिया प्रोफाइलिंग सुइट पेश करता है जो समाचार आउटलेट्स में राजनीतिक पूर्वाग्रह और तथ्यात्मकता का पता लगाने के लिए अत्याधुनिक परिणाम प्राप्त करने हेतु विविध निरूपणों (representations) और संलयन रणनीतियों (fusion strategies) का लाभ उठाता है।

Muhammad Arslan Manzoor, Dilshod Azizov, Daniil Orel, Umer Siddique, Zain Muhammad Mujahid, Yufang Hou, Preslav Nakov2026-05-05
💬 NLP

LLM Output Detectability and Task Performance Can be Jointly Optimized

यह शोध पत्र PUPPET को पेश करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो बड़े भाषा मॉडलों को वॉटरमार्क जैसे संकेतों के माध्यम से उनकी पहचान क्षमता बढ़ाने और साथ ही डाउनस्ट्रीम कार्यों पर उनके प्रदर्शन में सुधार करने के लिए फाइन-ट्यून करता है, जो पारंपरिक वॉटरमार्किंग विधियों से बेहतर प्रदर्शन करते हुए हमलों के प्रति मजबूत और प्रशिक्षित होने में कुशल है।

Koshiro Saito, Ryuto Koike, Masahiro Kaneko, Naoaki Okazaki2026-05-05
💬 NLP

On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility

यह शोध पत्र VOLTBench बेंचमार्क को पेश करके लंबी सामग्री के निर्माण (long-form generation) में महत्वपूर्ण लंबाई की अस्थिरता को संबोधित करता है, इसके आंतरिक अटेंशन-आधारित कारणों की पहचान करता है, और GLoBo का प्रस्ताव देता है, जो एक प्रशिक्षण-मुक्त डिकोडिंग रणनीति है जो जनरेशन की गुणवत्ता बनाए रखते हुए लंबाई की सटीकता और स्थिरता में काफी सुधार करती है।

Zhitao He, Haolin Yang, Rui Min, Zeyu Qin, Yi R. Fung2026-05-05
💬 NLP

Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast

यह शोध पत्र FoCore को पेश करता है, जो डिफ्यूजन लार्ज लैंग्वेज मॉडल्स के लिए एक प्रशिक्षण-मुक्त डिकोडिंग रणनीति है, जो उच्च-सूचना-घनत्व वाले टोकन के शीघ्र अभिसरण (early convergence) का स्व-तुलना (self-contrast) के माध्यम से लाभ उठाती है ताकि जनरेशन की गुणवत्ता में सुधार और इन्फरेंस गति में तेजी लाने को एक साथ प्राप्त किया जा सके।

Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu2026-05-05
💬 NLP

MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation

यह शोध पत्र मल्टी-ग्रैनुलर ट्रैजेक्टरी अलाइनमेंट (MTA) का प्रस्ताव करता है, जो एक नॉलेज डिस्टिलेशन फ्रेमवर्क है जो कंपोजिशनल सिमेंटिक्स के विकास को बेहतर ढंग से पकड़ने और लार्ज लैंग्वेज मॉडल कंप्रेशन में सुधार करने के लिए एडेप्टिव वर्ड-लेवल और फ्रेज-लेवल मैचिंग का उपयोग करके लेयर-वाइज ट्रांसफॉर्मेशन ट्रैजेक्टरीज के माध्यम से टीचर और स्टूडेंट रिप्रेजेंटेशन्स को अलाइन करता है।

Pham Khanh Chi, Quoc Phong Dao, Thuat Nguyen, Linh Ngo Van, Trung Le, Thanh Hong Nguyen2026-05-05