💬 NLP

Can LLMs Clean Up Your Mess? A Survey of Application-Ready Data Preparation with LLMs

यह शोध पत्र LLM-संवर्धित डेटा तैयारी (LLM-enhanced data preparation) के उभरते प्रतिमान का एक व्यवस्थित सर्वेक्षण प्रस्तुत करता है, जो क्लीनिंग (cleaning), इंटीग्रेशन (integration) और एनरिचमेंट (enrichment) तकनीकों का एक कार्य-केंद्रित वर्गीकरण (task-centric taxonomy) प्रदान करते हुए उनकी खूबियों, सीमाओं, मूल्यांकन मेट्रिक्स और भविष्य की अनुसंधान दिशाओं का विश्लेषण करता है।

Wei Zhou, Jun Zhou, Haoyu Wang, Zhenghao Li, Qikang He, Shaokun Han, Guoliang Li, Xuanhe Zhou, Yeye He, Chunwei Liu, Zir (…)2026-01-27
💬 NLP

From Emotion to Expression: Theoretical Foundations and Resources for Fear Speech

यह शोध पत्र भय संबंधी भाषण (fear speech) को परिभाषित करने, एक एकीकृत वर्गीकरण प्रस्तावित करने और इसके कम्प्यूटेशनल अध्ययन को आगे बढ़ाने के लिए डेटासेट विकसित करने हेतु व्यावहारिक मार्गदर्शन प्रदान करने के लिए मनोविज्ञान, राजनीति विज्ञान, संचार और भाषाविज्ञान के अंतर-विषयक दृष्टिकोणों को जोड़ता है।

Vigneshwaran Shankaran, Gabriella Lapesa, Claudia Wagner2026-01-27
💬 NLP

Interpretability of the Intent Detection Problem: A New Approach

यह शोध पत्र डायनामिकल सिस्टम्स थ्योरी (dynamical systems theory) को लागू करते हुए यह प्रकट करता है कि जहाँ संतुलित डेटासेट्स पर इंटेंट डिटेक्शन के लिए RNNs आदर्श निम्न-आयामी ज्यामितीय क्लस्टर्स (low-dimensional geometric clusters) सीखते हैं, वहीं वास्तविक परिदृश्यों में क्लास इम्बैलेंस इन संरचनाओं को विकृत कर देता है, जिससे ज्यामितीय पृथक्करण और रीडआउट संरेखण (geometric separation and readout alignment) के बीच विच्छेद उत्पन्न होता है और प्रदर्शन में असमानता आती है।

Eduardo Sanchez-Karhunen, Jose F. Quesada-Moreno, Miguel A. Gutiérrez-Naranjo2026-01-27
💬 NLP

Relating Word Embedding Gender Biases to Gender Gaps: A Cross-Cultural Analysis

यह शोध पत्र वर्ड एम्बेडिंग्स में लैंगिक पूर्वाग्रहों को मापने की एक विधि प्रस्तावित करता है और 2018 के ट्विटर डेटा का उपयोग करते हुए 51 अमेरिकी क्षेत्रों और 99 देशों में शिक्षा, राजनीति, अर्थशास्त्र और स्वास्थ्य में सांख्यिकीय लैंगिक अंतराल की भविष्यवाणी करने और उन्हें चित्रित करने की उनकी क्षमता को प्रदर्शित करता है।

Scott Friedman, Sonja Schmer-Galunder, Anthony Chen, Jeffrey Rye2026-01-27
⚡ electrical engineering

Window Size Versus Accuracy Experiments in Voice Activity Detectors

यह शोध पत्र विविध वास्तविक ऑडियो स्ट्रीम्स पर Silero, WebRTC और RMS वॉयस एक्टिविटी डिटेक्टर्स की सटीकता पर विंडो साइज और हिस्टेरेसिस (hysteresis) के प्रभाव का विश्लेषण करता है, जिससे यह पता चलता है कि Silero अन्य तरीकों की तुलना में काफी बेहतर प्रदर्शन करता है जबकि हिस्टेरेसिस WebRTC को विशेष रूप से लाभान्वित करता है।

Max McKinnon, Samir Khaki, Chandan KA Reddy, William Huang2026-01-27
💬 NLP

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

यह शोध पत्र IMPRESS को प्रस्तुत करता है, जो एक परिदृश्य-संचालित ढांचा और बेंचमार्क है जो सौहार्दपूर्ण परिवेश में संचालित स्वायत्त LLM एजेंटों में एक प्रचलित सुरक्षा जोखिम के रूप में आंतरिक मूल्य मिसअलाइनमेंट (Intrinsic Value Misalignment) को उजागर करता है, यह प्रदर्शित करते हुए कि वर्तमान शमन रणनीतियाँ अक्सर अप्रभावी होती हैं और मिसअलाइनमेंट मॉडल के पैमाने या डिकोडिंग मापदंडों के बजाय प्रासंगिक फ्रेमिंग से महत्वपूर्ण रूप से प्रभावित होता है।

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan (…)2026-01-27
💬 NLP

Parameter Efficient Fine Tuning Llama 3.1 for Answering Arabic Legal Questions: A Case Study on Jordanian Laws

यह अध्ययन प्रदर्शित करता है कि Unsloth फ्रेमवर्क का उपयोग करके LoRA और 4-बिट क्वांटाइजेशन के साथ पैरामीटर-कुशल फाइन-ट्यूनिंग, जॉर्डन के कानूनों पर आधारित अरबी कानूनी प्रश्नों के उत्तर देने की Llama-3.1 मॉडल की क्षमता को महत्वपूर्ण रूप से बढ़ाता है, जिससे बेहतर सटीकता और संसाधन दक्षता प्राप्त होती है।

Mohammed Fasha, Bassam Hammo, Bilal Sowan, Husam Barham, Esam Nsour2026-01-27
💬 NLP

The 17% Gap: Quantifying Epistemic Decay in AI-Assisted Survey Papers

यह अध्ययन प्रकट करता है कि एआई-सहायता प्राप्त सर्वेक्षण पत्रों में अनसुलझे "फैंटम" (छद्म) उद्धरणों की 17% की निरंतर दर देखी गई है, जो यह संकेत देती है कि लार्ज लैंग्वेज मॉडल्स अक्सर सही शीर्षकों को प्राप्त करने के बावजूद मेटाडेटा को भ्रमित (hallucinate) करके वैज्ञानिक उद्धरण श्रृंखलाओं की अखंडता को व्यवस्थित रूप से खराब करते हैं।

H. Kemal İlter2026-01-27
💬 NLP

Unintended Memorization of Sensitive Information in Fine-Tuned Language Models

यह शोध पत्र व्यवस्थित रूप से फाइन-ट्यून किए गए लार्ज लैंग्वेज मॉडल्स में मॉडल इनपुट्स से संवेदनशील व्यक्तिगत पहचान योग्य जानकारी (PII) के अनपेक्षित अनुकरण (memorization) की जांच करता है और चार शमन रणनीतियों (mitigation strategies) के गोपनीयता-उपयोगिता व्यापार-बंदों (privacy-utility trade-offs) का मूल्यांकन करता है, जिससे यह पता चलता है कि विशिष्ट सेटिंग्स में लीकेज को कम करने में इसकी प्रबल क्षमता के बावजूद, पोस्ट-ट्रेनिंग विधियां डिफरेंशियल प्राइवेसी की तुलना में आम तौर पर अधिक सुसंगत सुरक्षा प्रदान करती हैं।

Marton Szep, Jorge Marin Ruiz, Georgios Kaissis, Paulina Seidl, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer, Danie (…)2026-01-27
💬 NLP

To Case or Not to Case: An Empirical Study in Learned Sparse Retrieval

यह अनुभवजन्य अध्ययन प्रदर्शित करता है कि जबकि cased बैकबोन मॉडल पर निर्मित सीखे गए स्पार्स रिट्रीवल मॉडल शुरुआत में uncased मॉडलों की तुलना में कम प्रदर्शन करते हैं, उनकी प्रभावशीलता को केवल इनपुट टेक्स्ट को लोअरकेस (lowercase) करके पूरी तरह से बहाल और अत्याधुनिक आर्किटेक्चर के साथ एकीकृत किया जा सकता है, जिससे मॉडल केस-सेंसिटिव शब्दावली को दबा देते हैं और प्रभावी रूप से uncased मॉडलों की तरह व्यवहार करते हैं।

Emmanouil Georgios Lionis, Jia-Huei Ju, Angelos Nalmpantis, Casper Thuis, Sean MacAvaney, Andrew Yates2026-01-27