💬 NLP

Bridging Linguistic Gaps: Cross-Lingual Mapping in Pre-Training and Dataset for Enhanced Multilingual LLM Performance

यह शोध पत्र बड़े भाषा मॉडलों (Large Language Models) के प्री-ट्रेनिंग चरण में एक क्रॉस-लिंगुअल मैपिंग टास्क और एक लैंग्वेज अलाइनमेंट कोएफिशिएंट (Language Alignment Coefficient) को पेश करता है ताकि डेटा असंतुलन और मोनोलिंगुअल पूर्वाग्रह को प्रभावी ढंग से संबोधित किया जा सके, जिसके परिणामस्वरूप मोनोलिंगुअल प्रवाह से समझौता किए बिना मशीन अनुवाद, प्राकृतिक भाषा समझ और प्रश्न उत्तर कार्यों में महत्वपूर्ण प्रदर्शन सुधार प्राप्त होते हैं।

Weihua Zheng, Chang Liu, Zhengyuan Liu, Xin Huang, Kui Wu, Muhammad Huzaifah Md Shahrin, Aiti Aw, Roy Ka-Wei Lee2026-04-14
💬 NLP

BMdataset: A Musicologically Curated LilyPond Dataset

यह शोध पत्र BMdataset प्रस्तुत करता है, जो बारोक पांडुलिपियों से विशेषज्ञों द्वारा प्रतिलेखित लिलीपॉन्ड (LilyPond) स्कोर का एक संगीतशास्त्रीय रूप से क्यूरेट किया गया संग्रह है, और यह प्रदर्शित करता है कि अनुकूलित लिलीबर्ट (LilyBERT) मॉडल को इस उच्च-गुणवत्ता वाले, छोटे डेटासेट पर फाइन-ट्यून करना, प्रतीकात्मक संगीत समझ कार्यों के लिए विशाल शोरयुक्त कॉर्पोरा (massive noisy corpora) पर प्रशिक्षण देने की तुलना में बेहतर प्रदर्शन करता है।

Matteo Spanio, Ilay Guler, Antonio Rodà2026-04-14
🤖 machine learning

SpectralLoRA: Is Low-Frequency Structure Sufficient for LoRA Adaptation? A Spectral Analysis of Weight Updates

यह शोध पत्र स्पेक्ट्रल विश्लेषण के माध्यम से यह प्रदर्शित करता है कि LoRA वेट अपडेट्स निम्न-आवृत्ति (low-frequency) घटकों द्वारा संचालित होते हैं, जो यह प्रकट करता है कि केवल इन आवृत्तियों के एक छोटे अंश को बनाए रखने से प्रदर्शन में न्यूनतम हानि के साथ भंडारण में महत्वपूर्ण कमी आती है और यह सुझाव देता है कि उच्च-आवृत्ति घटक अक्सर अनुकूलन शोर (adaptation noise) के रूप में कार्य करते हैं।

Rajveer Singh2026-04-14
💬 NLP

HeceTokenizer: A Syllable-Based Tokenization Approach for Turkish Retrieval

यह शोध पत्र HeceTokenizer को प्रस्तुत करता है, जो तुर्की भाषा के लिए एक संसाधन-कुशल, शब्दांश-आधारित टोकनाइजेशन दृष्टिकोण है, जो बेहतर प्रतिधारण प्रदर्शन (TQuAD बेंचमार्क पर 50.3% Recall@5) प्राप्त करने के लिए भाषा की ध्वन्यात्मक नियमितता का लाभ उठाता है और मॉर्फोलॉजी-संचालित बेसलाइनों की तुलना में काफी छोटे मॉडल का उपयोग करता है।

Senol Gulgonul2026-04-14
💬 NLP

QFS-Composer: Query-focused summarization pipeline for less resourced languages

यह शोध पत्र QFS-Composer प्रस्तुत करता है, जो एक नवीन ढांचा है जो कम संसाधनों वाली भाषाओं में क्वेरी-केंद्रित सारांशों की तथ्यात्मक संरेखण और प्रासंगिकता को बढ़ाने के लिए क्वेरी अपघटन, प्रश्न निर्माण और प्रश्न उत्तर को एकीकृत करता है, जिसे स्लोवेनियाई पाठ पर बेहतर प्रदर्शन के माध्यम से प्रदर्शित किया गया है।

Vuk {\DJ}uranović, Marko Robnik Šikonja2026-04-14
💬 NLP

Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game

यह शोधपत्र CanaryRAG को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले रनटाइम रक्षा तंत्र है जो रिट्रीव किए गए चंक्स (chunks) में कैनरी टोकन को एम्बेड करता है और बिना मॉडल रिट्रेनिंग की आवश्यकता के या प्रदर्शन को प्रभावित किए बिना, रीयल टाइम में RAG एक्सट्रैक्शन हमलों का पता लगाने और उन्हें कम करने के लिए एक ड्यूल-पाथ इंटीग्रिटी गेम का उपयोग करता है।

Yuanbo Xie, Yingjie Zhang, Yulin Li, Shouyou Song, Xiaokun Chen, Zhihan Liu, Liya Su, Tingwen Liu2026-04-14
🤖 AI

Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation

यह शोध पत्र टेम्पोरल प्रोसेस लॉग्स को संवादात्मक संवादों में बदलकर और एक सुपरवाइज्ड फाइन-ट्यूनिंग प्लस प्रेफरेंस ऑप्टिमाइजेशन पाइपलाइन लागू करके, ओपन-वेट लैंग्वेज मॉडल्स को छात्र प्रोग्रामिंग व्यवहार का अनुकरण करने के लिए प्रशिक्षित करने की एक विधि प्रस्तावित करता है, जो कोड-ओनली दृष्टिकोणों और प्रॉम्प्टेड बेसलाइन्स की तुलना में मॉडल्स की प्रामाणिक डिबगिंग पैटर्न को दोहराने की क्षमता में महत्वपूर्ण सुधार करता है।

Charles Koutcheme, Arto Hellas, Juho Leinonen2026-04-14
💬 NLP

Expect the Unexpected? Testing the Surprisal of Salient Entities

यह शोध पत्र यह प्रदर्शित करके 'यूनिफॉर्म इन्फॉर्मेशन डेंसिटी' (Uniform Information Density) परिकल्पना को चुनौती देता है कि विमर्श (discourse) में वैश्विक रूप से प्रमुख संस्थाएं (globally salient entities) गैर-प्रमुख संस्थाओं की तुलना में काफी अधिक सर्प्राइज़ल (surprisal) प्रदर्शित करती हैं, जबकि साथ ही वे आसपास की सामग्री के सर्प्राइज़ल को कम भी करती हैं, जिससे यह स्पष्ट होता है कि वैश्विक संस्थागत प्रमुखता (global entity salience) विभिन्न शैलियों में सूचना वितरण को आकार देने वाला एक प्रमुख तंत्र है।

Jessica Lin, Amir Zeldes2026-04-14
💬 NLP

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models

यह शोध पत्र व्यवस्थित रूप से प्रदर्शित करता है कि रोल-प्लेइंग भाषा मॉडलों में, उच्च व्यक्तित्व अनुकूलता (persona agreeableness) महत्वपूर्ण रूप से बढ़े हुए चाटुकारिता व्यवहार (sycophantic behavior) की भविष्यवाणी करती है, जो व्यक्तित्व लक्षणों और तथ्यात्मक सटीकता के बजाय उपयोगकर्ता के सत्यापन को प्राथमिकता देने की प्रवृत्ति के बीच एक महत्वपूर्ण संबंध को उजागर करती है।

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai2026-04-14
💬 NLP

Self-Correcting RAG: Enhancing Faithfulness via MMKP Context Selection and NLI-Guided MCTS

यह शोध पत्र सेल्फ-करेक्टिंग RAG का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो संदर्भ चयन को एक बहु-आयामी मल्टीपल-चॉइस नैपसैक समस्या के रूप में पुनर्गठित करके और जनरेट किए गए उत्तरों को गतिशील रूप से मान्य करने के लिए NLI-निर्देशित मोंटे कार्लो ट्री सर्च का उपयोग करके जटिल तर्क कार्यों में निष्ठा (faithfulness) को बढ़ाता है, जिससे सटीकता में उल्लेखनीय सुधार होता है और मतिभ्रम (hallucinations) कम होता है।

Shijia Xu, Zhou Wu, Xiaolong Jia, Yu Wang, Kai Liu, April Xiaowen Dong2026-04-14