💬 NLP

Closing the Quality Gap in Low-Resource Text-to-Speech: LoRA Fine-Tuning of VoxCPM2 for Khmer and Korean

यह शोध पत्र प्रदर्शित करता है कि VoxCPM2 मॉडल पर एक एकल लो-रैंक एडेप्टेशन (LoRA) एडेप्टर लागू करने से कोरियाई के लिए प्रदर्शन बनाए रखते हुए कम-संसाधन वाली खमेर भाषा के लिए टेक्स्ट-टू-स्पीच की गुणवत्ता में काफी सुधार होता है, जो इस बात को रेखांकित करता है कि ऐसा अनुकूलन उन भाषाओं के लिए सबसे प्रभावी है जहाँ आधार मॉडल शुरू में खराब प्रदर्शन करता है।

Phannet Pov, Sovandara Chhoun, Hyun Woo Park, Wan-Sup Cho, Saksonita Khoeurn2026-06-26
🤖 machine learning

From Weights to Features: SAE-Guided Activation Regularization for LLM Continual Learning

यह शोधपत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए एक मेमोरी-कुशल निरंतर शिक्षण (कंटीन्यूअस लर्निंग) पद्धति प्रस्तावित करता है जो प्रीट्रेंड स्पार्स ऑटोएनकोडर (स्पार्स ऑटोएनकोर्स) का उपयोग करके एक मोनोसेमेंटिक फीचर स्पेस में एक्टिवेशन्स को रेगुलराइज करके कैटास्ट्रोफिक फॉरगेटिंग (विनाशकारी विस्मृति) को कम करता है, जिससे EWC जैसे मोटे वेट-स्पेस दृष्टिकोणों की सीमाओं को दूर किया जा सके और बिना किसी टास्क-स्पेसिफिक आर्किटेक्चर या रिप्ले डेटा के बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Evan Ning, Wei Xue, Dong Lou, Yike Guo2026-06-26
💬 NLP

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

यह शोधपत्र SocialPersona को प्रस्तुत करता है, जो 171 उपयोगकर्ताओं के दीर्घकालिक सोशल-मीडिया टाइमलाइन्स से प्राप्त एक मल्टीमॉडल बेंचमार्क है, जिसका उद्देश्य प्रकट प्राथमिकताओं (revealed preferences) का अनुमान लगाने और व्यक्तिगत प्रतिक्रियाएं उत्पन्न करने की लार्ज लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करना है, जिससे यह पता चलता है कि हालांकि मॉडल व्यापक रुचियों की पहचान कर सकते हैं, लेकिन वे सूक्ष्म विवरणों, हालिया अपडेट और इन अंतर्दृष्टि को संवाद में लागू करने में संघर्ष करते हैं।

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin2026-06-26
💬 NLP

Beyond Logical Forms: LLM-Extracted Patterns for Fallacy Classification

यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो अमूर्त तार्किक संरचनाओं और भाषाई संकेतों को संयोजित करने वाले डेटा-संचालित पैटर्न को आगमनात्मक रूप से निकालने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो ज़ीरो-शॉट बेसलाइन और मौजूदा विधियों की तुलना में दोषपूर्ण तर्क (fallacy) वर्गीकरण की सटीकता और सामान्यीकरण में महत्वपूर्ण सुधार करता है।

Eleni Papadopulos, Firoj Alam, Giovanni Da San Martino2026-06-26
🤖 machine learning

HyperDFlash: MHC-Aligned Block Speculative Decoding with Gated Residual Reduction

यह शोध पत्र HyperDFlash प्रस्तुत करता है, जो DeepSeek-V4 के MHC आर्किटेक्चर के लिए एक ब्लॉक-समानांतर स्पेक्युलेटिव डिकोडिंग फ्रेमवर्क है, जो प्री-कोलैप्स रेसिडुअल स्टेट्स के साथ ड्राफ्टर को संरेखित करके, एक लाइटवेट गेटेड रेसिडुअल रिड्यूसर का उपयोग करके और लक्षित KL डिस्टिलेशन लागू करके नेटिव ड्राफ्ट सटीकता में गिरावट को दूर करता है, जिससे बेहतर स्पीडअप और स्वीकृति दर प्राप्त होती है।

Luxi Lin, Shuang Peng, Rui Ma, Junhao Hua, Shuwei Fan, Zhengda Qin, Qiang Wang, Hongjian Sun, Fangmin Chen, Songwei Liu2026-06-26
🤖 machine learning

AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing

यह शोध पत्र AIGP का प्रस्ताव करता है, जो एक LLM-आधारित फ्रेमवर्क है जो व्याख्यात्मक, दीर्घकालिक मूल्य-संरेखित गतिशील मूल्य निर्धारण प्राप्त करने के लिए ऑफलाइन रीइन्फोर्समेंट लर्निंग और डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन के माध्यम से प्रशिक्षित लॉन्ग-टर्म वैल्यू एस्टिमेटर के साथ सुपरवाइज्ड फाइन-ट्यूनिंग को एकीकृत करता है, जो बड़े पैमाने के ई-कॉमर्स A/B परीक्षणों में GMV, ROI और माइलस्टोन उपलब्धि दरों में महत्वपूर्ण सुधार प्रदर्शित करता है।

Chennan Ma, Yanning Zhang, Siqi Hong, Xiuchong Wang, Fei Xiao, Keping Yang2026-06-26
💬 NLP

From Vajrayana Tara to Bengali Baul: A Computational Study of Lexical Transmission Across Buddhist, Shakta, and Vaishnava Traditions in Bengal

यह संगणनात्मक कॉर्पस अध्ययन आठ शताब्दियों के बंगाली और संस्कृत भक्ति साहित्य में शाब्दिक संचरण को परिमाणित करता है, जो पहला बहु-परंपरा साक्ष्य प्रदान करता है कि विशिष्ट बौद्ध वज्रयान शब्दावली पाल मठों के पतन के बाद भी जीवित रही और शाक्त तंत्र परंपरा में समाहित हो गई, एक ऐसा निष्कर्ष जिसे वैष्णव और शाक्त परंपराओं के बीच शून्य के निकट समानता की तुलना में बौद्ध-शाक्त संक्रमणकालीन ग्रंथों और शाक्त काली कृतियों के बीच काफी उच्च कोसाइन समानता द्वारा समर्थित किया गया है।

Joy Bose2026-06-26
💬 NLP

FBK's Long-form SpeechLLMs for IWSLT 2026 Instruction Following

यह शोध पत्र IWSLT 2026 इंस्ट्रक्शन फॉलोइंग साझा कार्य (shared task) के लिए FBK के SpeechLLMs को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि 2.0663 के HIFS स्कोर के साथ निश्चित 30-सेकंड का विभाजन दोहराव वाले मतिभ्रम (repetitive hallucinations) की चुनौतियों के बावजूद मजबूत लघु-रूप क्षमताओं को बनाए रखते हुए सबसे सुदृढ़ दीर्घ-रूप प्रदर्शन प्राप्त करता है।

Zhihang Xie, Marco Gaido, Sara Papi, Matteo Negri, Luisa Bentivogli2026-06-26
💬 NLP

Heterogeneous Neural Predictivity from Language Models During Naturalistic Comprehension

यह अध्ययन प्रदर्शित करता है कि फ्रोजन लैंग्वेज मॉडल रिप्रेजेंटेशन्स (frozen language model representations), स्वाभाविक भाषण और पाठ बोध के दौरान मस्तिष्क की गतिविधि के लिए प्रभावी, विषम न्यूरल प्रेडिक्टर्स (heterogeneous neural predictors) के रूप में कार्य करते हैं, जबकि इस बात पर जोर देता है कि उनकी भविष्य कहने वाली उपयोगिता आवश्यक रूप से साझा तंत्रिका संगठन या कम्प्यूटेशनल तंत्र का संकेत नहीं देती है।

Xiao Jia2026-06-26
💬 NLP

Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

यह शोध पत्र प्रदर्शित करता है कि गैर-विशेषज्ञ दुर्भावनापूर्ण कर्ता (malicious actors), अनुकूलतम जेलब्रेक को स्वचालित रूप से चुनने के लिए एक मल्टी-आर्म्ड बैंडिट एल्गोरिदम को उन्नत दुर्भावनापूर्ण प्रश्नों के एक क्यूरेटेड बेंचमार्क के साथ जोड़कर, 15 अत्याधुनिक मॉडलों में 97% तक की सफलता दर प्राप्त करते हुए प्रभावी रूप से एलएलएम (LLM) सुरक्षा उपायों को बायपास कर सकते हैं।

Prarabdh Shukla, Ritik, Suhas Rao, Arpit Agarwal, Arjun Bhagoji2026-06-26