⚡ electrical engineering

X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning

X-Voice एक हल्का 0.4B बहुभाषी ज़ीरो-शॉट वॉयस क्लोनिंग मॉडल है जिसे एक नवीन दो-चरणीय प्रतिमान और वास्तुशिल्प संवर्द्धनों का उपयोग करके 420K-घंटे के कॉर्पस पर प्रशिक्षित किया गया है ताकि ऑडियो प्रॉम्प्ट के लिए ट्रांसक्रिप्ट की आवश्यकता के बिना 30 भाषाओं में उच्च-गुणवत्ता वाले स्पीच सिंथेसिस को सक्षम बनाया जा सके, जो बिलियन-स्केल मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है।

Rixi Xu, Qingyu Liu, Haitao Li, Yushen Chen, Zhikang Niu, Yunting Yang, Jian Zhao, Ke Li, Berrak Sisman, Qinyuan Cheng (…)2026-05-08
🤖 machine learning

Leveraging Image Generators to Address Training Data Scarcity: The Gen4Regen Dataset for Forest Regeneration Mapping

यह शोध पत्र Gen4Regen डेटासेट और नैनो बनाना प्रो (Nano Banana Pro) विजन-लैंग्वेज मॉडल का लाभ उठाने वाले एक ढांचे को प्रस्तुत करता है जो सिंथेटिक, पिक्सेल-अलाइन्ड इमेज-मास्क जोड़े उत्पन्न करता है, यह प्रदर्शित करते हुए कि इन एआई-जनरेटेड नमूनों को सीमित वास्तविक दुनिया के डेटा के साथ संयोजित करने से दुर्लभ और कम प्रतिनिधित्व वाली वन पुनरुद्धार प्रजातियों के लिए सिमेंटिक सेगमेंटेशन प्रदर्शन में महत्वपूर्ण सुधार होता है।

Gabriel Jeanson, David-Alexandre Duclos, William Larrivée-Hardy, Noé Cochet, Matěj Boxan, Anthony Deschênes, François Po (…)2026-05-08
🤖 AI

Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation

यह शोध पत्र रिट्रीवल-गाइडेड एडेप्टिव ऑर्केस्ट्रेशन (RGAO) को प्रस्तुत करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो एक पदानुक्रमित कोड इंडेक्स से निकाले गए संरचनात्मक जटिलता के आधार पर डायनामिक रूप से कोड जनरेशन टोपोलॉजी का चयन करता है, जिससे जटिलता-सशर्त रूटिंग और औपचारिक संसाधन बीजगणित के नवीन एकीकरण के माध्यम से प्रमाणित बजट संरक्षण प्राप्त होता है।

Abhijit Talluri, Pujith Anne, Bhagavan Choudary Pendiyala, Raghavendra Chilukuri2026-05-08
💬 NLP

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

यह शोध पत्र XL-SafetyBench प्रस्तुत करता है, जो 10 भाषा युग्मों में 5,500 देश-आधारित परीक्षण मामलों वाला एक क्रॉस-कल्चरल बेंचमार्क है, जो फ्रंटियर मॉडल्स में जेलब्रेक मजबूती और सांस्कृतिक संवेदनशीलता के बीच एक विच्छेद को प्रकट करता है, साथ ही यह भी उजागर करता है कि स्थानीय मॉडल्स की स्पष्ट सुरक्षा अक्सर वास्तविक संरेखण के बजाय जनरेशन विफलताओं से उत्पन्न होती है।

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichl (…)2026-05-08
🤖 AI

Large Vision-Language Models Get Lost in Attention

यह शोध पत्र एक एकीकृत सूचना-सैद्धांतिक और ज्यामितीय ढांचे का प्रस्ताव करता है जो यह प्रकट करता है कि लार्ज विजन-लैंग्वेज मॉडल्स में अटेंशन मैकेनिज्म कार्यात्मक रूप से अनावश्यक और अक्सर गलत तरीके से आवंटित होते हैं, क्योंकि सीखे गए अटेंशन वेट्स को पूर्व-निर्धारित मानों से बदलने से तुलनीय या बेहतर प्रदर्शन प्राप्त किया जा सकता है।

Gongli Xi, Ye Tian, Mengyu Yang, Huahui Yi, Liang Lin, Xiaoshuai Hao, Kun Wang, Wendong Wang2026-05-08
🤖 machine learning

Temporal Functional Circuits: From Spline Plots to Faithful Explanations in KAN Forecasting

यह योगदान टेम्पोरल फंक्शनल सर्किट्स (Temporal Functional Circuits) को प्रस्तुत करता है, जो गेटेड रेसिडुअल कोल्मोगोरोव-अर्नोव नेटवर्क (KANs) पर आधारित एक ढांचा है जो स्पष्ट एज फंक्शन्स (edge functions) को टाइम सीरीज़ फोरकास्टिंग के लिए विश्वसनीय, समय-आधारित स्पष्टीकरणों में परिवर्तित करता है, जिससे प्रतिस्पर्धी प्रदर्शन प्राप्त होता है और सीखे गए स्प्लाइन आकारों (spline shapes) के भविष्य कहनेवाला मूल्य का प्रदर्शन होता है।

Naveen Mysore2026-05-08
🤖 AI

GCCM: Enhancing Generative Graph Prediction via Contrastive Consistency Model

यह शोध पत्र GCCM का प्रस्ताव करता है, जो एक ग्राफ कंट्रास्टिव कंसिस्टेंसी मॉडल है जो नेगेटिव पेयर्स और फीचर परटर्बेशन्स को पेश करके कंसिस्टेंसी ट्रेनिंग को ट्रिवियल डिटर्मिनिस्टिक शॉर्टकट्स में ढहने से रोकता है, जिससे स्थिर और बेहतर ग्राफ प्रेडिक्शन प्रदर्शन प्राप्त होता है।

Shaozhen Ma, Wei Huang, Hanchen Wang, Dong Wen, Wenjie Zhang2026-05-08
🤖 AI

CFE-PPAR: Compression-friendly encryption for privacy-preserving action recognition leveraging video transformers

यह शोध पत्र CFE-PPAR का प्रस्ताव करता है, जो गोपनीयता-संरक्षण क्रिया पहचान (privacy-preserving action recognition) के लिए पहला संपीड़न-अनुकूल (compression-friendly) एन्क्रिप्शन तरीका है, जो की-ट्रांसफॉर्मड वीडियो ट्रांसफॉर्मर का उपयोग करता है ताकि एन्क्रिप्टेड वीडियो को संपीड़ित करने पर भी उच्च पहचान प्रदर्शन और दृश्य गुणवत्ता को बनाए रखा जा सके।

Haiwei Lin, Shoko Imaizumi, Hitoshi Kiya2026-05-08
🤖 machine learning

Saliency-Aware Regularized Quantization Calibration for Large Language Models

यह शोध पत्र सैलिएंसी-अवेयर रेगुलराइज्ड क्वांटाइजेशन कैलिब्रेशन (SARQC) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो कैलिब्रेशन ऑब्जेक्टिव में एक सैलिएंसी-अवेयर रेगुलराइजेशन टर्म पेश करके लार्ज लैंग्वेज मॉडल्स के लिए पोस्ट-ट्रेनिंग क्वांटाइजेशन को बेहतर बनाता है, जिससे बिना किसी इन्फरेंस ओवरहेड के जनरलाइजेशन जोखिमों को कम किया जाता है और डाउनस्ट्रीम प्रदर्शन में सुधार किया जाता है।

Yanlong Zhao, Xiaoyuan Cheng, Huihang Liu, Baihua He, Xinyu Zhang, Harrison Bo Hua Zhu, Wenlong Chen, Li Zeng, Zhuo Sun2026-05-08
🤖 machine learning

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

इर्मिन्सुल (Irminsul) एजेंटिक एलएलएम (Agentic LLMs) के लिए एक नेटिव पोजीशन-इंडिपेंडेंट कैशिंग सिस्टम पेश करता है जो कंटेंट-एड्रेस्ड की-वैल्यू कैशिंग को सक्षम करने के लिए मल्टी-हेड लेटेंट अटेंशन (Multi-Head Latent Attention) की आर्किटेक्चरल संरचना का लाभ उठाता है, जिससे पारंपरिक प्रीफिक्स-मैचिंग दृष्टिकोणों में निहित कैश इनवैलिडेशन समस्याओं को दूर करते हुए 83% तक प्रॉम्प्ट टोकन रिकवरी और 63% प्रीफिल ऊर्जा बचत प्राप्त होती है।

Bole Ma, Jan Eitzinger, Harald Köstler2026-05-08