📊 statistics

Understanding Catastrophic Forgetting In LoRA via Mean-Field Attention Dynamics

यह शोध पत्र लो-रैंक अडैप्टेशन (LoRA) में कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) की जांच करने के लिए एक मीन-फील्ड सेल्फ-अटेंशन मॉडल का उपयोग करता है ताकि परटर्बेशन नॉर्म्स और ट्रांसफॉर्मर डेप्थ के आधार पर फॉरगेटिंग और नॉन-फॉरगेटिंग व्यवहारों के बीच फेज ट्रांजिशन की पहचान की जा सके, साथ ही वास्तविक मॉडलों पर प्रयोगों के माध्यम से इन सैद्धांतिक निष्कर्षों को मान्य किया जा सके।

Hugo Koubbi, Louis Hernandez, Matthieu Boussard2026-05-14
🤖 AI

Increasing the Robustness of Model Predictions to Missing Sensors in Earth Observation

यह शोध पत्र दो नवीन विधियों, इनपुट सेंसर ड्रॉपआउट (ISensD) और एनसेम्बल सेंसर इनवेरिएंट (ESensI) का प्रस्ताव और मूल्यांकन करता है, जो तीन अर्थ ऑब्जर्वेशन डेटासेट पर प्रयोगों के माध्यम से यह प्रदर्शित करता है कि एनसेम्बल-आधारित मल्टी-सेंसर मॉडल और सेंसर ड्रॉपआउट तकनीकें लुप्त सेंसर डेटा के विरुद्ध भविष्यवाणी की मजबूती को महत्वपूर्ण रूप से बढ़ाती हैं।

Francisco Mena, Diego Arenas, Andreas Dengel2026-05-14
🤖 machine learning

Convergent Differential Privacy Analysis for General Federated Learning

यह शोध पत्र ff-DP विश्लेषण और शिफ्टेड इंटरपोलेशन तकनीकों का उपयोग करके फेडरेटेड लर्निंग विद डिफरेंशियल प्राइवेसी (Federated Learning with Differential Privacy) में मौजूदा ढीले और विचलित प्राइवेसी बाउंड्स की सीमाओं को संबोधित करता है, जिससे यह सिद्ध होता है कि Noisy-FedAvg एक टाइट कन्वर्जेंट प्राइवेसी बाउंड प्राप्त करता है जबकि Noisy-FedProx एक स्थिर कॉन्स्टेंट लोअर बाउंड बनाए रखता है, जिससे दीर्घकालिक FL-DP प्रशिक्षण की विश्वसनीयता के लिए एक ठोस सैद्धांतिक आधार स्थापित होता है।

Yan Sun, Qixin Zhang, Li Shen, Dacheng Tao2026-05-14
⚡ electrical engineering

Repurposing Image Diffusion Models for Training-Free Music Style Transfer on Mel-spectrograms

यह शोध पत्र Stylus का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो मेल-स्पेक्ट्रोग्राम (Mel-spectrograms) पर उच्च-निष्ठा वाला संगीत शैली स्थानांतरण (music style transfer) प्राप्त करने के लिए प्रीट्रेंड इमेज डिफ्यूजन मॉडल्स को सेल्फ-अटेंशन मैकेनिज्म में हेरफेर करने और फेज़-प्रिजर्विंग रिकंस्ट्रक्शन (phase-preserving reconstruction) को नियोजित करके पुनरुत्पादित करता है, जिससे यह कंटेंट संरक्षण और संवेदी गुणवत्ता दोनों में मौजूदा ज़ीरो-शॉट विधियों से बेहतर प्रदर्शन करता है।

Heehwan Wang, Joonwoo Kwon, Sooyoung Kim, Jungwoo Seo, Shinjae Yoo, Yuewei Lin, Jiook Cha2026-05-14
📊 statistics

Exact Sequence Interpolation with Transformers

यह शोध पत्र यह सिद्ध करता है कि ट्रांसफॉर्मर Rd\mathbb{R}^d में इनपुट और आउटपुट अनुक्रमों के परिमित डेटासेट को सटीक रूप से इंटरपोलेट कर सकते हैं, जिसमें एक ऐसा मॉडल निर्मित किया गया है जिसकी जटिलता इनपुट लंबाई से स्वतंत्र है, और जो सीक्वेंस-टू-सीक्वेंस लर्निंग कार्यों के लिए सैद्धांतिक गारंटी प्रदान करने हेतु अल्टरनेटिंग लेयर्स और लो-रैंक अटेंशन मैकेनिज्म का उपयोग करता है।

Albert Alcalde, Giovanni Fantuzzi, Enrique Zuazua2026-05-14
🤖 machine learning

On What Depends the Robustness of Multi-source Models to Missing Data in Earth Observation?

यह अध्ययन छह अत्याधुनिक मल्टी-सोर्स अर्थ ऑब्जर्वेशन मॉडल्स का मूल्यांकन करता है जिससे यह पता चलता है कि लुप्त डेटा के प्रति उनकी मजबूती कार्य की प्रकृति, स्रोत की पूरकता और मॉडल के डिज़ाइन पर निर्भर करती है, साथ ही यह इस धारणा को चुनौती देता है कि सभी उपलब्ध डेटा का उपयोग करने से प्रदर्शन में हमेशा सुधार होता है।

Francisco Mena, Diego Arenas, Miro Miranda, Andreas Dengel2026-05-14
🤖 machine learning

VIPO: Value Function Inconsistency Penalized Offline Reinforcement Learning

VIPO एक नवीन मॉडल-आधारित ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो ऑफलाइन डेटा से प्राप्त मूल्य अनुमानों और सीखे गए मॉडल द्वारा अनुमानित मूल्यों के बीच विसंगतियों को दंडित करने के लिए स्व-पर्यवेक्षित फीडबैक को शामिल करके मॉडल की सटीकता को बढ़ाता है और अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xuyang Chen, Keyu Yan, Guojian Wang, Lin Zhao2026-05-14
💬 NLP

A3 : an Analytical Low-Rank Approximation Framework for Attention

यह शोधपत्र A³, एक पोस्ट-ट्रेनिंग लो-रैंक एप्रोक्सिमेशन फ्रेमवर्क का प्रस्ताव करता है जो कार्यात्मक हानि (फंक्शनल लॉस) को न्यूनतम करने के लिए ट्रांसफॉर्मर घटकों (QK, OV, और MLP) के हिडन डायमेंशन को विश्लेषणात्मक रूप से कम करता है, जिससे मौजूदा विधियों की तुलना में शून्य रनटाइम ओवरहेड के साथ बेहतर संपीड़न और प्रदर्शन प्राप्त होता है।

Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk (…)2026-05-14
🤖 machine learning

A Faster Generalized Two-Stage Approximate Top-K

यह शोध पत्र केवल शीर्ष-1 के बजाय प्रति विभाजन शीर्ष-KK' तत्वों का चयन करके एक दो-चरणीय अनुमानित (two-stage approximate) टॉप-KK एल्गोरिदम का सामान्यीकरण करता है, जो एक कड़ा सैद्धांतिक रिकॉल बाउंड (theoretical recall bound) प्रदान करता है और समान अपेक्षित रिकॉल बनाए रखते हुए क्लाउड TPUv5e पर एक परिमाण के क्रम (order-of-magnitude) की गति वृद्धि प्रदर्शित करता है।

Yashas Samaga, Varun Yerram, Spandana Raj Babbula, Prateek Jain, Praneeth Netrapalli2026-05-14
🤖 machine learning

MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs

MaskPro एक नवीन रैखिक-स्थान (linear-space) संभाव्य ढांचे (probabilistic framework) को प्रस्तुत करता है जो बिना प्रतिस्थापन के N-वे सैंपलिंग (N-way sampling without replacement) के माध्यम से बड़े भाषा मॉडलों में (N:M)-विरलता (sparsity) को कुशलतापूर्वक उत्पन्न करने के लिए श्रेणीगत वितरणों (categorical distributions) को सीखता है, जबकि प्रशिक्षण को स्थिर करने और मौजूदा ग्रीडी (greedy) या ग्रेडिएंट-संचालित विधियों की तुलना में बेहतर मेमोरी दक्षता और मजबूती प्राप्त करने के लिए लॉस रेसिडुअल्स (loss residuals) के मूविंग एवरेज का उपयोग करता है।

Yan Sun, Qixin Zhang, Zhiyuan Yu, Xikun Zhang, Li Shen, Dacheng Tao2026-05-14