🤖 machine learning

Learning Theory of the SVRG: Generalization and Convergence Analysis

यह शोध पत्र एक नवीन अपघटन और लयापुनोव फलन दृष्टिकोण के माध्यम से तीक्ष्ण, डेटा-निर्भर एल्गोरिद्मिक स्थिरता सीमाएँ स्थापित करके स्टोकेस्टिक वेरिएंस रिड्यूस्ड ग्रेडिएंट (SVRG) पद्धति का प्रथम गैर-रिक्त सामान्यीकरण विश्लेषण प्रस्तुत करता है, जिससे इष्टतम अतिरिक्त जनसंख्या जोखिम सीमाओं को प्राप्त करने के लिए अनुकूलन और सामान्यीकरण के बीच के अंतर्संबंध को स्पष्ट किया जा सके।

Yunwen Lei, Zimeng Wang, Xiaoming Yuan2026-05-28
📊 statistics

Conservative neural posterior estimation via distributionally robust training

यह शोध पत्र DRO-NPE प्रस्तुत करता है, जो एक वितरण रूप से सुदृढ़ (distributionally robust) प्रशिक्षण ढांचा है जो एक वासरस्टीन अस्पष्टता सेट (Wasserstein ambiguity set) पर एक वर्स्ट-केस लॉस को अनुकूलित करके सीमित सिमुलेशन बजट के तहत न्यूरल पोस्टीरियर एस्टीमेशन में अति-आत्मविश्वास को कम करता है और अंशांकन (calibration) में सुधार करता है।

William Laplante, Yuga Hikida, Charita Dellaporta, François-Xavier Briol, Ayush Bharti2026-05-28
🤖 machine learning

Stochastic Gradient Descent with Momentum is Algorithmically Stable

यह शोध पत्र पोलियाक (Polyak) और नेस्टरोव (Nesterov) की योजनाओं के लिए एक एकीकृत ढांचे को पेश करके, लिप्सचिट्ज़ लॉस (Lipschitz loss) धारणाओं की आवश्यकता के बिना सटीक स्थिरता सीमाओं को व्युत्पन्न करके, और मोमेंटम (momentum) के सामान्यीकरण पर प्रभाव के संबंध में अनुमान को हल करने वाले इष्टतम अतिरिक्त जनसंख्या जोखिम (excess population risk) सीमाओं को सिद्ध करके, स्टोकैस्टिक ग्रेडिएंट डिसेंट विद मोमेंटम (SGDM) की एल्गोरिद्मिक स्थिरता और सामान्यीकरण क्षमताओं को स्थापित करता है।

Yunwen Lei, Zimeng Wang, Xiaoming Yuan2026-05-28
🤖 machine learning

Stabilizing distribution-free probabilistic forecasts

यह शोध पत्र डिस्ट्रीब्यूशन-फ्री प्रोबेबिलिस्टिक टाइम-सीरीज फोरकास्ट्स की गुणवत्ता और स्थिरता को संयुक्त रूप से अनुकूलित करने के लिए रिग्रेशन स्प्लाइन्स का उपयोग करने वाली एक न्यूरल नेटवर्क-आधारित विधि प्रस्तावित करता है, जो डाउनस्ट्रीम अनुप्रयोगों के लिए प्रासंगिक विशिष्ट डिस्ट्रीब्यूशन क्षेत्रों के लक्षित स्थिरीकरण की अनुमति देते हुए महंगी पूर्वानुमान परिवर्तनशीलता को प्रभावी ढंग से कम करता है।

Jente Van Belle, Honglin Wen, Wouter Verbeke, Pierre Pinson2026-05-28
🤖 AI

Cultural Binding Heads in Language Models

यह शोध पत्र बड़े भाषा मॉडलों (large language models) में उन विशिष्ट मिड-लेयर अटेंशन हेड्स (mid-layer attention heads) की पहचान करता है जो सांस्कृतिक बंधन (cultural binding) को कार्यवत रूप से संचालित करते हैं, यह प्रकट करते हुए कि जबकि मॉडलों के पास पर्याप्त सांस्कृतिक ज्ञान मौजूद है, समान व्यवहार करने की उनकी प्रवृत्ति एक रूटिंग बॉटलनेक (routing bottleneck) से उत्पन्न होती जिसे हेड नॉकआउट (head knockout) और α\alpha-स्केलिंग (α\alpha-scaling) जैसे लक्षित मैकेनिस्टिक हस्तक्षेपों के माध्यम से कम किया जा सकता है।

Avrile Floro, Luca Benedetto2026-05-28
🤖 machine learning

High Performance, Low Reliability: Uncertainty Benchmarking for Tabular Foundation Models

यह शोध पत्र प्रकट करता है कि जहाँ टैबुलर फाउंडेशन मॉडल्स (Tabular Foundation Models) प्रेडिक्टिव सटीकता में ग्रेडिएंट-बूस्टेड डिसिजन ट्रीज़ (Gradient-Boosted Decision Trees) से बेहतर प्रदर्शन करते हैं, वहीं वे निम्न अनिश्चितता मात्रा निर्धारण (uncertainty quantification) और अंशांकन (calibration) से ग्रस्त हैं, जो एक महत्वपूर्ण प्रदर्शन-विश्वसनीयता ट्रेड-ऑफ को उजागर करता है जिसे उनके विश्वसनीय अंगीकरण के लिए संबोधित किया जाना चाहिए।

José Lucas De Melo Costa, Fabrice Popineau, Arpad Rimmel, Bich-Liên Doan2026-05-28
💬 NLP

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

यह शोधपत्र Soft-SVeRL प्रस्तुत करता है, जो एक स्व-सत्यापित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो आंशिक रूप से सत्यापन योग्य कार्यों में निर्देश-अनुपालन में सुधार के लिए विघटित, चेकलिस्ट-आधारित सॉफ्ट रिवॉर्ड्स का उपयोग करता है, और साथ ही स्पष्ट स्थिरीकरण तंत्रों के माध्यम से सत्यापनकर्ता शोर (verifier noise) और रिवॉर्ड मुद्रास्फीति के बीच महत्वपूर्ण ट्रेड-ऑफ को संबोधित करता है।

Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis2026-05-28
🤖 machine learning

Semantic Optimal Transport for Sparse Autoencoder Feature Matching and Circuit Compression

यह शोधपत्र वॉसरस्टीन दूरी (Wasserstein distance) पर आधारित एक एकीकृत वितरण ढांचे (unified distributional framework) को प्रस्तुत करता है जो स्पार्स ऑटोएन्कोडर (Sparse Autoencoder) फीचर्स को एक्टिवेशन-वेटेड डिस्ट्रीब्यूशन के रूप में निरूपित करता है ताकि परतों के बीच सुदृढ़ अर्थपूर्ण मिलान (robust semantic matching) और फीचर सर्किट्स को व्याख्यात्मक सुपरनोड्स (interpretable supernodes) में स्वचालित संपीड़न (automatic compression) सक्षम किया जा सके।

Tue M. Cao, Nguyen Do, My T. Thai2026-05-28
🤖 AI

Continual Model Routing in Evolving Model Hubs

यह शोध पत्र निरंतर बढ़ते एआई हब में मॉडल चयन को स्केल करने की चुनौतियों को संबोधित करने के लिए निरंतर मॉडल रूटिंग (CMR) सेटिंग को औपचारिक रूप देता है, बड़े पैमाने पर CMRBench बेंचमार्क को प्रस्तुत करता है, और CARvE का प्रस्ताव देता है, जो एक कंट्रास्टिव एम्बेडिंग विधि है जो विविध मॉडलों और कार्यों में रूटिंग सटीकता के मामले में मौजूदा बेसलाइन से काफी बेहतर प्रदर्शन करती है।

Jack Bell, Giacomo Carfì, Gerlando Gramaglia, Vincenzo Lomonaco2026-05-28
🤖 machine learning

A Generalized Tikhonov Layer for Interpretable-by-design Graph Neural Networks

यह शोध पत्र टिखोनोव लेयर (Tikhonov layer) का परिचय देता है, जो एक ग्राफ न्यूरल नेटवर्क घटक है जिसे अपने सीखे गए मापदंडों को विशिष्ट फीचर और टोपोलॉजिकल योगदानों से सीधे मैप करके स्वाभाविक रूप से व्याख्या योग्य (interpretable) बनाने के लिए डिज़ाइन किया गया है, जबकि साथ ही वैश्विक रिसेप्टिव फील्ड्स प्राप्त करना और अपारदर्शी बेसलाइनों के प्रदर्शन के बराबर प्रदर्शन करना सुनिश्चित किया गया है।

Nicolas Tremblay, Benjamin Ricaud, Filippo Maria Bianchi2026-05-28