🤖 machine learning

Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization

यह शोध पत्र संचार-कुशल वितरित अनुकूलन (communication-efficient distributed optimization) में बाहरी मोमेंटम के आवधिक पुनरारंभ (periodic restarting) का प्रस्ताव और विश्लेषण करता है, जो यह प्रदर्शित करता है कि यह तंत्र चरण रद्दीकरण (phase cancellation) का लाभ उठाने के लिए पुराने मोमेंटम को त्याग देता है, जिससे हाइपरपैरामीटर की स्थिर सीमा विस्तृत होती है और उच्च-आयामी परिवेशों में अभिसरण (convergence) में सुधार होता है।

Kristi Topollai, Allan Ma, Tolga Dimlioglu, Sui Jiet Tay, Anna Choromanska2026-05-28
🤖 machine learning

Thinned Mean Field Langevin Dynamics

यह शोध पत्र \texttt{KT-MFLD} का प्रस्ताव करता है, जो एक नवीन एल्गोरिदम है जो कर्नेल थिनिंग (kernel thinning) का उपयोग करके कणों की अंतःक्रियाओं को O(N1/2)O(N^{1/2}) आकार के एक कोसेट (coreset) तक सीमित करता है, जिससे मीन-फील्ड लैंग्विन डायनेमिक्स (Mean-Field Langevin Dynamics) की कम्प्यूटेशनल जटिलता को O(N2)O(N^2) से घटाकर O(N3/2)O(N^{3/2}) कर दिया जाता है, जबकि मूल विधि के समान अभिसरण गारंटी (convergence guarantees) को बनाए रखा जाता है।

Zonghao Chen, Heishiro Kanagawa, François-Xavier Briol, Chris J. Oates, Lester Mackey2026-05-28
🤖 machine learning

PLS in the Mirror of Self-Attention

यह शोध पत्र आंशिक न्यूनतम वर्ग (Partial Least Squares - PLS) को एक रैखिकीकृत स्व-ध्यान (self-attention) तंत्र के रूप में प्रस्तुत करने का प्रस्ताव करता है ताकि न्यूरल नेटवर्क प्रतिमान के भीतर इसका अध्ययन किया जा सके, जो यह सुझाव देता है कि PLS की आया कमी (dimensionality reduction) यह दर्शाती है कि स्व-ध्यान स्वाभाविक रूप से बेहतर सीखने के लिए आया सामान्यीकरण (dimensionality normalization) को समाहित करता है।

Jiangsheng (Jason), You2026-05-28
🤖 machine learning

Transformers Provably Learn to Internalize Chain-of-Thought

यह शोध पत्र पहला सैद्धांतिक प्रमाण प्रदान करता है कि एक नवीन Log-ICoT पाठ्यक्रम के साथ प्रशिक्षित एक मल्टी-लेयर ट्रांसफार्मर, बहुपद नमूना दक्षता (polynomial sample efficiency) और लघुगणकीय प्रशिक्षण चरणों (logarithmic training stages) के साथ kk-पैरिटी को सिद्ध रूप से सीख सकता है, जिससे वह स्पष्ट चेन-ऑफ-थॉट (Chain-of-Thought) तर्क की नमूना दक्षता प्राप्त करते हुए आंतरिककृत मध्यवर्ती चरणों के माध्यम से इसके इन्फरेंस ओवरहेड को समाप्त कर देता है।

Yixiao Huang, Hanlin Zhu, Zixuan Wang, Jiantao Jiao, Stuart Russell, Somayeh Sojoudi, Song Mei2026-05-28
🤖 machine learning

Online Irregular Multivariate Time Series Forecasting via Uncertainty-Driven Dual-Expert Calibration

यह शोध पत्र Under-Cali का प्रस्ताव करता है, जो एक अनिश्चितता-संचालित (uncertainty-driven) डुअल-एक्सपर्ट कैलिब्रेशन फ्रेमवर्क है जो अनुमानित अनिश्चितता के आधार पर विश्वसनीय और अविश्वसनीय विशेषज्ञों के बीच नमूनों को गतिशील रूप से रूट करके अनियमित बहुभिन्न चर समय श्रृंखला (irregular multivariate time series) के लिए कुशल और स्थिर ऑनलाइन पूर्वानुमान सक्षम करता है, और यह सब स्रोत मॉडल को स्थिर (frozen) रखते हुए किया जाता है।

Haonan Wen, Hanyang Chen, Songhe Feng2026-05-28
📊 statistics

Implicit Regularization in Perturbed Deep Matrix Factorization: Spectral Conditions and Stability

यह शोध पत्र पर्याप्त स्पेक्ट्रल स्थितियाँ और अभिसरण गारंटी स्थापित करता है जो यह प्रदर्शित करती हैं कि डीप मैट्रिक्स फैक्टराइजेशन में लो-रैंक इम्प्लिसिट रेगुलराइजेशन प्रभाव लक्ष्य स्पेक्ट्रम, इनिशियलाइजेशन और गड़बड़ी के आकार पर स्पष्ट निर्भरता के साथ, शोर संबंधी गड़बड़ियों (नॉइज़ परटर्बेशन) के तहत स्थिर रहता है।

Jingzhe Wang, Hung-Hsu Chou2026-05-28
🤖 machine learning

Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection

यह शोध पत्र SHIFT को प्रस्तुत करता है, जो 'वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग' (RLVR) के लिए एक ट्रेनिंग-मुक्त डेटा चयन पद्धति है, जो एकल इन्फरेंस रोलआउट के दौरान रीजनिंग-प्रेरित हिडन-स्टेट शिफ्ट को मापकर उच्च-उपयोगिता वाले इंस्टेंस की पहचान करती है, जिससे लेबल या रिवॉर्ड सिग्नल तक पहुंच के बिना प्रभावी मॉडल प्रशिक्षण सक्षम होता है।

Jianghao Wu, Jianfei Cai, Weiqiang Wang, Jin Ye, Daniel F. Schmidt, Yasmeen George2026-05-28
🤖 machine learning

Interpretability-Guided Layer Selection over Subspace Projection: SAEs as Stethoscopes, Not Scalpels, for Raw Task Vector Model Editing

यह शोध पत्र यह प्रदर्शित करता है कि टास्क वेक्टर्स (task vectors) को SAE फीचर सबस्पेस पर प्रोजेक्ट करना ज्यामितीय मिसअलाइनमेंट (geometric misalignment) के कारण एक मॉडल एडिटिंग रणनीति के रूप में विफल रहता है, और इसके बजाय विशिष्ट परतों में कच्चे टास्क वेक्टर्स को चुनिंदा रूप से इंजेक्ट करने के लिए SAEs को नैदानिक "स्टेथोस्कोप" के रूप में उपयोग करने का प्रस्ताव देता है, जो बिना किसी अतिरिक्त कम्प्यूटेशनल लागत के गणितीय तर्क प्रदर्शन में महत्वपूर्ण सुधार करता है।

Li Lei, Madalina Ciobanu, Qingqing Mao, Ritankar Das2026-05-28
🤖 machine learning

Applications of temporal graph learning for predicting the dynamics of biological systems

यह कार्य-प्रगति (work-in-progress) पेपर एक टेम्पोरल ग्राफ लर्निंग फ्रेमवर्क प्रस्तावित करता है जो सेलुलर डायनेमिक्स को विकसित होते जीन रेगुलेटरी नेटवर्क के रूप में मॉडल करता है, जो माउस विकासात्मक डेटासेट में जीन अभिव्यक्ति और नियामक अंतःक्रियाओं के पूर्वानुमान में scGPT जैसे स्टैटिक फाउंडेशन मॉडल्स की तुलना में इसकी श्रेष्ठता को प्रदर्शित करता है।

Manuel Dileo, Andrea Sottoriva2026-05-28
🤖 machine learning

Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection

यह शोध पत्र प्रदर्शित करता है कि जबकि एक्टिवेशन स्टीयरिंग (Activation Steering) डाउनस्ट्रीम सुरक्षा पहचान में सुधार के लिए प्रभावी सिंथेटिक डेटा उत्पन्न कर सकता है, इसकी उपयोगिता एक संकीर्ण क्षेत्र तक सीमित है जहाँ अवधारणा संरेखण (concept alignment) और सुसंगतता (coherence) के साथ प्रतिक्रिया विविधता बनाए रखने के लिए स्टीयरिंग स्ट्रेंथ को सावधानीपूर्वक संतुलित किया जाना चाहिए।

Vijeta Deshpande, Tootiya Giyahchi, Veena Padmanabhan, Leman Akoglu, Anna Rumshisky2026-05-28