⚡ electrical engineering

Hybrid Active-Online Learning Framework for Label-Efficient Concept Drift Adaptation in Optical Network Failure Detection

यह शोधपत्र एक हाइब्रिड एक्टिव-ऑनलाइन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो मार्जिन-आधारित चयनात्मक लेबलिंग के माध्यम से स्ट्रीमिंग नमूनों के केवल 3.4% को क्वेरी करके, नगण्य विलंबता ओवरहेड बनाए रखते हुए, कॉन्सेप्ट ड्रिफ्ट के तहत ऑप्टिकल नेटवर्क विफलता का पता लगाने में सीलिंग के करीब सटीकता प्राप्त करता है।

Yousuf Moiz Ali, Jaroslaw E. Prilepsky, João Pedro, Sasipim Srivallapanondh, Antonio Napoli, Sergei K. Turitsyn, Pedro F (…)2026-06-30
📊 statistics

Extrapolating from Regularised Solutions for Solving Ill-Conditioned Linear Systems in Machine Learning

यह शोध पत्र **autonugget** प्रस्तुत करता है, जो एक JAX-संगत पायथन पैकेज है जो रिचर्डसन एक्सट्रपलेशनेशन (Richardson extrapolation) के माध्यम से कई टिखोनोव-नियमित समाधानों (Tikhonov-regularized solutions) को जोड़कर मशीन लर्निंग प्रोटोटाइपिंग के लिए इल-कंडीशन्ड (ill-conditioned) रैखिक प्रणालियों को हल करने की सटीकता और स्थिरता में सुधार करता है, जिससे कठिन नगेट चयन (nugget selection) की आवश्यकता समाप्त हो जाती है और पूर्णतः डिफरेंशिएबल एंड-टू-एंड प्रशिक्षण सक्षम होता है।

Disha Hegde, Jon Cockayne, Chris. J. Oates2026-06-30
🔬 physics

Local-Minima-Preserving Continuous Relaxation of Ising Problems

यह शोध पत्र सामान्यीकृत आइसिंग समस्या (generalized Ising problem) के लिए एक बहुपद विश्राम (polynomial relaxation) प्रस्तुत करता है जो इसके स्थानीय निम्नीकृतों (local minima) और मूल असतत समस्या के वन-फ्लिप स्थानीय निम्नीकृतों के बीच एक एक-से-एक पत्राचार को संरक्षित करता है, जिससे MAX-CUT और नंबर पार्टीशनिंग जैसे चुनौतीपूर्ण संयोजन संबंधी बेंचमार्क को हल करने के लिए ADAM जैसे स्केलेबल ग्रेडिएंट-आधारित ऑप्टिमाइज़र का उपयोग करना सक्षम होता है।

Debraj Banerjee, Santanu Mahapatra, Kunal N. Chaudhury2026-06-30
💬 NLP

REAR: Test-time Preference Realignment through Reward Decomposition

यह शोधपत्र REAR को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) टेस्ट-टाइम फ्रेमवर्क है जो रिवॉर्ड फंक्शन्स को विघटित करके रिवॉर्ड घटकों को चुनिलेक्टिव रूप से रीस्केल करता है, जिससे लार्ज लैंग्वेज मॉडल्स को विविध उपयोगकर्ता प्राथमिकताओं के साथ संरेखित किया जाता है, और इस प्रकार सत्यापन योग्य डोमेन से परे जटिल प्राथमिकता संरेखण कार्यों तक कुशल टेस्ट-टाइम स्केलिंग का विस्तार किया जाता है।

Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An2026-06-30
⚡ electrical engineering

OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL

OLIVE एक स्व-पर्यवेक्षित स्पीच रिप्रजेंटेशन लर्निंग फ्रेमवर्क है जो व्यू-ऑगमेंटेड मास्क्ड लेटेंट प्रेडिक्शन और वेवफॉर्म रिकंस्ट्रक्शन को संयुक्त रूप से अनुकूलित करता है ताकि मजबूत, सिग्नल-इन्फॉर्मेटिव रिप्रजेंटेशन्स उत्पन्न किए जा सकें जो जनरेशन और स्पीकर कार्यों में उत्कृष्ट होने के साथ-साथ रिकग्निशन और सिमेंटिक अनुप्रयोगों में प्रतिस्पर्धी प्रदर्शन बनाए रखते हैं।

Karl El Hajal, Mathew Magimai. -Doss2026-06-30
🤖 machine learning

On the Vulnerability of Parameter-Level Defenses to Model Merging

यह शोध पत्र मॉडल मर्जिंग के विरुद्ध पैरामीटर-स्तरीय सुरक्षा उपायों में एक महत्वपूर्ण भेद्यता को उजागर करता है, जहाँ संरक्षित टास्क वेक्टर्स प्रीट्रेन्ड मॉडल को छिपाने के लिए बहुत छोटे हैं, जिससे एक नया एंकर-गाइडेड अटैक (AGA) मौजूदा सुरक्षा उपायों को दरकिनार करने में सक्षम होता है, जबकि एक प्रभावी प्रतिउपाय के रूप में एंकर-रिपल्सिव फाइन-ट्यूनिंग (ARF) का प्रस्ताव भी दिया गया है।

Kuangpu Guo, Qingyan Zheng, Jian Liang, Yongcan Yu, Zilei Wang, Ran He, Tieniu Tan2026-06-30
🤖 machine learning

FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification

FlowAWR एक निरंतर जनरेटिव फ्लो मॉडल्स के लिए एक ऑनलाइन एडेप्टिव रिइन्फोर्समेंट लर्निंग फ्रेमवर्क पेश करता है जो पॉलिसी ऑप्टिमाइज़ेशन को एक एडवांटेज-वेटेड वेलोसिटी फील्ड की ओर सुपरवाइज्ड रिग्रेशन के रूप में पुनर्गठित करता है, जिससे अप्राप्य ट्रेजेक्टरी लाइकलीहुड्स, स्टोकेस्टिक SDE सैंपलर और क्लासिफायर-फ्री गाइडेंस की आवश्यकता समाप्त हो जाती है और मौजूदा तरीकों की तुलना में तेज़ अभिसरण और बेहतर अलाइनमेंट प्रदर्शन प्राप्त होता है।

Zheming Fu, Ruizhe He, Wei Shang, Xiaoxiao Ma, Lei Wang, Chang Liu, Siming Fu2026-06-30
🤖 machine learning

Diffusion Fine-tuning with Rewarded Moment Matching Distillation

यह शोध पत्र रिवॉर्डेड मोमेंट मैचिंग डिस्टिलेशन (RMMD) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो बेहतर गति-गुणवत्ता ट्रेड-ऑफ प्राप्त करने के लिए डिफ्यूजन मॉडल डिस्टिलेशन और सुदृढीकरण शिक्षण (reinforcement learning) को एकीकृत करता है, जिसे ImageNet और उच्च-आयामी GenCast मौसम पूर्वानुमान मॉडल दोनों पर महत्वपूर्ण सुधारों द्वारा प्रदर्शित किया गया है।

Alexis Jacq, Guillaume Couairon, Valentin De Bortoli, Quentin Berthet, Arnaud Doucet, Romuald Elie2026-06-30
🤖 machine learning

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

यह शोध पत्र इस पारंपरिक दृष्टिकोण को चुनौती देता है कि त्रुटि संचय (error accumulation) ऑनलाइन इमिटेशन लर्निंग की सफलता को संचालित करता है, और इसके बजाय यह प्रदर्शित करता है कि ऑफलाइन विधियों पर इसका लाभ मुख्य रूप से गैर-यथार्थता (non-realizability) द्वारा निर्धारित होता है, जहाँ ऑनलाइन इंटरेक्शन उन सूचनात्मक बाधाओं (information-theoretic bottlenecks) को दूर करता है जो मिसस्पेसिफाइड सेटिंग्स में ऑफलाइन दृष्टिकोणों द्वारा एक हॉराइजन (horizon) के स्तर पर भी हल नहीं की जा सकती हैं।

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski2026-06-30
🤖 machine learning

Internal-State Probes Read the Situation, Not the Action: Three Negative Results for Pre-Action Misalignment Monitoring

यह शोधपत्र तीन नकारात्मक परिणाम प्रस्तुत करता है जो यह प्रदर्शित करते हैं कि वर्तमान आंतरिक-अवस्था प्रोब (internal-state probes), विशिष्ट संदर्भों में आशाजनक होने के बावजूद, एक सुदृढ़ प्री-एक्शन मिसअलाइनमेंट मॉनिटर के रूप में कार्य करने में विफल रहते हैं क्योंकि वे विश्वसनीय रूप से सामान्यीकरण और विशिष्टता परीक्षणों के माध्यम से हानिकारक भविष्य की कार्रवाइयों की भविष्यवाणी करने के बजाय मुख्य रूप से प्रॉम्प्ट निर्माण या वर्तमान प्रक्षेपवक्र को दर्शाते हैं।

Max Fomin, Elad David, Amit LeVi2026-06-30