🤖 machine learning

Unlocking the Potential of Continual Model Merging: An ODE Perspective

यह शोध पत्र ODE-M का प्रस्ताव करता है, जो एक नवीन निरंतर मॉडल विलय (continual model merging) ढांचा है जो पैरामीटर स्पेस में लो-लॉस पथों को ट्रैक करने के लिए एक साधारण अवकल समीकरण (Ordinary Differential Equation) परिप्रेक्ष्य का लाभ उठाता है, जिससे कैटास्ट्रोफिक फॉरगेटिंग को प्रभावी ढंग से कम किया जा सके और विषम कार्य बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन किया जा सके।

Lihong Lin, Haidong Kang2026-05-20
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

यह शोध पत्र कॉन्ट्रास्टिविव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन (CEPO) को प्रस्तुत करता है, जो एक नवीन RLVR सेल्फ-डिस्टिलेशन विधि है जो एक कॉन्ट्रास्टिव रिवॉर्ड सिग्नल उत्पन्न करने के लिए सही और अस्वीकृत दोनों रोलआउट्स का लाभ उठाती है, जिससे सूचना रिसाव (information leakage) से बचते हुए निर्णायक रीजनिंग स्टेप्स की सटीक पहचान की जाती है और मल्टीमॉडल गणितीय तर्क बेंचमार्क पर GRPO जैसे मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जाता है।

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan2026-05-20
🤖 machine learning

When the Majority Votes Wrong, the Intervention Timing for Test-Time Reinforcement Learning Hides in the Extinction Window

यह शोध पत्र तर्क देता है कि टेस्ट-टाइम रीइन्फोर्समेंट लर्निंग (TTRL) के कथित लाभ अक्सर "करेक्ट-आंसर एक्सटिंक्शन विंडो" में सही उत्तरों के अपरिवर्तनीय दमन के कारण भ्रामक होते हैं, और TTRL-Guard का प्रस्ताव करता है, जो इस क्षति को कम करने और गणितीय तर्क संबंधी बेंचमार्क पर प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए फ्लिप-रेट मॉनिटरिंग और अल्पसंख्यक-संरक्षण तंत्रों का उपयोग करने वाला एक ढांचा है।

Hongxiang Lin, Zhirui Kuai, Erpeng Xue, Lei Wang2026-05-20
🤖 machine learning

Implicit Bias of Mirror Flow in Homogeneous Neural Networks: Sparse and Dense Feature Learning

यह शोध पत्र एक नवीन संतुलन समीकरण को व्युत्पन्न करके होमोजेनियस न्यूरल नेटवर्क में मिरर फ्लो के अंतर्निहित पूर्वाग्रह (implicit bias) को अभिलक्षित करता है और यह सिद्ध करता है कि भिन्न मिरर मैप्स, हालांकि समान मैक्स-मार्जिन समाधान की ओर अभिसरित होते हैं, फिर भी विरल (sparse) से सघन (dense) सक्रियताओं तक के व्यापक रूप से भिन्न फीचर लर्निंग व्यवहार को प्रेरित कर सकते हैं।

Tom Jacobs, Guido Montufar2026-05-20
🤖 machine learning

Quantifying the Pre-training Dividend: Generative versus Latent Self-Supervised Learning for Time Series Foundation Models

यह शोध पत्र एक नियंत्रित ढांचा स्थापित करता है जो यह प्रदर्शित करता है कि स्व-पर्यवेक्षित प्री-ट्रेनिंग (self-supervised pre-training) टाइम सीरीज़ वर्गीकरण और विसंगति का पता लगाने (anomaly detection) के लिए पर्याप्त लाभ प्रदान करती है, लेकिन पूर्वानुमान (forecasting) के लिए यह मामूली लाभ ही देती है, एक ऐसा अंतर जो परिशुद्धता-अपरिवर्तनीयता (precision-invariance) के व्यापार-बंद (trade-off) द्वारा संचालित है जो जनरेटिव प्रतिमानों (generative paradigms) के बजाय लेटेंट अलाइनमेंट आर्किटेक्चर (latent alignment architectures) के पक्ष में है।

Noam Major, Kathy Razmadze, Yoli Shavit2026-05-20
🤖 machine learning

Sampling-Based Safe Reinforcement Learning

यह शोध पत्र सैंपलिंग-आधारित सेफ रिइन्फोर्समेंट लर्निंग (SBSRL) प्रस्तुत करता है, जो एक मॉडल-आधारित एल्गोरिदम है जो डायनेमिक्स सैंपल्स में बाधाओं को लागू करके और एपिस्टेमिक अनसर्टेन्टी (epistemic uncertainty) को प्रबंधित करके निरंतर नियंत्रण शिक्षण के दौरान सुरक्षा सुनिश्चित करता है, जिससे सैद्धांतिक सुरक्षा गारंटी प्रदान होती है और सिमुलेशन एवं वास्तविक दुनिया के रोबोटिक हार्डवेयर दोनों में कुशल अन्वेषण प्राप्त होता है।

Luca Vignola, Bruce D. Lee, Manish Prajapat, Manuel Wendl, Melanie Zeilinger, Andreas Krause, Yarden As2026-05-20
💬 NLP

Drifting Objectives for Refining Discrete Diffusion Language Models

यह शोध पत्र TokenDrift को प्रस्तुत करता है, जो एक नवीन प्रशिक्षण उद्देश्य (training objective) है जो निरंतर ड्रिफ्टिंग सिद्धांतों (continuous drifting principles) को डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स पर अनुकूलित करने के लिए श्रेणीगत भविष्यवाणियों (categorical predictions) को एंटी-सिमेट्रिक रिफाइनमेंट के लिए सॉफ्ट-टोकन फीचर्स में ऊपर उठाता है, जिससे कम सैंपलिंग स्टेप्स पर जनरेशन की गुणवत्ता में महत्वपूर्ण सुधार होता है।

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki2026-05-20
🤖 machine learning

Adynamical systems view of training generativemodels and the memorization phenomenon

यह शोध पत्र एक डायनेमिकल सिस्टम्स परिप्रेक्ष्य का उपयोग करता है, जो जनरेटिव मॉडल्स में मेमोराइजेशन (memorization) की घटना के लिए एक सिस्टम-थ्योरेटिक स्पष्टीकरण प्रदान करने हेतु स्टोकेस्टिक ग्रेडिएंट डिसेंट में टू-टाइम-स्केल डायनेमिक्स और मॉडल कोलैप्स पर हालिया परिणामों का लाभ उठाता है, जहाँ प्रशिक्षण के दौरान आउटपुट लंबे समय तक स्थिर रहते हैं।

Siva Athreya, Chiranjib Bhattacharya, Vivek S. Borkar2026-05-20
🤖 machine learning

The Silent Hyperparameter: Quantifying the Impact of Inference Backends on LLM Reproducibility

यह शोध पत्र प्रकट करता है कि इन्फरेंस बैकएंड (inference backend) का चयन एक महत्वपूर्ण, फिर भी अक्सर अनरिपोर्ट किया जाने वाला हाइपरपैरामीटर है जो सिस्टम-स्तरीय अनुकूलन के कारण LLM बेंचमार्क स्कोर को 16.6 प्रतिशत अंकों तक महत्वपूर्ण रूप से बदल सकता है, जिससे यह समुदाय को पुनरुत्पादकता सुनिश्चित करने के लिए इन्फरेंस स्टैक रिपोर्टिंग को मानकीकृत करने का आग्रह करता है।

David Pape, Jonathan Evertz, Lea Schönherr2026-05-20
📊 statistics

Density-Ratio Losses for Post-Hoc Learning to Defer

यह शोध पत्र एक पोस्ट-हॉक 'लर्निंग टू डिफर' (Learning to Defer) ढांचे का प्रस्ताव करता है जो विलंब निर्णय (deferral decisions) को मॉडल और विशेषज्ञ आदर्श वितरणों के बीच घनत्व-अनुपात अनुमान (density-ratio estimation) के रूप में तैयार करता है, जिससे बिना पुनप्रशिक्षण के समायोज्य विलंब दर सक्षम होती है और चो के नियम (Chow's rule), विशेषज्ञ-झुकाव वाले बेयसियन अनुमान (expert-tilted Bayesian inference), और विसंगति का पता लगाने (anomaly detection) को एकीकृत किया जाता है।

Alexander Soen, Ragnar Thobaben, Joakim Jaldén, Richard Nock2026-05-20