🤖 machine learning

Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training

यह शोध पत्र भाषा मॉडल पोस्ट-ट्रेनिंग के लिए एक "स्पार्स-टू-डेंस" (sparse-to-dense) रिवॉर्ड सिद्धांत प्रस्तावित और अनुभवजन्य रूप से मान्य करता है, जो यह प्रदर्शित करता है कि एक छोटे छात्र (student) में डेंस सुपरविजन के माध्यम से इसके व्यवहार को स्थानांतरित करने से पहले, स्पार्स रिवॉर्ड्स के साथ एक मजबूत शिक्षक (teacher) मॉडल को प्रशिक्षित करने के लिए दुर्लभ सत्यापन योग्य डेटा आवंटित करना, छात्र पर सीधे स्पार्स सुदृढीकरण शिक्षण (sparse reinforcement learning) करने की तुलना में बेहतर परिणाम देता है।

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard2026-05-13
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

यह शोध पत्र फास्ट-स्लो ट्रेनिंग (FST) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो स्थिर मॉडल मापदंडों ("स्लो" वेट्स) को अनुकूलित संदर्भ ("फास्ट" वेट्स) के साथ जोड़ता है ताकि LLMs को टेक्स्टुअल फीडबैक से अधिक कुशलता से सीखने, उच्च प्रदर्शन प्राप्त करने और पारंपरिक पैरामीटर-अपडेटिंग विधियों की तुलना में अधिक प्लास्टिसिटी बनाए रखने और कैटास्ट्रोफिक फॉरगेटिंग को महत्वपूर्ण रूप से कम करने में सक्षम बनाया जा सके।

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Ri (…)2026-05-13
🤖 machine learning

Elastic Attention Cores for Scalable Vision Transformers

यह शोध पत्र VECA (विजुअल इलास्टिक कोर अटेंशन) प्रस्तुत करता है, जो एक विजन ट्रांसफार्मर आर्किटेक्चर है जो क्वाड्रेटिक ऑल-टू-ऑल सेल्फ-अटेंशन को एक कुशल कोर-पेरिफेरी संरचना से बदलकर रैखिक कम्प्यूटेशनल जटिलता और स्केलेबल हाई-रिज़ॉल्यूशन प्रोसेसिंग प्राप्त करता है, जहाँ पैच टोकन विशेष रूप से कोर एम्बेडिंग्स के एक छोटे, सीखे गए सेट के माध्यम से संचार करते हैं।

Alan Z. Song, Yinjie Chen, Mu Nan, Rui Zhang, Jiahang Cao, Weijian Mai, Muquan Yu, Hossein Adeli, Deva Ramanan, Michael (…)2026-05-13
🤖 machine learning

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

यह शोध पत्र AlphaGRPO का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो बिना किसी कोल्ड-स्टार्ट चरण के, स्थिर और व्याख्या योग्य पर्यवेक्षण के लिए एक नवीन डिकम्पोजिशनल वेरिफिएबल रिवॉर्ड (DVReward) द्वारा निर्देशित ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन को लागू करके यूनिफाइड मल्टीमॉडल मॉडल्स की जनरेशन और सेल्फ-रिफ्लेक्टिव रिफाइनमेंट क्षमताओं को बढ़ाता है।

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao2026-05-13
🔢 mathematics

Projection-Free Functional Constrained Optimization for Risk Aversion and Sparsity Control

यह शोध पत्र प्रोजेक्शन-फ्री लेवल कंडिशनल ग्रेडिएंट (LCG) और इनएक्सैक्ट प्रॉक्सिमल पॉइंट LCG (IPP-LCG) विधियों को प्रस्तुत करता है जो क्रमशः उत्तल (convex) और गैर-उत्तल (nonconvex) कार्यात्मक बाधाओं वाले अनुकूलन समस्याओं को हल करने के लिए अत्याधुनिक इटरेशन जटिलताएँ प्राप्त करते हैं, जबकि पोर्टफोलियो अनुकूलन और रेडिएशन थेरेपी जैसे अनुप्रयोगों में जोखिम निवारण और विरलता (sparsity) के बीच प्रभावी ढंग से संतुलन बनाते हैं।

Yi Cheng, Guanghui Lan, Saeed Masiha, H. Edwin Romeijn2026-05-12
🔬 physics

Bayesian Reasoning for Physics Informed Neural Networks

यह शोध पत्र भौतिकी-सूचित तंत्रिका नेटवर्क (फिजिक्स-इन्फॉर्म्ड न्यूरल नेटवर्क्स) का एक साक्ष्य-संचालित बायेसियन सूत्रीकरण प्रस्तुत करता है जो मॉडल साक्ष्य (मॉडल एविडेंस) की विश्लेषणात्मक गणना के लिए लाप्लास सन्निकटन (लैपलेस एप्रोक्सिमेशन) का उपयोग करता है, जिससे विभिन्न आंशिक अवकल समीकरणों (पार्शियल डिफरेंशियल इक्वेशंस) में लॉस वेट्स और अनिश्चितता परिमाणीकरण का कुशल, सैंपलिंग-मुक्त स्वचालित अनुकूलन सक्षम होता है।

Krzysztof M. Graczyk, Kornel Witkowski2026-05-12
🤖 machine learning

EchoAlign: Bridging Generative and Discriminative Learning under Noisy Labels

एकोअलाइन (EchoAlign) एक नवीन ढांचा है जो जनरेटिव और डिस्क्रिमिनेटिव लर्निंग के बीच सेतु बनाकर शोर वाले लेबल (noisy labels) के विरुद्ध मजबूती को बढ़ाता है, जहाँ यह संरचनात्मक अखंडता को बनाए रखते हुए और विश्वसनीय नमूनों को सुरक्षित रखते हुए, शोर वाले पर्यवेक्षण लक्ष्यों (supervision targets) के साथ संरेखित करने के लिए इंस्टेंस फीचर्स को संशोधित करता है, जिससे यह मौजूदा अत्याधुनिक विधियों से बेहतर प्रदर्शन करता है।

Yuxiang Zheng, Zhongyi Han, Yilong Yin2026-05-12
🤖 machine learning

Explaining Graph Neural Networks for Node Similarity on Graphs

यह शोध पत्र ग्राफ पर एक्सप्लेनेबल सिमिलरिटी सर्च (explainable similarity search) की जांच करता है, जिसमें ग्राफ न्यूरल नेटवर्क के लिए म्यूचुअल इंफॉर्मेशन और ग्रेडिएंट-आधारित स्पष्टीकरण विधियों का मूल्यांकन करते हुए यह प्रदर्शित किया गया है कि ग्रेडिएंट-आधारित दृष्टिकोण नोड सिमिलरिटी स्कोर के लिए बेहतर एक्शनबल (actionable), सुसंगत और स्पारसिफिएबल (sparsifiable) स्पष्टीकरण प्रदान करते हैं।

Daniel Daza, Cuong Xuan Chu, Trung-Kien Tran, Daria Stepanova, Michael Cochez, Paul Groth2026-05-12
🤖 machine learning

SINDyG: Sparse Identification of Nonlinear Dynamical Systems from Graph-Structured Data, with Applications to Stuart-Landau Oscillator Networks

यह शोध पत्र SINDyG प्रस्तुत करता है, जो एक नवीन विधि है जो ग्राफ-संरचित गतिशील प्रणालियों के लिए गवर्निंग समीकरणों की सटीक पहचान करने हेतु स्पार्स रिग्रेशन में नेटवर्क संरचना को एकीकृत करती है, और स्टुअर्ट-लैंडौ ऑसिलेटर नेटवर्क को मॉडल करने में पारंपरिक SINDy दृष्टिकोणों की तुलना में बेहतर प्रदर्शन प्रदर्शित करती है।

Mohammad Amin Basiri, Sina Khanmohammadi2026-05-12
🔢 mathematics

Equivariant score-based generative models provably learn distributions with symmetries efficiently

यह शोध पत्र यह सिद्ध करते हुए कि इक्विवेरिएंट इंडक्टिव बायस (equivariant inductive bias) को शामिल करने से बेहतर जनरलाइजेशन बाउंड्स प्राप्त होते हैं और गैर-इक्विवेरिएंट दृष्टिकोणों की तुलना में डेटा ऑग्मेंटेशन की आवश्यकता समाप्त हो जाती है, यह पहला सैद्धांतिक आश्वासन प्रदान करता है कि इक्विवेरिएंट स्कोर-आधारित जनरेटिव मॉडल सममित वितरणों (symmetric distributions) को कुशलतापूर्वक सीखते हैं।

Ziyu Chen, Markos A. Katsoulakis, Benjamin J. Zhang2026-05-12