🤖 machine learning

GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents

यह शोध पत्र GROW को प्रस्तुत करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो संदर्भ लंबाई की सीमाओं को दूर करने के लिए पूर्ण प्रक्षेप पथों (trajectories) को अवस्था-क्रिया नमूनों (state-action samples) में विघटित करके ओपन-वर्ल्ड विजन-लैंग्वेज मॉडल एजेंटों के लिए ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) को अनुकूलित करता है, जिससे 800 से अधिक माइनक्राफ्ट कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Xiongbin Wu, Zhihao Luo, Shanzhe Lei, Lechao Zhang, Xuhong Wang, Jie Yang, Zhonglong Zheng, Yuanjie Zheng, Xin Tan, Wei (…)2026-05-21
🤖 machine learning

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE एक नवीन निरंतर शिक्षण (continual learning) ढांचा है जो स्थिरता-संरक्षण रूटिंग (consistency-preserving routing) और लक्षित नियमितीकरण (targeted regularization) के माध्यम से स्थिर विशेषज्ञों में कार्य-विशिष्ट अपडेट के एकीकरण को निर्देशित करने के लिए एक क्षणिक विशेषज्ञ (transient expert) का उपयोग करके LLMs और VLMs में विनाशकारी विस्मृति (catastrophic forgetting) को कम करता है, जिससे ज्ञान हस्तांतरण और पैरामीटर स्थिरता के बीच संतुलन बनाते हुए अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

Yang Liu, Toan Nguyen, Flora D. Salim2026-05-21
🤖 machine learning

Graph Transductive Sharpening: Leveraging Unlabeled Predictions in Node Classification

यह शोध पत्र 'ट्रांसडक्टिव शार्पनिंग' (Transductive Sharpening) को प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण उद्देश्य है जो अनलेबल नोड्स पर प्रेडिक्शन एंट्रॉपी (prediction entropy) को कम करके और लेबल वाले नोड्स पर इस प्रभाव को संतुलित करके सेमी-सुपरवाइज्ड नोड वर्गीकरण में सुधार करता है, जिससे अंतर्निहित आर्किटेक्चर को संशोधित किए बिना प्रदर्शन को बढ़ाने के लिए अनलेबल प्रेडिक्शन्स का लाभ उठाया जा सके।

Brown Zaz, Mar Gonzàlez I Català, Ferran Hernandez Caralt, Moshe Eliasof, Pietro Liò2026-05-21
🤖 machine learning

Automated Kernel Discovery Towards Understanding High-dimensional Bayesian Optimization

यह शोध पत्र कर्नेल डिस्कवरी (Kernel Discovery) का परिचय देता है, जो एक LLM-संचालित विकासवादी ढांचा (evolutionary framework) है जो कच्चे अवलोकनों (raw observations) पर निर्भर हुए बिना एक व्यापक गणितीय स्थान की खोज करके उच्च-आयामी बायेसियन अनुकूलन (Bayesian optimization) में मौजूदा स्वचालित कर्नेल डिजाइन की सीमाओं को दूर करता है, और बेंचमार्क पर 17 में से 1.2 की औसत रैंक के साथ बेहतर प्रदर्शन प्राप्त करता है।

Taeyoung Yun, Woocheol Shin, Inhyuck Song, Jaewoo Lee, Jinkyoo Park2026-05-21
🤖 machine learning

Physics-informed convolutional neural networks for fluid flow through porous media

यह शोध पत्र एक भौतिकी-सूचित कनवल्शनल न्यूरल नेटवर्क फ्रेमवर्क प्रस्तुत करता है जो प्रशिक्षण प्रक्रिया में भौतिक बाधाओं को एकीकृत करके जटिल सरंध्र माध्यमों (पोरस मीडिया) में पोर-स्केल वेग क्षेत्रों की सटीक भविष्यवाणी करता है, जिससे बेहतर प्रारंभिक स्थितियों के माध्यम से लैटिस-बोल्ट्ज़मैन सिमुलेशन के महत्वपूर्ण त्वरण को सक्षम बनाया जा सके।

Rafał Topolnicki, Paweł Dłotko, Maciej Matyka2026-05-21
🤖 machine learning

Multi-Agent Reinforcement Learning for Safe Autonomous Driving Under Pedestrian Behavioral Uncertainty

यह शोध पत्र एक मल्टी-एजेंट सुदृढीकरण शिक्षण (Multi-Agent Reinforcement Learning) ढांचे का प्रस्ताव करता है जो छिपे हुए व्यक्तित्व लक्षणों वाले पैदल यात्रियों के साथ स्वायत्त वाहनों को सह-प्रशिक्षित करता है, और यह प्रदर्शित करता है कि यह दृष्टिकोण नियम-आधारित बेसलाइन और एकल-एजेंट प्रशिक्षण की तुलना में अधिक यथार्थवादी इंटरेक्शन परिदृश्य उत्पन्न करता है और टकराव की दरों को महत्वपूर्ण रूप से कम करता है।

Prakash Aryan, Kaushik Raghupathruni, Timo Kehrer, Sebastiano Panichella2026-05-21
🤖 machine learning

It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs

यह शोध पत्र SELFCI को प्रस्तुत करता है, जो एक पूरक स्व-विमर्दीकरण (self-distillation) ढांचा है जो 'प्रोडक्ट-ऑफ-एक्सपर्ट्स' दृष्टिकोण के माध्यम से कार्य प्रदर्शन और प्रासंगिक अखंडता (contextual-integrity) को संयुक्त रूप से अनुकूलित करके लार्ज लैंग्वेज मॉडल्स में गोपनीयता-उपयोगिता के बीच के संतुलन को हल करता है, और महंगी बाहरी पर्यवेक्षण की आवश्यकता के बिना मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

Sangwoo Park, Woongyeong Yeo, Seanie Lee, Yumin Choi, Hyomin Lee, Kangsan Kim, Jinheon Baek, Seong Joon Oh, Sung Ju Hwan (…)2026-05-21
🤖 machine learning

Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

क्रॉनिकल (Chronicle) एक सघन, 324M-पैरामीटर वाला डिकोडर-ओनली ट्रांसफार्मर है जिसे एक एकीकृत आर्किटेक्चर के भीतर प्राकृतिक भाषा और टाइम सीरीज़ दोनों पर शून्य से प्रशिक्षित किया गया है, जो प्रीट्रेन मॉडल के पोस्ट-हॉक अनुकूलन पर निर्भर किए बिना दोनों डोमेन में प्रतिस्पर्धी प्रदर्शन और बेहतर मल्टीमॉडल पूर्वानुमान क्षमताओं को प्राप्त करता है।

Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu2026-05-21
📊 statistics

Multi-Head Attention as Ensemble Nadaraya-Watson Estimation: Variance Reduction, Decorrelation, and Optimal Head Diversity

यह शोधपत्र एक कठोर सांख्यिकीय ढांचे को स्थापित करता है जो यह सिद्ध करता है कि मल्टी-हेड अटेंशन, नदरया-वाट्सन अनुमानकों (Nadaraya-Watson estimators) के एक डिकोरिलेटेड एन्सेम्बल के रूप में कार्य करता है, जहाँ हेड डाइवर्सिटी इंडेक्स यह परिमाणीकरण करता है कि कैसे ऑर्थोगोनल प्रोजेक्शन सबस्पेस वेरिएन्स को कम करते हैं और माध्य वर्ग त्रुटि (mean squared error) को न्यूनतम करने के लिए इष्टतम आर्किटेक्चरल स्केलिंग लॉज़ को निर्धारित करते हैं।

Ernest Fokoué2026-05-21
🤖 machine learning

Modality-Decoupled Online Recursive Editing

यह शोध पत्र M-ORE को प्रस्तुत करता है, जो एक मोडैलिटी-डिकपल्ड ऑनलाइन रिकर्सिव एडिटर है जो टेक्स्ट और विजुअल घटकों के लिए अलग-अलग लोकैलिटी सांख्यिकी (locality statistics) बनाए रखकर और क्रॉस-मोडल संघर्ष एवं इंटर-एडिट हस्तक्षेप को कम करने के लिए एक निश्चित ऑर्थोगोनल लो-रैंक सबस्पेस में निरंतर अपडेट करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स के कुशल और विश्वसनीय लाइफलोंग एडेप्टेशन को सक्षम बनाता है।

Siyuan Li, Youyuan Zhang, Fangming Liu, Jing Li2026-05-21