🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

यह शोध पत्र LaDi-RL का प्रस्ताव करता है, जो एक सुव्यवस्थित तर्क प्रक्षेप पथ (reasoning trajectories) उत्पन्न करने के लिए लेटेंट डिफ्यूजन मॉडल का उपयोग करता है और पदानुक्रमित लेटेंट-टेक्स्ट रोलआउट्स (hierarchical latent-text rollouts) को नियोजित करता है ताकि लेटेंट प्लानिंग की गुणवत्ता को टेक्स्ट डिकोडिंग त्रुटियों से अलग किया जा सके, जिससे एंट्रॉपी कोलैप्स (entropy collapse) को रोका जा सके और कोड एवं गणितीय तर्क कार्यों पर पारंपरिक टोकन-स्तरीय RL की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin2026-05-19
📊 statistics

ST-BCP: Tightening Coverage Bound for Backward Conformal Prediction via Non-Conformity Score Transformation

यह शोध पत्र ST-BCP प्रस्तुत करता है, जो एक नवीन विधि है जो बैकवर्ड कॉन्फॉर्मल प्रेडिक्शन (Backward Conformal Prediction) में नॉन-कन्फॉर्मिटी स्कोर के डेटा-डिपेंडेंट ट्रांसफॉर्मेशन का उपयोग करके कवरेज बाउंड को महत्वपूर्ण रूप से सघन करती है, जिससे अनुमानित और अनुभवजन्य कवरेज के बीच का अंतर 4.20% से घटकर 1.12% रह जाता है।

Junxian Liu, Hao Zeng, Hongxin Wei2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

यह शोध पत्र डीप डेटा रिसर्च (DDR) और इसके संगत बेंचमार्क, DDR-Bench को प्रस्तुत करता है, जो कच्चे डेटा से स्वायत्त रूप से अंतर्दृष्टि निकालने में एजेंटिक लार्ज लैंग्वेज मॉडल्स की खोजी बुद्धिमत्ता का मूल्यांकन करता है, और यह प्रकट करता है कि जबकि फ्रंटियर मॉडल्स उभरती हुई एजेंसी प्रदर्शित करते हैं, प्रभावी लॉन्ग-होरिजन अन्वेषण के लिए केवल स्केलिंग या स्कैफोल्डिंग से परे आंतरिक रणनीतियों की आवश्यकता होती है।

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
⚡ electrical engineering

Adaptive Control in Autonomous Driving via Real-Time Recurrent RL

यह शोध पत्र स्वायत्त ड्राइविंग के लिए एक अनुकूली नियंत्रण ढांचे (adaptive control framework) को प्रस्तुत करता है जो ऑफलाइन बिहेवियरल क्लोनिंग को LrcSSM का उपयोग करके ऑनलाइन रियल-टाइम रिकरेंट रीइन्फोर्समेंट लर्निंग (RTRRL) फाइन-ट्यूनिंग के साथ जोड़ता है, जो कार रेसिंग सिमुलेशन और इवेंट कैमरा से लैस 1:10-स्केल रोबोरेसर प्लेटफॉर्म पर वास्तविक दुनिया के प्रयोगों, दोनों में वितरण बदलावों (distribution shifts) के प्रति बेहतर नीति अनुकूलन को सफलतापूर्वक प्रदर्शित करता है।

Julian Lemmel, Felix Resch, Mónika Farsang, Ramin Hasani, Daniela Rus, Radu Grosu2026-05-19
📊 statistics

SC3D: Dynamic and Differentiable Causal Discovery for Temporal and Instantaneous Graphs

यह शोध पत्र SC3D को प्रस्तुत करता है, जो एक दो-चरणीय विभेदक (differentiable) ढांचा है जो मल्टीवेरिएट टाइम सीरीज़ से लैग-विशिष्ट (lag-specific) और तात्कालिक कारण संरचनाओं (instantaneous causal structures) को संयुक्त रूप से सीखता है, जो मौजूदा विधियों की तुलना में विविध सिंथेटिक और वास्तविक दुनिया के बेंचमार्क में डायनेमिक ग्राफ को रिकवर करने में बेहतर स्थिरता और सटीकता प्रदर्शित करता है।

Sourajit Das, Dibyajyoti Chakraborty, Romit Maulik2026-05-19
🔢 mathematics

Sparse Training of Neural Networks based on Multilevel Mirror Descent

यह शोध पत्र मल्टीलेवल मिरर डिसेंट पर आधारित एक डायनेमिक स्पार्स ट्रेनिंग एल्गोरिदम प्रस्तुत करता है जो अत्यधिक सटीक, स्पार्स मॉडल प्राप्त करने के लिए स्टैटिक और डायनेमिक स्पार्सिटी अपडेट्स के बीच बारी-बारी से कार्य करता है, जिससे मानक विधियों की तुलना में गणनात्मक लागत और प्रशिक्षण समय में काफी कमी आती है।

Yannick Lunk, Sebastian J. Scott, Leon Bungert2026-05-19
🤖 machine learning

Mitigating Conversational Inertia in Multi-Turn Agents

यह शोधपत्र मल्टी-टर्न एलएलएम (LLM) एजेंटों में "कन्वर्सेशनल इनर्शिया" (संवादात्मक जड़ता) की पहचान करता है, जहाँ मॉडल त्रुटिवश अपनी ही पिछली प्रतिक्रियाओं की नकल करते हैं, और एक 'कॉन्टेक्स्ट प्रेफरेंस लर्निंग' (संदर्भ प्राथमिकता शिक्षण) ढांचे का प्रस्ताव करता है जो मॉडल को कम-जड़ता वाले कार्यों को प्राथमिकता देने के लिए कैलिब्रेट करता है, जिससे विभिन्न एजेंटिक वातावरणों में प्रदर्शन सुधारने के लिए अन्वेषण (exploration) और दोहन (exploitation) के बीच संतुलन बनाया जा सके।

Yang Wan, Zheng Cao, Zhenhao Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu2026-05-19
📊 statistics

Finite-Particle Rates for Regularized Stein Variational Gradient Descent

यह शोध पत्र रेगुलराइज्ड स्टीन वेरिएशनल ग्रेडिएंट डिसेंट (R-SVGD) एल्गोरिदम के लिए स्पष्ट गैर-एसिम्प्टोटिक परिमित-कण अभिसरण दरें स्थापित करता है, जो नियमितीकरण, स्टेप साइज और एवरेजिंग मापदंडों के सिद्धांतपूर्ण ट्यूनिंग के माध्यम से निरंतर-क्रम पूर्वाग्रह को ठीक करने और वास्तविक फिशर सूचना और वासरस्टीन दूरी में अभिसरण प्राप्त करने की इसकी क्षमता को प्रदर्शित करता है।

Ye He, Krishnakumar Balasubramanian, Sayan Banerjee, Promit Ghosal2026-05-19
🤖 machine learning

SuReNav: Superpixel Graph-based Constraint Relaxation for Navigation in Over-constrained Environments

SuReNav एक सुपरपिक्सेल ग्राफ-आधारित फ्रेमवर्क है जो अर्ध-स्थिर (semi-static) वातावरणों में मानव प्रदर्शनों पर प्रशिक्षित ग्राफ न्यूरल नेटवर्क का उपयोग करके क्षेत्रीय बाधाओं को शिथिल करता है, जिससे सिमुलेटेड और वास्तविक दुनिया के शहरी परिवेशों में सुरक्षित, कुशल और मानव-समान पथ नियोजन सक्षम होता है, और यह अर्ध-प्रतिबंधित नेविगेशन की समस्या का समाधान करता है।

Keonyoung Koh, Moonkyeong Jung, Samuel Seungsup Lee, Daehyung Park2026-05-19
🤖 AI

The Laplacian Keyboard: Beyond the Linear Span

यह शोध पत्र लैपलेसियन कीबोर्ड (Laplacian Keyboard) का परिचय देता है, जो एक पदानुक्रमित ढांचा (hierarchical framework) है जो लैपलेसियन आइजनवेक्टर्स (Laplacian eigenvectors) से व्यवहारों का एक कार्य-अज्ञेय लाइब्रेरी (task-agnostic library) निर्मित करता है और उन्हें गतिशील रूप से जोड़ने के लिए एक मेटा-पॉलिसी सीखता है, जिससे रैखिक विस्तार-आधारित (linear span-based) ज़ीरो-शॉट नियंत्रण की अभिव्यक्ति संबंधी सीमाओं को पार करने और सुदृढीकरण शिक्षण (reinforcement learning) में बेहतर नमूना दक्षता (sample efficiency) प्राप्त करने में सफलता मिलती है।

Siddarth Chandrasekar, Marlos C. Machado2026-05-19