🔢 mathematics

Theory of Minimal Weight Perturbations in Deep Networks and its Applications for Low-Rank Activated Backdoor Attacks

यह शोध पत्र आउटपुट परिवर्तनों पर सैद्धांतिक सीमाएँ स्थापित करने के लिए डीप न्यूरल नेटवर्क में न्यूनतम भार वाले व्यवधानों (minimal weight perturbations) के सटीक सूत्र व्युत्पन्न करता है, और इन निष्कर्षों को यह प्रदर्शित करने के लिए लागू करता है कि लो-रैंक संपीड़न (low-rank compression) मॉडल की सटीकता को बनाए रखते हुए विश्वसनीय रूप से लेटेंट बैकडोर्स को सक्रिय कर सकता है और हमले की विफलता के लिए प्रमाणिक सीमाएं निर्धारित कर सकता है।

Bethan Evans, Jared Tanner2026-05-19
📊 statistics

The Powers of Precision: Structure-Informed Detection in Complex Systems -- From Customer Churn to Seizure Onset

यह शोधपत्र एक संरचना-सूचित मशीन लर्निंग पद्धति प्रस्तावित करता है जो जटिल प्रणालियों, जैसे कि मिर्गी के दौरों और ग्राहक मंथन (customer churn), में उभरती महत्वपूर्ण घटनाओं के शीघ्र पता लगाने और व्याख्या योग्य पहचान के लिए इष्टतम फीचर प्रतिनिधित्व सीखने हेतु कोवेरिएंस या प्रिसिजन मैट्रिक्स की ट्यूनेबल फैमिली का उपयोग करती है।

Augusto Santos, Teresa Santos, Catarina Rodrigues, José M. F. Moura2026-05-19
🤖 machine learning

Factored Causal Representation Learning for Robust Reward Modeling in RLHF

यह शोध पत्र एक फैक्टर्ड कॉज़ल रिप्रेजेंटेशन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो मॉडल एम्बेडिंग्स को कॉज़ल और नॉन-कॉज़ल कारकों में विभाजित करता है ताकि रिवॉर्ड प्रेडिक्शन को कॉज़ल सिग्नल्स तक सीमित किया जा सके, जिससे लेंथ बायस और साइकोफैंसी जैसे स्प्यूरियस कोरिलेशन को कम करके RLHF की मजबूती और प्रदर्शन में सुधार किया जा सके।

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Fan Feng, Biwei Huang, Shikui Tu, Lei Xu2026-05-19
🤖 machine learning

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

यह शोध पत्र LaDi-RL का प्रस्ताव करता है, जो एक सुव्यवस्थित तर्क प्रक्षेप पथ (reasoning trajectories) उत्पन्न करने के लिए लेटेंट डिफ्यूजन मॉडल का उपयोग करता है और पदानुक्रमित लेटेंट-टेक्स्ट रोलआउट्स (hierarchical latent-text rollouts) को नियोजित करता है ताकि लेटेंट प्लानिंग की गुणवत्ता को टेक्स्ट डिकोडिंग त्रुटियों से अलग किया जा सके, जिससे एंट्रॉपी कोलैप्स (entropy collapse) को रोका जा सके और कोड एवं गणितीय तर्क कार्यों पर पारंपरिक टोकन-स्तरीय RL की तुलना में काफी बेहतर प्रदर्शन किया जा सके।

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin2026-05-19
📊 statistics

ST-BCP: Tightening Coverage Bound for Backward Conformal Prediction via Non-Conformity Score Transformation

यह शोध पत्र ST-BCP प्रस्तुत करता है, जो एक नवीन विधि है जो बैकवर्ड कॉन्फॉर्मल प्रेडिक्शन (Backward Conformal Prediction) में नॉन-कन्फॉर्मिटी स्कोर के डेटा-डिपेंडेंट ट्रांसफॉर्मेशन का उपयोग करके कवरेज बाउंड को महत्वपूर्ण रूप से सघन करती है, जिससे अनुमानित और अनुभवजन्य कवरेज के बीच का अंतर 4.20% से घटकर 1.12% रह जाता है।

Junxian Liu, Hao Zeng, Hongxin Wei2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

यह शोध पत्र डीप डेटा रिसर्च (DDR) और इसके संगत बेंचमार्क, DDR-Bench को प्रस्तुत करता है, जो कच्चे डेटा से स्वायत्त रूप से अंतर्दृष्टि निकालने में एजेंटिक लार्ज लैंग्वेज मॉडल्स की खोजी बुद्धिमत्ता का मूल्यांकन करता है, और यह प्रकट करता है कि जबकि फ्रंटियर मॉडल्स उभरती हुई एजेंसी प्रदर्शित करते हैं, प्रभावी लॉन्ग-होरिजन अन्वेषण के लिए केवल स्केलिंग या स्कैफोल्डिंग से परे आंतरिक रणनीतियों की आवश्यकता होती है।

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
⚡ electrical engineering

Adaptive Control in Autonomous Driving via Real-Time Recurrent RL

यह शोध पत्र स्वायत्त ड्राइविंग के लिए एक अनुकूली नियंत्रण ढांचे (adaptive control framework) को प्रस्तुत करता है जो ऑफलाइन बिहेवियरल क्लोनिंग को LrcSSM का उपयोग करके ऑनलाइन रियल-टाइम रिकरेंट रीइन्फोर्समेंट लर्निंग (RTRRL) फाइन-ट्यूनिंग के साथ जोड़ता है, जो कार रेसिंग सिमुलेशन और इवेंट कैमरा से लैस 1:10-स्केल रोबोरेसर प्लेटफॉर्म पर वास्तविक दुनिया के प्रयोगों, दोनों में वितरण बदलावों (distribution shifts) के प्रति बेहतर नीति अनुकूलन को सफलतापूर्वक प्रदर्शित करता है।

Julian Lemmel, Felix Resch, Mónika Farsang, Ramin Hasani, Daniela Rus, Radu Grosu2026-05-19
📊 statistics

SC3D: Dynamic and Differentiable Causal Discovery for Temporal and Instantaneous Graphs

यह शोध पत्र SC3D को प्रस्तुत करता है, जो एक दो-चरणीय विभेदक (differentiable) ढांचा है जो मल्टीवेरिएट टाइम सीरीज़ से लैग-विशिष्ट (lag-specific) और तात्कालिक कारण संरचनाओं (instantaneous causal structures) को संयुक्त रूप से सीखता है, जो मौजूदा विधियों की तुलना में विविध सिंथेटिक और वास्तविक दुनिया के बेंचमार्क में डायनेमिक ग्राफ को रिकवर करने में बेहतर स्थिरता और सटीकता प्रदर्शित करता है।

Sourajit Das, Dibyajyoti Chakraborty, Romit Maulik2026-05-19
🔢 mathematics

Sparse Training of Neural Networks based on Multilevel Mirror Descent

यह शोध पत्र मल्टीलेवल मिरर डिसेंट पर आधारित एक डायनेमिक स्पार्स ट्रेनिंग एल्गोरिदम प्रस्तुत करता है जो अत्यधिक सटीक, स्पार्स मॉडल प्राप्त करने के लिए स्टैटिक और डायनेमिक स्पार्सिटी अपडेट्स के बीच बारी-बारी से कार्य करता है, जिससे मानक विधियों की तुलना में गणनात्मक लागत और प्रशिक्षण समय में काफी कमी आती है।

Yannick Lunk, Sebastian J. Scott, Leon Bungert2026-05-19
🤖 machine learning

Mitigating Conversational Inertia in Multi-Turn Agents

यह शोधपत्र मल्टी-टर्न एलएलएम (LLM) एजेंटों में "कन्वर्सेशनल इनर्शिया" (संवादात्मक जड़ता) की पहचान करता है, जहाँ मॉडल त्रुटिवश अपनी ही पिछली प्रतिक्रियाओं की नकल करते हैं, और एक 'कॉन्टेक्स्ट प्रेफरेंस लर्निंग' (संदर्भ प्राथमिकता शिक्षण) ढांचे का प्रस्ताव करता है जो मॉडल को कम-जड़ता वाले कार्यों को प्राथमिकता देने के लिए कैलिब्रेट करता है, जिससे विभिन्न एजेंटिक वातावरणों में प्रदर्शन सुधारने के लिए अन्वेषण (exploration) और दोहन (exploitation) के बीच संतुलन बनाया जा सके।

Yang Wan, Zheng Cao, Zhenhao Zhang, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu2026-05-19