🤖 machine learning

Streaming Reinforcement Learning under Partial Observability with Real-Time Recurrent Learning

यह शोध पत्र रिकरेंट ट्रेस यूनिट्स (recurrent trace units) का परिचय देता है, जो एक डायगोनल रिकरेंट आर्किटेक्चर है जो रैखिक जटिलता के साथ सटीक रियल-टाइम रिकरेंट लर्निंग को सक्षम बनाता है, जिससे स्ट्रीमिंग सुदृढीकरण लर्निंग (reinforcement learning) एजेंटों को बिना रीप्ले बफ़र्स या बैच अपडेट पर निर्भर हुए, आंशिक दृश्यता (partial observability) और दीर्घकालिक निर्भरताओं को प्रभावी ढंग से संभालने की अनुमति मिलती है।

Noah Farr, Aryaman Reddi, Carlo D'Eramo, Jan Peters2026-05-26
🤖 machine learning

Hardware-Aware Federated Learning for Speech Emotion Recognition

यह शोधपत्र एक हार्डवेयर-जागरूक फेडरेटेड लर्निंग फ्रेमवर्क प्रस्तावित करता है जो विषम एज डिवाइसेस पर स्पीच इमोशन रिकग्निशन के लिए प्रतिस्पर्धी सटीकता बनाए रखते हुए प्रशिक्षण समय और संचार लागत को महत्वपूर्ण रूप से कम करने के लिए हार्डवेयर प्रोफाइलिंग, टॉप-K क्लाइंट चयन और एडेप्टिव लोकल एपोक्स को एकीकृत करता है।

Beyazit Bestami Yuksel, Emrah Dikbiyik2026-05-26
🤖 machine learning

Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality

यह शोध पत्र एक पुनरावृत्ति दृष्टिकोण (iterative approach) प्रस्तावित करता है जो अज्ञात MDP मापदंडों को PAC लर्निंग शर्तों को संतुष्ट करने के लिए परिष्कृत करता है, जिससे एसिम्प्टोटिक अनुकूलता (asymptotic optimality) की गारंटी मिलती है और पहुंच योग्यता विशिष्टताओं (reachability specifications) के लिए सुदृढीकरण शिक्षण (reinforcement learning) की अभिसरण गतिशीलता (convergence dynamics) में गहरी सैद्धांतिक अंतर्दृष्टि प्रदान होती है।

Amogh Palasamudram, Jakub Svoboda, Suguman Bansal, Krishnendu Chatterjee2026-05-26
🤖 machine learning

Aligning Molecular Graph Explanations with Chemical Identity via InChIfied Invariants

यह शोध पत्र "InChIfied Invariants" प्रस्तुत करता है, जो इंटरनेशनल केमिकल आइडेंटिफायर (InChI) पर आधारित आणविक ग्राफ विशेषताओं का एक नया वर्ग है जो यह सुनिश्चित करता है कि मशीन लर्निंग भविष्यवाणियाँ और स्पष्टीकरण रासायनिक रूप से समकक्ष लेकिन संरचनात्मक रूप से भिन्न ग्राफ निरूपणों में सुसंगत रहें, जो अपनी भविष्य कहने वाली सटीकता बनाए रखते हुए स्थिरता के मामले में मानक डेलाइट (Daylight) इनवेरियंट्स से काफी बेहतर प्रदर्शन करते हैं।

Emanuele Guidotti, Sara Puglioli2026-05-26
🤖 machine learning

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

यह शोध पत्र BOOST को प्रस्तुत करता है, जो एक बाइलेवल ऑप्टिमाइज़ेशन फ्रेमवर्क है जो वास्तविक वैलिडेशन डेटा पर एक लाइटवेट हेड को ऑप्टिमाइज़ करके, विषम सिंथेटिक मल्टी-टर्न ट्रेजेक्टरीज को पुन: भारित (reweight) करना स्वचालित रूप से सीखता है ताकि LLM फाइन-ट्यूनिंग के लिए, जिससे बाहरी जजों की आवश्यकता के बिना विविधता और गुणवत्ता को संतुलित करते हुए मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जा सके।

Shresth Verma, Mauricio Tec, Cheol Woo Kim, Kai Wang, Milind Tambe2026-05-26
📊 statistics

How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis

यह शोध पत्र एक गॉसियन सिंगल-इंडेक्स फ्रेमवर्क के भीतर एक टू-स्टेज न्यूरल रिवॉर्ड मॉडल का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि एक्सपोनेंशियल रिवॉर्ड वेटिंग किस प्रकार प्रथम परत में फीचर रिकवरी को प्रभावित करती है और पॉलिसी वैल्यू गैप्स पर स्पष्ट तापमान-निर्भर सीमाएं स्थापित करती है, जिससे अनुकूलन लाभों और सीखने की लागतों के बीच संतुलन बनाने वाले परिनियोजन तापमानों की एक स्वीकार्य सीमा की पहचान की जा सके।

Rei Higuchi, Ryotaro Kawata, Akifumi Wachi, Shokichi Takakura, Kohei Miyaguchi, Taiji Suzuki2026-05-26
🤖 machine learning

A computational phase transition for learning-to-sample from Ising models

यह शोध पत्र बाउंडेड-विड्थ आइसिंग मॉडल्स (bounded-width Ising models) के स्पेक्ट्रल थ्रेशोल्ड (spectral threshold) पर लर्निंग-टू-सैंपल (learning-to-sample) के लिए एक तीव्र कम्प्यूटेशनल फेज ट्रांजिशन (computational phase transition) स्थापित करता है, जो यह प्रदर्शित करता है कि जबकि पैरामीटर लर्निंग (parameter learning) सुलभ बना रहता है, इस थ्रेशोल्ड के ठीक परे सैंपलिंग मानक क्रिप्टोग्राफिक धारणाओं (standard cryptographic assumptions) के तहत कम्प्यूटेशनल रूप से कठिन हो जाता है, जो किसी भी कुशल शिक्षार्थी को या तो प्रशिक्षण डेटा को याद करने या नगण्य-प्रायिकता वाली कॉन्फ़िगरेशन (negligible-probability configurations) को मतिभ्रम (hallucinate) करने के लिए मजबूर करता है।

Andrej Risteski, Thuy-Duong Vuong2026-05-26
💻 computer science

Motion-Compensated Weight Compression

यह शोध पत्र मोशन-कंपनसेटेड वेट कम्प्रेशन (MCWC) का प्रस्ताव करता है, जो एक वेट-ओनली कोडेक है जो न्यूरल नेटवर्क परिनियोजन के लिए रेट-एक्यूरेसी ट्रेड-ऑफ को महत्वपूर्ण रूप से सुधारने के लिए परम्यूटेशन सिमिट्री अलाइनमेंट और लेयर-सीक्वेंशियल प्रेडिक्शन का लाभ उठाता है।

Ismail Lamaakal2026-05-26
🤖 machine learning

A Contractive Feedback Semantics for Reinforcement Learning

यह शोध पत्र डिस्काउंटेड रिइन्फोर्समेंट लर्निंग के लिए एक कंपोजिशनल सिमेंटिक्स प्रस्तावित करता है जो एक-चरणीय निर्णय प्रक्रियाओं को ओपन स्टोकेस्टिक घटकों के रूप में मानता है, जिससे घटक तुल्यता के लिए कॉन्टेक्स्टुअल कॉन्ग्रुएंस (संदर्भगत संगति), स्टेट एब्स्ट्रैक्शंस के लिए स्पष्ट सीमाएँ, और क्वांटेल-वैल्यूड कॉन्ट्रैक्ट्स के माध्यम से सुरक्षा एवं संसाधन विनिर्देशों को लिफ्ट करने के लिए एक ढांचा स्थापित करने हेतु कॉन्ट्रैक्टिव फीडबैक लूप्स के माध्यम से अनंत-क्षितिज नीति मूल्यांकन को सक्षम किया जा सके।

Zuyuan Zhang2026-05-26
🔬 physics

Hermite-NGP: Gradient-Augmented Hash Encoding for Learning PDEs

यह शोध पत्र Hermite-NGP को प्रस्तुत करता है, जो एक ग्रेडिएंट-ऑगमेंटेड मल्टी-रेज़ोल्यूशन हैश एनकोडिंग है जो ग्रिड वर्टिसेस पर फलन मानों (function values) और मिश्रित आंशिक अवकलजों (mixed partial derivatives) को संग्रहीत करता है ताकि पूर्णतः विश्लेषणात्मक अवकलज मूल्यांकन और एक मल्टीग्रिड-शैली के करिकुलम को सक्षम बनाया जा सके, जिससे मौजूदा न्यूरल PDE सॉल्वर की तुलना में काफी कम त्रुटियां और तेज़ अभिसरण (convergence) प्राप्त होता है।

Jinjin He, Zhiqi Li, Sinan Wang, Bo Zhu2026-05-26