🤖 machine learning

Reinforcement Learning for Reachability: Guaranteeing Asymptotic Optimality

यह शोध पत्र एक पुनरावृत्ति दृष्टिकोण (iterative approach) प्रस्तावित करता है जो अज्ञात MDP मापदंडों को PAC लर्निंग शर्तों को संतुष्ट करने के लिए परिष्कृत करता है, जिससे एसिम्प्टोटिक अनुकूलता (asymptotic optimality) की गारंटी मिलती है और पहुंच योग्यता विशिष्टताओं (reachability specifications) के लिए सुदृढीकरण शिक्षण (reinforcement learning) की अभिसरण गतिशीलता (convergence dynamics) में गहरी सैद्धांतिक अंतर्दृष्टि प्रदान होती है।

Amogh Palasamudram, Jakub Svoboda, Suguman Bansal, Krishnendu Chatterjee2026-05-26
🤖 machine learning

Aligning Molecular Graph Explanations with Chemical Identity via InChIfied Invariants

यह शोध पत्र "InChIfied Invariants" प्रस्तुत करता है, जो इंटरनेशनल केमिकल आइडेंटिफायर (InChI) पर आधारित आणविक ग्राफ विशेषताओं का एक नया वर्ग है जो यह सुनिश्चित करता है कि मशीन लर्निंग भविष्यवाणियाँ और स्पष्टीकरण रासायनिक रूप से समकक्ष लेकिन संरचनात्मक रूप से भिन्न ग्राफ निरूपणों में सुसंगत रहें, जो अपनी भविष्य कहने वाली सटीकता बनाए रखते हुए स्थिरता के मामले में मानक डेलाइट (Daylight) इनवेरियंट्स से काफी बेहतर प्रदर्शन करते हैं।

Emanuele Guidotti, Sara Puglioli2026-05-26
🤖 machine learning

Bilevel Optimization of Synthetic Trajectories for Multi-Turn LLM Fine-Tuning

यह शोध पत्र BOOST को प्रस्तुत करता है, जो एक बाइलेवल ऑप्टिमाइज़ेशन फ्रेमवर्क है जो वास्तविक वैलिडेशन डेटा पर एक लाइटवेट हेड को ऑप्टिमाइज़ करके, विषम सिंथेटिक मल्टी-टर्न ट्रेजेक्टरीज को पुन: भारित (reweight) करना स्वचालित रूप से सीखता है ताकि LLM फाइन-ट्यूनिंग के लिए, जिससे बाहरी जजों की आवश्यकता के बिना विविधता और गुणवत्ता को संतुलित करते हुए मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जा सके।

Shresth Verma, Mauricio Tec, Cheol Woo Kim, Kai Wang, Milind Tambe2026-05-26
📊 statistics

How Neural Reward Models Learn Features for Policy Optimization: A Single-Index Analysis

यह शोध पत्र एक गॉसियन सिंगल-इंडेक्स फ्रेमवर्क के भीतर एक टू-स्टेज न्यूरल रिवॉर्ड मॉडल का विश्लेषण करता है ताकि यह प्रदर्शित किया जा सके कि एक्सपोनेंशियल रिवॉर्ड वेटिंग किस प्रकार प्रथम परत में फीचर रिकवरी को प्रभावित करती है और पॉलिसी वैल्यू गैप्स पर स्पष्ट तापमान-निर्भर सीमाएं स्थापित करती है, जिससे अनुकूलन लाभों और सीखने की लागतों के बीच संतुलन बनाने वाले परिनियोजन तापमानों की एक स्वीकार्य सीमा की पहचान की जा सके।

Rei Higuchi, Ryotaro Kawata, Akifumi Wachi, Shokichi Takakura, Kohei Miyaguchi, Taiji Suzuki2026-05-26
🤖 machine learning

A computational phase transition for learning-to-sample from Ising models

यह शोध पत्र बाउंडेड-विड्थ आइसिंग मॉडल्स (bounded-width Ising models) के स्पेक्ट्रल थ्रेशोल्ड (spectral threshold) पर लर्निंग-टू-सैंपल (learning-to-sample) के लिए एक तीव्र कम्प्यूटेशनल फेज ट्रांजिशन (computational phase transition) स्थापित करता है, जो यह प्रदर्शित करता है कि जबकि पैरामीटर लर्निंग (parameter learning) सुलभ बना रहता है, इस थ्रेशोल्ड के ठीक परे सैंपलिंग मानक क्रिप्टोग्राफिक धारणाओं (standard cryptographic assumptions) के तहत कम्प्यूटेशनल रूप से कठिन हो जाता है, जो किसी भी कुशल शिक्षार्थी को या तो प्रशिक्षण डेटा को याद करने या नगण्य-प्रायिकता वाली कॉन्फ़िगरेशन (negligible-probability configurations) को मतिभ्रम (hallucinate) करने के लिए मजबूर करता है।

Andrej Risteski, Thuy-Duong Vuong2026-05-26
💻 computer science

Motion-Compensated Weight Compression

यह शोध पत्र मोशन-कंपनसेटेड वेट कम्प्रेशन (MCWC) का प्रस्ताव करता है, जो एक वेट-ओनली कोडेक है जो न्यूरल नेटवर्क परिनियोजन के लिए रेट-एक्यूरेसी ट्रेड-ऑफ को महत्वपूर्ण रूप से सुधारने के लिए परम्यूटेशन सिमिट्री अलाइनमेंट और लेयर-सीक्वेंशियल प्रेडिक्शन का लाभ उठाता है।

Ismail Lamaakal2026-05-26
🤖 machine learning

A Contractive Feedback Semantics for Reinforcement Learning

यह शोध पत्र डिस्काउंटेड रिइन्फोर्समेंट लर्निंग के लिए एक कंपोजिशनल सिमेंटिक्स प्रस्तावित करता है जो एक-चरणीय निर्णय प्रक्रियाओं को ओपन स्टोकेस्टिक घटकों के रूप में मानता है, जिससे घटक तुल्यता के लिए कॉन्टेक्स्टुअल कॉन्ग्रुएंस (संदर्भगत संगति), स्टेट एब्स्ट्रैक्शंस के लिए स्पष्ट सीमाएँ, और क्वांटेल-वैल्यूड कॉन्ट्रैक्ट्स के माध्यम से सुरक्षा एवं संसाधन विनिर्देशों को लिफ्ट करने के लिए एक ढांचा स्थापित करने हेतु कॉन्ट्रैक्टिव फीडबैक लूप्स के माध्यम से अनंत-क्षितिज नीति मूल्यांकन को सक्षम किया जा सके।

Zuyuan Zhang2026-05-26
🔬 physics

Hermite-NGP: Gradient-Augmented Hash Encoding for Learning PDEs

यह शोध पत्र Hermite-NGP को प्रस्तुत करता है, जो एक ग्रेडिएंट-ऑगमेंटेड मल्टी-रेज़ोल्यूशन हैश एनकोडिंग है जो ग्रिड वर्टिसेस पर फलन मानों (function values) और मिश्रित आंशिक अवकलजों (mixed partial derivatives) को संग्रहीत करता है ताकि पूर्णतः विश्लेषणात्मक अवकलज मूल्यांकन और एक मल्टीग्रिड-शैली के करिकुलम को सक्षम बनाया जा सके, जिससे मौजूदा न्यूरल PDE सॉल्वर की तुलना में काफी कम त्रुटियां और तेज़ अभिसरण (convergence) प्राप्त होता है।

Jinjin He, Zhiqi Li, Sinan Wang, Bo Zhu2026-05-26
🤖 machine learning

Complement Submodular Information Measures for Balanced and Robust Data Selection

यह शोध पत्र कॉम्प्लीमेंट सबमॉड्यूलर इंफॉर्मेशन (CSI) प्रस्तुत करता है, जो उद्देश्यों का एक नया वर्ग है जो संतुलित, सुदृढ़ डेटा चयन प्राप्त करने के लिए एक चयनित उपसमुच्चय (subset) और उसके पूरक (complement) के बीच संरचनात्मक संबंधों को मापता है, जिसमें लगभग इष्टतम ग्रीडी एप्रोक्सिमेशन गारंटी और बेहतर डाउनस्ट्रीम प्रदर्शन मिलता है।

Rishabh Iyer2026-05-26
🤖 machine learning

The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

यह शोध पत्र "परसेप्शन-फिजिक्स पैराडॉक्स" (Perception-Physics Paradox) को प्रस्तुत करता है ताकि यह रेखांकित किया जा सके कि कैसे विजन फाउंडेशन मॉडल्स अक्सर वैज्ञानिक डोमेन में भौतिक अपरिवर्तनीयताओं (physical invariants) के बजाय दृश्य सहसंबंधों (visual correlations) पर निर्भर करते हैं, और संरचनात्मक समरूपता (structural isomorphism) के माध्यम से "वैज्ञानिक संरेखण" (scientific alignment) का प्रस्ताव देता है तथा नए TC-Bench डेटासेट के माध्यम से यह प्रदर्शित करता है कि वर्तमान मॉडल उच्च भविष्य कहनेवाला प्रदर्शन (predictive performance) के बावजूद चरम स्थितियों (extreme regimes) में सही ढंग से तर्क करने में विफल रहते हैं।

Dingling Yao, Andrea Polesello, Adeel Pervez, Caroline Muller, Francesco Locatello2026-05-26