📊 statistics

Proximal Policy Optimization for Amortized Discrete Sampling

यह शोध पत्र GFlowNets और एंट्रॉपी-रेगुलराइज्ड सुदृढीकरण शिक्षण (reinforcement learning) के बीच सैद्धांतिक संबंध स्थापित करता है ताकि विभिन्न बेंचमार्क पर संरचित असतत वितरणों (structured discrete distributions) से नमूने लेने के लिए स्टोकेस्टिक नीतियों को प्रशिक्षित करने हेतु प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) की बेहतर अभिसरण (convergence) और डेटा दक्षता को व्युत्पन्न और प्रदर्शित किया जा सके।

Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin, Nikita Morozov2026-06-16
🤖 machine learning

Mean-Field Parallel Decoding for Discrete Diffusion Language Models

यह शोध पत्र 'मीन-फील्ड पैरेलल डिकोडिंग' नामक एक प्रशिक्षण-मुक्त, हल्के फ्रेमवर्क को प्रस्तुत करता है जो युग्मवार इंटरेक्शन स्कोर के माध्यम से समानांतर टोकन अपडेट्स को समन्वित करके डिस्क्रीट डिफ्यूजन लैंग्वेज मॉडल्स को बेहतर बनाता है, जिससे बिना मॉडल पुनप्रशिक्षण के गुणवत्ता-विलंबता व्यापार-संतुलन (क्वालिटी-लेटेंसी ट्रेड-ऑफ) में सुधार होता है।

Tamim Zoabi, Ameen Ali, Liran Ringel, Lior Wolf2026-06-16
🤖 machine learning

Brownian Kernel Ladders

यह शोध पत्र ब्राउनियन कर्नेल लैडर्स (Brownian kernel ladders) को प्रस्तुत करता है, जो इंटीग्रल रिप्रोड्यूसिंग कर्नेल हिल्बर्ट स्पेस (integral reproducing kernel Hilbert spaces) का एक पुनरावर्ती रूप से परिभाषित पदानुक्रम है जो पदानुक्रमित संरचनात्मक निरूपणों (hierarchical compositional representations) को गणितीय रूप से औपचारिक बनाता है, और उनके विश्लेषणात्मक गुणों को स्थापित करता है, जिसमें गहराई-निर्भर नियमितता (depth-dependent regularity) और नियमितीकृत अनुभवजन्य जोखिम न्यूनीकरण (regularized empirical risk minimization) के लिए निकट-पैरामीट्रिक अतिरिक्त-जोखिम गारंटी शामिल है।

Mahdi Mohammadigohari, Giuseppe Di Fatta, Giuseppe Nicosia, Panos M Pardalos2026-06-16
🤖 machine learning

SILAGE: Memory-Efficient, Full-Gradient-Free Nonconvex Optimization for Nested Finite Sums

यह शोध पत्र SILAGE का प्रस्ताव करता है, जो नेस्टेड फाइनाइट सम्स (nested finite sums) पर नॉनकॉन्वेक्स ऑप्टिमाइज़ेशन के लिए एक मेमोरी-कुशल, फुल-ग्रेडिएंट-फ्री वेरियंस-रिड्यूस्ड एल्गोरिदम है, जो ग्लोबल फुल-ग्रेडिएंट रिफ्रेशेस को समाप्त करके O(n)\mathcal{O}(n) मेमोरी उपयोग प्राप्त करता है और नेस्टेड फंक्शनल सिमिलरिटीज के माध्यम से अपनी कन्वर्जेंस कॉम्प्लेक्सिटी को डेटा ज्योमेट्री के अनुरूप ढालता है।

Igor Sokolov, Laurent Condat, Peter Richtárik2026-06-16
📊 statistics

Learning a Sampling-Free Variational DNN Plugin from Tiny Training Sets to Refine OOD Segmentation With Uncertainty Estimation

यह शोध पत्र VarDeepPCA को पेश करता है, जो एक हल्का, सैंपलिंग-मुक्त वेरिएशनल DNN ढांचा है जो छोटे इन-डिस्ट्रीब्यूशन डेटासेट से अंतर्निहित ज्यामितीय पूर्ववृत्त (intrinsic geometric priors) सीखकर आउट-ऑफ-डिस्ट्रीब्यूशन मेडिकल सेगमेंटेशन को परिष्कृत करता है और अनिश्चितता अनुमान प्रदान करता है, जिससे अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के बिना शारीरिक सुसंगतता (anatomical plausibility) में सुधार होता है और त्रुटियों को कम किया जाता है।

Jimut B. Pal, Suyash P. Awate2026-06-16
⚡ electrical engineering

Early Anomaly-Onset Detection based on Wigner--Ville Distribution Slice Spectra: A Transmission-Grid Test Case

यह अध्ययन प्रदर्शित करता है कि हाई-वोल्टेज ग्रिड वेवफॉर्म्स में अनुक्रमिक विसंगति का पता लगाने के लिए फुल-वेक्टर विग्नर-विले डिस्ट्रीब्यूशन स्लाइस (WVDS) स्पेक्ट्रा का उपयोग करना, FFT-आधारित और ऑटोएनकोडर विधियों की तुलना में झूठे अलार्म को महत्वपूर्ण रूप से कम करता है, जो इसे ऑनलाइन निगरानी के लिए एक बेहतर दृष्टिकोण बनाता है जहाँ प्री-ऑनसेट फॉल्स पॉजिटिव्स को कम करना अत्यंत महत्वपूर्ण है।

Eduardo Jr Piedad, Eduardo Prieto-Araujo, Oriol Gomis-Bellmunt2026-06-16
🤖 AI

STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning

यह शोध पत्र STRIDE को प्रस्तुत करता है, जो एक सूक्ष्म-स्तरीय (fine-grained) सत्यापन योग्य पुरस्कारों (Verifiable Rewards) के साथ सुदृढीकरण शिक्षण (Reinforcement Learning) ढांचा है, जो रणनीतिक nn-gram पैटर्न से सत्यापन योग्य, परिणाम-भेदभावपूर्ण पर्यवेक्षण (outcome-discriminative supervision) प्राप्त करके बड़े भाषा मॉडलों में तर्क क्षमता को बढ़ाता है ताकि मौजूदा विधियों की तुलना में अधिक सटीक क्रेडिट असाइनमेंट (credit assignment) सक्षम किया जा सके।

Qinjian Zhao, Zhihao Dou, Dinggen Zhang, Xiangyu Li, Chaoda Song, Zhongwei Wan, Xinpeng Li, Yanyan Zhang, Kaijie Chen, Q (…)2026-06-16
🤖 machine learning

David vs. Goliath in Next Activity Prediction: Argmax vs. LSTM, Transformer, and LLM

यह शोध पत्र सात वास्तविक जीवन के इवेंट लॉग्स के माध्यम से एक व्यवस्थित बेंचमार्क प्रस्तुत करता है जो यह दर्शाता है कि एक सरल काउंटिंग-आधारित आर्गमैक्स (argmax) बेसलाइन अक्सर अगली गतिविधि की भविष्यवाणी करने में जटिल डीप लर्निंग मॉडल्स और अरबों-पैरामीटर वाले एलएलएम (LLMs) के प्रदर्शन के बराबर या उसके करीब पहुँच जाती है, जो इस धारणा को चुनौती देती है कि बढ़ती मॉडल जटिलता और प्रीट्रेनिंग लगातार बेहतर परिणाम प्रदान करते हैं।

Hans Weytjens, Ingo Weber2026-06-16
📊 statistics

Amortized mean-shift interacting particles

यह शोध पत्र एमोर्टाइज्ड मीन-शिफ्ट इंटरैक्टिंग पार्टिकल्स (amortized mean-shift interacting particles) को प्रस्तुत करता है, जो एक सीखी हुई विधि है जो एकल फॉरवर्ड पास में नियत, हस्ताक्षरित-भार वाले क्वाड्रैचर नोड्स (deterministic, signed-weight quadrature nodes) उत्पन्न करके इनवर्स समस्याओं के लिए पोस्टीरियर एक्सपेक्टेशंस का कुशलतापूर्वक अनुमान लगाती है, जिससे घनत्व या स्कोर मूल्यांकन की आवश्यकता के बिना मानक मोंटे कार्लो इंटीग्रेशन की तुलना में उच्च सटीकता प्राप्त होती है।

Ali Siahkoohi2026-06-16
🤖 machine learning

Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes

यह शोध पत्र AIPR को मान्य करता है, जो एक प्रॉम्प्ट-आधारित LLM सिस्टम है जो पांडुलिपि गुणवत्ता स्कोर और संरचित समीक्षाएं उत्पन्न करता है, यह प्रदर्शित करते हुए कि इसके समग्र स्कोर बिना समीक्षा डेटा पर फाइन-ट्यूनिंग के भी उच्च विश्वसनीयता और निरंतरता के साथ ICLR में पीयर-रिव्यू स्वीकृति परिणामों की प्रभावी ढंग से भविष्यवाणी करते हैं।

Costa Georgantas2026-06-16