🤖 AI

Where Rollouts Begin: Low-Load, High-Leverage First-Token Diversification for RLVR

यह शोध पत्र REFT को प्रस्तुत करता है, जो एक हल्का RLVR तरीका है जो रीजनिंग मार्कर के बाद पहले टोकन के लिए पॉलिसी के शीर्ष-NN उम्मीदवारों से समान रूप से नमूना लेकर रोलआउट विविधता को बढ़ाता है और रीजनिंग प्रदर्शन में सुधार करता है, जिससे शुद्धता संकेत (correctness signal) को बदले बिना अन्वेषण का विस्तार होता है।

Soeun Kim, Albert No2026-05-28
🤖 machine learning

Compositional Generalization in Autoregressive Models via Logit Composition

यह शोधपत्र डिफ्यूजन विधियों से प्रेरित, ऑटोरेग्रेसिव मॉडलों के लिए एक सिद्धांत-आधारित लॉजिट कंपोजिशन रणनीति प्रस्तुत करता है, जो आउटपुट सबस्पेस पर प्रक्षेपिक नियंत्रण सुनिश्चित करता है और फैक्टराइज्ड-कंडीशनल्स धारणाओं के तहत लंबाई सामान्यीकरण को संरक्षित करता है।

Aakash Kumar, Maria Sofia Bucarelli, Emanuele Natale2026-05-28
🤖 machine learning

Learning to Assess the Reliability of Number-of-Runs Estimation in Stochastic Optimization

यह शोध पत्र एक लर्निंग-आधारित दृष्टिकोण प्रस्तावित करता है जो स्टोकेस्टिक ऑप्टिमाइज़ेशन में एडेप्टिव रन-नंबर अनुमानों की विश्वसनीयता का पूर्वानुमान लगाने के लिए व्यापक बेंचमार्किंग डेटा से सांख्यिकीय विशेषताओं पर क्लासिफायर को प्रशिक्षित करता है, जो विशिष्ट ऑप्टिमाइज़र कॉन्फ़िगरेशन के भीतर अविश्वसनीय अनुमानों का पता लगाने में सफलतापूर्वक सक्षम है, जबकि विविध सेटिंग्स में सामान्यीकरण करने में सीमाओं को भी रेखांकित करता है।

Sara Gjorgjieva, Eva Tuba, Tome Eftimov2026-05-28
🔬 physics

Hybrid Neural World Models

यह शोधपत्र हाइब्रिड न्यूरल वर्ल्ड मॉडल्स (hybrid neural world models) को प्रस्तुत करता है, जो एक एकल-नेटवर्क फ्रेमवर्क है जो शास्त्रीय सॉल्वर की तुलना में महत्वपूर्ण गति के साथ भौतिक गतिकी (physical dynamics) की भविष्यवाणी करता है और साथ ही झटकों (shocks) और संपर्कों (contacts) जैसे तीव्र विच्छेदन (discontinuities) का पता लगाने के लिए आंतरिक रूप से एक त्रुटि मानचित्र (error map) उत्पन्न करता है, जिससे एक फॉलबैक तंत्र सक्षम होता है जो बिना किसी अतिरिक्त अंशांकन (calibration) या शासी-समीकरण ज्ञान की आवश्यकता के भविष्यवाणियों की त्रुटियों को काफी कम कर देता है।

Pranav Lakshmanan, Paras Chopra2026-05-28✓ Author reviewed
💰 quantitative finance

Insurance Pricing Optimization via Off-Policy Evaluation

यह शोध पत्र एक नए कर्नेलयुक्त इन्वर्स प्रोपेंसिटी स्कोर एस्टीमेटर के साथ ऑफ-पॉलिसी इवैल्यूएशन को एकीकृत करके बीमा मूल्य निर्धारण को अनुकूलित करने के लिए एक ढांचे का प्रस्ताव करता है और यह प्रदर्शित करता है कि न्यूरल नेटवर्क-आधारित पॉलिसी पैरामीटराइजेशन एक सिंथेटिक यात्रा बीमा वातावरण में मौजूदा तकनीकों से बेहतर प्रदर्शन करता है।

Sascha Günther, Dimitri Semenovich, Mario V. Wüthrich2026-05-28
🤖 machine learning

Learning the Error Patterns of Language Models

यह शोध पत्र "प्रिफिक्स फिल्टर्स" (prefix filters) और "पल्ला" (Palla) एल्गोरिदम को पेश करता है जो डोमेन-विशिष्ट बाधाओं को कुशलतापूर्वक सीखने और लागू करने के लिए है जो सामान्य LLM त्रुटि पैटर्न को पकड़ते हैं और उन्हें सुधारते हैं, जिससे आउटपुट वैधता जैसे कि टाइपस्क्रिप्ट (TypeScript) कंपाइलेशन दरों में महत्वपूर्ण सुधार होता है।

Jinwoo Kim, Taylor Berg-KirkPatrick, Loris D'Antoni2026-05-28
🤖 machine learning

Dimensionality Reduction for Robust Federated Learning: A Theoretical Analysis and Convergence Guarantee

यह शोध पत्र प्रोजेक्टेड डाइमेंशनलिटी रिडक्शन (PDR) का प्रस्ताव करता है, जो एक सार्वभौमिक ढांचा है जो स्पार्स रैंडम प्रोजेक्शन के माध्यम से ग्रेडिएंट्स को संकुचित करके रोबस्ट फेडरेटेड लर्निंग को त्वरित करता है ताकि इष्टतम कम्प्यूटेशनल जटिलता और सिद्ध अभिसरण गारंटी प्राप्त की जा सके, जबकि केवल मामूली रूप से बायज़ेंटाइन एरर फ्लोर को बढ़ाया जाता है।

Shiyuan Zuo, Jiashuo Li, Rongfei Fan, Han Hu, Jie Xu2026-05-28
🤖 machine learning

Detecting Diffusion-Generated Time Series Under Generator Shift

यह शोध पत्र जनरेटर शिफ्ट के तहत डिफ्यूजन-जनित टाइम सीरीज़ (time series) का पता लगाने के पहले व्यवस्थित अन्वेषण को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक सरल ब्लैक-बॉक्स क्लासिफायर व्हाइट-बॉक्स पुनर्निर्माण-आधारित विधियों की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे यह स्पष्ट होता है कि टाइम सीरीज़ डिटेक्शन को सीधे इमेज डोमेन से स्थानांतरित नहीं किया जा सकता है।

Zhi Wen Soi, Aditya Shankar, Gert Lek, Abele Mălan, Daniel Neider, Jian-Jia Chen, Lydia Chen2026-05-28
🤖 machine learning

Score Based Error Correcting Code Decoder

यह शोध पत्र SB-ECC प्रस्तुत करता है, जो एक स्कोर-आधारित डिकोडर है जो त्रुटि सुधार (error correction) को एक न्यूरल प्रोबेबिलिटी-फ्लो ODE के माध्यम से निरंतर-समय डिनोइजिंग प्रक्रिया के रूप में फ्रेम करता है, जो SNR अनुमान की आवश्यकता के बिना विविध कोड सेटिंग्स में बेहतर बिट-त्रुटि-दर प्रदर्शन प्राप्त करता है और विलंबता (latency) एवं सटीकता के बीच लचीले ट्रेड-ऑफ को सक्षम बनाता है।

Alon Helvits, Eliya Nachmani2026-05-28
🤖 machine learning

Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

यह शोध पत्र एक नवीन एल्गोरिदम प्रस्तावित करता है जो स्व-पर्यवेक्षित कंट्रास्टिव लर्निंग (self-supervised contrastive learning) के माध्यम से एक साझा एम्बेडिंग स्पेस को प्रशिक्षित करके स्टेट-आधारित सुदृढीकरण अधिगम-संचालित अनुकरण अधिगम (state-based reinforcement learning-driven imitation learning) में इमिटेशन गैप को कम करता है, ताकि यह सुनिश्चित किया जा सके कि शिक्षक नीतियां केवल अवलोकन योग्य जानकारी पर निर्भर करती हैं, जिससे बिना किसी पोस्ट-ट्रेनिंग आरएल फाइन-ट्यूनिंग की आवश्यकता के उच्च-प्रदर्शन वाली छात्र नीतियों को सक्षम बनाया जा सके।

Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas Stork2026-05-28