📊 statistics

Efficient Evaluation of LLM Performance with Statistical Guarantees

यह शोध पत्र फैक्टरइज़्ड एक्टिव क्वेयरिंग (FAQ) का प्रस्ताव करता है, जो एक ऐसी विधि है जो ऐतिहासिक डेटा और अनुकूली नमूनाकरण (adaptive sampling) का लाभ उठाकर सांख्यिकीय रूप से वैध विश्वास अंतराल (confidence intervals) बनाए रखते हुए लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए आवश्यक प्रश्नों की संख्या को काफी कम कर देती है।

Skyler Wu, Yash Nair, Emmanuel J. Candès2026-05-12
🔢 mathematics

Implicit Hypothesis Testing and Divergence Preservation in Neural Network Representations

यह शोध पत्र न्यूरल नेटवर्क वर्गीकरण को बाइनरी परिकल्पना परीक्षणों की एक श्रृंखला के रूप में पुनर्गठित करता है, जो अनुभवजन्य रूप से यह प्रदर्शित करता है कि अच्छी तरह से सामान्यीकरण करने वाले मॉडल रिटेन्ड (retained) KL डाइवर्जेंस की निरंतर वृद्धि के माध्यम से नेमन-पियर्सन अनुकूल निर्णय नियमों की ओर अभिसरित होते हैं, और साथ ही विभिन्न आर्किटेक्चरों में अभिसरण का व्यवस्थित रूप से आकलन करने के लिए एक "एविडेंस-एरर" (साक्ष्य-त्रुटि) तल प्रस्तुत करता है।

Kadircan Aksoy, Protim Bhattacharjee, Peter Jung2026-05-12
📊 statistics

Supervised Guidance Training for Infinite-Dimensional Diffusion Models

यह शोध पत्र डोब के hh-ट्रांसफॉर्म के विस्तार के माध्यम से शोर युक्त अवलोकनों (noisy observations) पर अनंत-आयामी डिफ्यूजन मॉडलों को अनुकूलित करने के लिए एक सैद्धांतिक ढांचा स्थापित करता है और बेयसियन व्युत्क्रम समस्याओं (Bayesian inverse problems) में सटीक पोस्टीरियर सैंपलिंग के लिए इन मॉडलों को कुशलतापूर्वक फाइन-ट्यून करने हेतु एक सिम्युलेशन-मुक्त "सुपरवाइज्ड गाइडेंस ट्रेनिंग" पद्धति प्रस्तुत करता है।

Elizabeth L. Baker, Alexander Denker, Jes Frellsen2026-05-12
🤖 machine learning

Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning

यह शोध पत्र "फेलियर-प्रिफिक्स कंडीशनिंग" (failure-prefix conditioning) का प्रस्ताव करता है, जो दुर्लभ गलत प्रक्षेप पथों (trajectories) के प्रिफिक्स पर कंडीशन करके संतृप्त समस्याओं (saturated problems) पर रीजनिंग मॉडल के प्रशिक्षण को बढ़ाता है ताकि अन्वेषण को विफलता-प्रवण अवस्थाओं की ओर स्थानांतरित किया जा सके, जिससे महंगी नई डेटा संग्रह की आवश्यकता के बिना मूल्यवान शिक्षण संकेतों को अनलॉक किया जा सके।

Minwu Kim, Safal Shrestha, Anubhav Shrestha, Keith Ross2026-05-12
⚡ electrical engineering

Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection

यह शोध पत्र एक सरल, मॉडल-अज्ञेय (model-agnostic) "प्रॉम्ट प्रोजेक्टर" मॉड्यूल का प्रस्ताव करके LLM-आधारित स्पीच रिकग्निशन में फिक्स्ड प्रॉम्ट डिज़ाइन्स के कारण होने वाली प्रदर्शन अस्थिरता को संबोधित करता है, जो प्रॉम्ट एम्बेडिंग्स को अनुकूलित करना सीखता है, जिससे विविध डेटासेट्स में सटीकता में निरंतर सुधार होता है और परिवर्तनशीलता कम होती है।

Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K (…)2026-05-12
📊 statistics

Learning When to Trust LLM Priors: A Validated Framework for Semantic Prior Integration

यह शोध पत्र स्टैट्सफॉर्मर (Statsformer) का परिचय देता है, जो एक सत्यापित ढांचा है जो आउट-ऑफ-फोल्ड वैलिडेशन के माध्यम से विभिन्न प्रेडिक्टर्स के पुस्तकालय में एलएलएम-व्युत्पन्न (LLM-derived) सिमेंटिक प्रायर्स (semantic priors) के प्रभाव को अनुकूल रूप से कैलिब्रेट करता है, यह सुनिश्चित करते हुए कि अंतिम मॉडल उम्मीदवारों के सर्वश्रेष्ठ संयोजन से खराब प्रदर्शन न करे और अविश्वसनीय या मतिभ्रम (hallucinated) मार्गदर्शन को स्वचालित रूप से कम भार दे।

Erica Zhang, Naomi Sagan, Danny Tse, Fangzhao Zhang, Mert Pilanci, Jose Blanchet2026-05-12
🤖 machine learning

ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment

यह शोध पत्र ETS का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त अनुमान विधि (training-free inference method) है जो ऑनलाइन मोंटे कार्लो अनुमान (online Monte Carlo estimation) और महत्व नमूनाकरण (importance sampling) के साथ ऊर्जा-निर्देशित परीक्षण-समय स्केलिंग (energy-guided test-time scaling) का लाभ उठाती है ताकि इष्टतम RL नीतियों से कुशलतापूर्वक नमूना लिया जा सके, जिससे पारंपरिक RL पोस्ट-ट्रेनिंग की लागत और अस्थिरता के बिना रीजनिंग, कोडिंग और विज्ञान बेंचमार्क में जनरेशन की गुणवत्ता में सुधार होता है।

Xiuyu Li, Jinkai Zhang, Mingyang Yi, Yu Li, Longqiang Wang, Yue Wang, Ju Fan2026-05-12
🤖 machine learning

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

यह अध्ययन प्रदर्शित करता है कि भाषाई रूप से प्रेरित पाठ्यक्रम LLM प्रीट्रेनिंग में मुख्य रूप से साझा लेटेंट लर्निंग चरणों की अवधि को बदलकर छोटे मॉडलों में प्रशिक्षण स्थिरता को बढ़ाते हैं और ग्रेडिएंट शोर को कम करते हैं, न कि नए चरण बनाकर, जबकि बड़े मॉडल पैमानों पर ये लाभ कम हो जाते हैं।

Mohamed Elgaar, Hadi Amiri2026-05-12
📊 statistics

Why Adam Works Better with β1=β2\beta_1 = \beta_2: The Missing Gradient Scale Invariance Principle

यह शोध पत्र यह प्रकट करता है कि एडम (Adam) ऑप्टिमाइज़र में β1=β2\beta_1 = \beta_2 निर्धारित करना इष्टतम है क्योंकि यह विशिष्ट रूप से प्रथम-क्रम ग्रेडिएंट स्केल इनवेरिएंस (first-order gradient scale invariance) सुनिश्चित करता है, जो एक ऐसी संरचनात्मक विशेषता है जो विविध कार्यों में प्रशिक्षण स्थिरता और प्रदर्शन में अनुभवजन्य रूप से देखे गए सुधारों की व्याख्या करती है।

Alberto Fernández-Hernández, Cristian Pérez-Corral, Jose I. Mestre, Manuel F. Dolz, Enrique S. Quintana-Ortí2026-05-12
🤖 AI

Supervised Mixture-of-Experts for Surgical Grasping and Retraction

यह शोध पत्र एक सुपरवाइज्ड मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर प्रस्तुत करता है जो केवल स्टीरियो एंडोस्कोपिक छवियों और 150 से कम प्रदर्शनों (demonstrations) का उपयोग करके हल्केवेट इमिटेशन लर्निंग पॉलिसियों को लचीले ऊतकों (deformable tissue) पर मजबूत और डेटा-कुशल सर्जिकल ग्रैस्पिंग और रिट्रैक्शन प्राप्त करने में सक्षम बनाता है, जो इन-डिस्ट्रीब्यूशन और चुनौतीपूर्ण आउट-ऑफ-डिस्ट्रीब्यूशन परिदृश्यों दोनों में मानक मॉडलों से काफी बेहतर प्रदर्शन करता है और एक्स विवो (ex vivo) तथा प्रारंभिक इन विवो (in vivo) पोर्सिन सर्जरी में सफल ज़ीरो-शॉट ट्रांसफर प्रदर्शित करता है।

Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagn (…)2026-05-12