🤖 machine learning

The Geometric Reasoner: Manifold-Informed Latent Foresight Search for Long-Context Reasoning

द ज्योमेट्रिक रीज़नर (TGR) एक ट्रेनिंग-फ्री फ्रेमवर्क है जो चंक-वाइज KV कैश रिसेट्स के साथ मैनिफोल्ड-इन्फॉर्म्ड लेटेंट फोरसाइट सर्च को निष्पादित करके सख्त मेमोरी बाधाओं के तहत लॉन्ग-कॉन्टेक्स्ट रीजनिंग को बढ़ाता है, जिससे गणित और कोड बेंचमार्क पर नगण्य कम्प्यूटेशनल ओवरहेड के साथ प्रक्षेपवक्र कवरेज (ट्रैजेक्टरी कवरेज) में महत्वपूर्ण सुधार प्राप्त होता है।

Ren Zhuang, Ben Wang, Shuifa Sun2026-05-12
🤖 machine learning

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

यह शोध पत्र सरल, स्केलेबल तकनीकों को प्रस्तुत करता है जो यह प्रदर्शित करती हैं कि इम्पलिसिट प्लानिंग (implicit planning)—एक ऐसी प्रक्रिया जहाँ भाषा मॉडल तुकबंदी या उत्तर जैसे भविष्य के लक्ष्यों की ओर मध्यवर्ती टोकन को निर्देशित करते हैं—एक सार्वभौमिक क्षमता है जो 1B पैरामीटर्स जितने छोटे मॉडलों में भी मौजूद है, जो एआई सुरक्षा और नियंत्रण के लिए नई अंतर्दृष्टि प्रदान करती है।

Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda2026-05-12
📊 statistics

Efficient Evaluation of LLM Performance with Statistical Guarantees

यह शोध पत्र फैक्टरइज़्ड एक्टिव क्वेयरिंग (FAQ) का प्रस्ताव करता है, जो एक ऐसी विधि है जो ऐतिहासिक डेटा और अनुकूली नमूनाकरण (adaptive sampling) का लाभ उठाकर सांख्यिकीय रूप से वैध विश्वास अंतराल (confidence intervals) बनाए रखते हुए लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए आवश्यक प्रश्नों की संख्या को काफी कम कर देती है।

Skyler Wu, Yash Nair, Emmanuel J. Candès2026-05-12
🔢 mathematics

Implicit Hypothesis Testing and Divergence Preservation in Neural Network Representations

यह शोध पत्र न्यूरल नेटवर्क वर्गीकरण को बाइनरी परिकल्पना परीक्षणों की एक श्रृंखला के रूप में पुनर्गठित करता है, जो अनुभवजन्य रूप से यह प्रदर्शित करता है कि अच्छी तरह से सामान्यीकरण करने वाले मॉडल रिटेन्ड (retained) KL डाइवर्जेंस की निरंतर वृद्धि के माध्यम से नेमन-पियर्सन अनुकूल निर्णय नियमों की ओर अभिसरित होते हैं, और साथ ही विभिन्न आर्किटेक्चरों में अभिसरण का व्यवस्थित रूप से आकलन करने के लिए एक "एविडेंस-एरर" (साक्ष्य-त्रुटि) तल प्रस्तुत करता है।

Kadircan Aksoy, Protim Bhattacharjee, Peter Jung2026-05-12
📊 statistics

Supervised Guidance Training for Infinite-Dimensional Diffusion Models

यह शोध पत्र डोब के hh-ट्रांसफॉर्म के विस्तार के माध्यम से शोर युक्त अवलोकनों (noisy observations) पर अनंत-आयामी डिफ्यूजन मॉडलों को अनुकूलित करने के लिए एक सैद्धांतिक ढांचा स्थापित करता है और बेयसियन व्युत्क्रम समस्याओं (Bayesian inverse problems) में सटीक पोस्टीरियर सैंपलिंग के लिए इन मॉडलों को कुशलतापूर्वक फाइन-ट्यून करने हेतु एक सिम्युलेशन-मुक्त "सुपरवाइज्ड गाइडेंस ट्रेनिंग" पद्धति प्रस्तुत करता है।

Elizabeth L. Baker, Alexander Denker, Jes Frellsen2026-05-12
🤖 machine learning

Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning

यह शोध पत्र "फेलियर-प्रिफिक्स कंडीशनिंग" (failure-prefix conditioning) का प्रस्ताव करता है, जो दुर्लभ गलत प्रक्षेप पथों (trajectories) के प्रिफिक्स पर कंडीशन करके संतृप्त समस्याओं (saturated problems) पर रीजनिंग मॉडल के प्रशिक्षण को बढ़ाता है ताकि अन्वेषण को विफलता-प्रवण अवस्थाओं की ओर स्थानांतरित किया जा सके, जिससे महंगी नई डेटा संग्रह की आवश्यकता के बिना मूल्यवान शिक्षण संकेतों को अनलॉक किया जा सके।

Minwu Kim, Safal Shrestha, Anubhav Shrestha, Keith Ross2026-05-12
⚡ electrical engineering

Reducing Prompt Sensitivity in LLM-based Speech Recognition Through Learnable Projection

यह शोध पत्र एक सरल, मॉडल-अज्ञेय (model-agnostic) "प्रॉम्ट प्रोजेक्टर" मॉड्यूल का प्रस्ताव करके LLM-आधारित स्पीच रिकग्निशन में फिक्स्ड प्रॉम्ट डिज़ाइन्स के कारण होने वाली प्रदर्शन अस्थिरता को संबोधित करता है, जो प्रॉम्ट एम्बेडिंग्स को अनुकूलित करना सीखता है, जिससे विविध डेटासेट्स में सटीकता में निरंतर सुधार होता है और परिवर्तनशीलता कम होती है।

Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Srikanth Madikeri, Andrés Carofilis, Pradeep Rangappa, Manjunath K (…)2026-05-12
📊 statistics

Learning When to Trust LLM Priors: A Validated Framework for Semantic Prior Integration

यह शोध पत्र स्टैट्सफॉर्मर (Statsformer) का परिचय देता है, जो एक सत्यापित ढांचा है जो आउट-ऑफ-फोल्ड वैलिडेशन के माध्यम से विभिन्न प्रेडिक्टर्स के पुस्तकालय में एलएलएम-व्युत्पन्न (LLM-derived) सिमेंटिक प्रायर्स (semantic priors) के प्रभाव को अनुकूल रूप से कैलिब्रेट करता है, यह सुनिश्चित करते हुए कि अंतिम मॉडल उम्मीदवारों के सर्वश्रेष्ठ संयोजन से खराब प्रदर्शन न करे और अविश्वसनीय या मतिभ्रम (hallucinated) मार्गदर्शन को स्वचालित रूप से कम भार दे।

Erica Zhang, Naomi Sagan, Danny Tse, Fangzhao Zhang, Mert Pilanci, Jose Blanchet2026-05-12
🤖 machine learning

ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment

यह शोध पत्र ETS का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त अनुमान विधि (training-free inference method) है जो ऑनलाइन मोंटे कार्लो अनुमान (online Monte Carlo estimation) और महत्व नमूनाकरण (importance sampling) के साथ ऊर्जा-निर्देशित परीक्षण-समय स्केलिंग (energy-guided test-time scaling) का लाभ उठाती है ताकि इष्टतम RL नीतियों से कुशलतापूर्वक नमूना लिया जा सके, जिससे पारंपरिक RL पोस्ट-ट्रेनिंग की लागत और अस्थिरता के बिना रीजनिंग, कोडिंग और विज्ञान बेंचमार्क में जनरेशन की गुणवत्ता में सुधार होता है।

Xiuyu Li, Jinkai Zhang, Mingyang Yi, Yu Li, Longqiang Wang, Yue Wang, Ju Fan2026-05-12
🤖 machine learning

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

यह अध्ययन प्रदर्शित करता है कि भाषाई रूप से प्रेरित पाठ्यक्रम LLM प्रीट्रेनिंग में मुख्य रूप से साझा लेटेंट लर्निंग चरणों की अवधि को बदलकर छोटे मॉडलों में प्रशिक्षण स्थिरता को बढ़ाते हैं और ग्रेडिएंट शोर को कम करते हैं, न कि नए चरण बनाकर, जबकि बड़े मॉडल पैमानों पर ये लाभ कम हो जाते हैं।

Mohamed Elgaar, Hadi Amiri2026-05-12