🤖 machine learning

Revisiting Mixture Policies in Entropy-Regularized Actor-Critic

यह शोध पत्र मिश्रण नीतियों (mixture policies) में मानक लाइकलीहुड-रेश्यो विधियों की उच्च विचरण (high variance) की समस्या को दूर करने के लिए एक मार्जिनलाइज्ड रीपैरामीट्राइजेशन (MRP) एस्टिमेटर का प्रस्ताव करता है, जो यह प्रदर्शित करता है कि यह दृष्टिकोण मिश्रण नीतियों को निरंतर एक्शन सुदृढीकरण लर्निंग (continuous action reinforcement learning) कार्यों में गॉसियन नीतियों के प्रदर्शन के बराबर या उससे बेहतर बनाने में सक्षम बनाता है।

Jiamin He, Samuel Neumann, Jincheng Mei, Adam White, Martha White2026-05-12
🤖 machine learning

Sparse Layers are Critical to Scaling Looped Language Models

यह शोध पत्र प्रदर्शित करता है कि मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर को लेयर लूपिंग और अर्ली-एग्जिट मैकेनिज्म के साथ संयोजित करने से भाषा मॉडल मानक ट्रांसफॉर्मर की तुलना में स्केलिंग दक्षता में बेहतर प्रदर्शन करने में सक्षम होते हैं और साथ ही मेमोरी और इन्फरेंस लागत को काफी कम करते हैं।

Ryan Lee, Jacob Biloki, Edward J. Hu, Jonathan May2026-05-12
🤖 AI

WorldSpeech: A Multilingual Speech Corpus from Around the World

यह शोध पत्र WorldSpeech को प्रस्तुत करता है, जो 76 भाषाओं में 65,000 घंटों के संरेखित (aligned) ऑडियो-ट्रांसक्रिप्ट डेटा वाला एक बड़े पैमाने का बहुभाषी संग्रह है, जो कम संसाधन वाली भाषाओं के लिए स्वचालित वाक् पहचान (automatic speech recognition) प्रदर्शन में सुधार करते हुए शब्द त्रुटि दर (word error rate) को औसतन 63.5% तक कम कर देता है।

Antonis Asonitis, Luca A. Lanzendörfer, Frédéric Berdoz, Roger Wattenhofer2026-05-12
🤖 AI

CIVeX: Causal Intervention Verification for Language Agents

यह शोध पत्र CIVeX को प्रस्तुत करता है, जो एक कारण संबंधी हस्तक्षेप सत्यापनकर्ता (causal intervention verifier) है जो प्रस्तावित कार्यों को संरचनात्मक कारण प्रश्नों (structural causal queries) में मैप करके भाषा एजेंटों में विश्वसनीय टूल उपयोग सुनिश्चित करता है ताकि पहचान योग्य कारण प्रभावों की गारंटी दी जा सके, जिससे उन कन्फाउंडेड वर्कफ़्लो (confounded workflows) में गलत निष्पादन को रोका जा सके जहाँ मानक सत्यापन सुरक्षा उपाय विफल हो जाते हैं।

Fabio Rovai2026-05-12
🤖 machine learning

Prediction Bottlenecks Don't Discover Causal Structure (But Here's What They Actually Do)

यह शोध पत्र एक मानकीकृत मिथ्याकरण बेंचमार्क (falsification benchmark) प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि यह दावा कि प्रेडिक्शन बॉटलनैक्स (prediction bottlenecks) कारण संरचना (causal structure) की खोज करते है, गलत है, जो इसके बजाय यह प्रकट करता है कि देखे गए लाभ काफी हद तक नमूना-आकार के भ्रम (sample-size confounds) या विधि-अज्ञेय प्रभाव (method-agnostic effects) हैं जो ग्रेंजर कॉज़ैलिटी (Granger causality) और लासो (Lasso) जैसी शास्त्रीय विधियों द्वारा पीछे छोड़ दिए जाते हैं।

Ankit Hemant Lade, Sai Krishna Jasti, Indar Kumar, Aman Chadha2026-05-12
🤖 machine learning

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

यह सर्वेक्षण बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए अनुकूलन एल्गोरिदम (ऑप्टिमाइज़ेशन एल्गोरिदम) की एक व्यापक समीक्षा प्रदान करता है, जो शास्त्रीय प्रथम-क्रम दृष्टिकोणों से लेकर म्यूऑन (Muon) जैसे उन्नत मैट्रिक्स-आधारित ऑप्टिमाइज़र तक विधियों को वर्गीकृत करता है, और एक कठोर, स्केल-जागरूक बेंचमार्किंग का समर्थन करता है जो अभिसरण (कन्वर्जेंस), स्थिरता, मेमोरी दक्षता और कार्यान्वयन जटिलता का संयुक्त रूप से मूल्यांकन करता है।

Aditya Ranganath2026-05-12
🤖 machine learning

Learning When to Stop: Selective Imitation Learning Under Arbitrary Dynamics Shift

यह शोधपत्र SeqRejectron प्रस्तुत करता है, जो चयनात्मक अनुकरण शिक्षण (selective imitation learning) के लिए एक एल्गोरिदम है जो एक क्षितिज-मुक्त (horizon-free) स्टॉपिंग नियम का निर्माण करके एजेंटों को मनमानी गतिकी परिवर्तनों (arbitrary dynamics shifts) के तहत सुरक्षित रूप से कार्य करने से बचने में सक्षम बनाता है, जिसके पास सिद्ध नमूना जटिलता गारंटी (provable sample complexity guarantees) है।

Surbhi Goel, Jonathan Pei, James Wang2026-05-12
🤖 AI

Emergent Semantic Role Understanding in Language Models

यह शोध पत्र यह प्रदर्शित करता है कि लीनियर प्रोब्स (linear probes) द्वारा प्रमाणित, प्री-ट्रेनिंग के दौरान फ्रोजन डिकोडर-ओनली ट्रांसफॉर्मर में सिमेंटिक रोल (semantic role) की समझ आंशिक रूप से उभरती है, हालांकि पूर्ण प्रदर्शन के लिए फाइन-ट्यूनिंग की आवश्यकता होती है और मॉडल स्केल बढ़ने के साथ इन भूमिकाओं का आंतरिक प्रतिनिधित्व तेजी से वितरित होता जाता है।

Carla Griffiths, Mirco Musolesi2026-05-12
🤖 machine learning

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

यह शोध पत्र DARE का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो विभिन्न कार्य कठिनाइयों के माध्यम से प्रशिक्षण दक्षता, अंतिम प्रदर्शन और अनुमान संक्षिप्तता को एक साथ सुधारने के लिए सेल्फ-नॉर्मलाइज्ड इम्पोर्टेंस सैंपलिंग और एडेप्टिव कंप्यूट एलोकेशन के माध्यम से पॉलिसी के साथ कठिनाई अनुमान को सह-विकसित करता है।

Yang Zhou, Can Jin, Zihan Dong, Zhepeng Wang, Yanting Yang, Shiyu Zhao, Lei Li, Runxue Bao, Yaochen Xie, Dimitris N. Met (…)2026-05-12
📊 statistics

Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability

यह शोध पत्र सिंगल-पॉलिसी कंसेंट्रैबिलिटी के तहत फॉरवर्ड-केएल (forward-KL) रेगुलाइजेशन वाले ऑफलाइन कॉन्टेक्स्टुअल बैंडिट्स के लिए पहले O~(ϵ−1)\tilde{O}(\epsilon^{-1}) फास्ट सैंपल कॉम्प्लेक्सिटी अपर बाउंड्स स्थापित करता है, जो एक नवीन कॉनवेक्स-एनालिटिकल विश्लेषण के माध्यम से टैबुलर और जनरल फंक्शन एप्रोक्सिमेशन सेटिंग्स को एकीकृत करता है और मैचिंग लोअर बाउंड्स के माध्यम से इन दरों की टाइटनेस को सिद्ध करता है।

Qingyue Zhao, Kaixuan Ji, Heyang Zhao, Quanquan Gu2026-05-12