🤖 machine learning

ORTHOBO: Orthogonal Bayesian Hyperparameter Optimization

यह शोध पत्र OrthoBO को प्रस्तुत करता है, जो एक बेयसियन ऑप्टिमाइज़ेशन फ्रेमवर्क है जो मोंटे कार्लो वेरिएंस (Monte Carlo variance) को कम करने के लिए कंट्रोल वेरिएट्स के साथ एक ऑर्थोगोनल एक्विजिशन एस्टिमेटर का उपयोग करके शोर वाले एक्विजिशन अनुमानों (noisy acquisition estimates) की विफलता मोड को कम करता है, जिससे कैंडिडेट रैंकिंग को स्थिर किया जाता है और हाइपरपैरामीटर अनुकूलन प्रदर्शन में सुधार किया जाता है।

Maresa Schröder, Pascal Janetzky, Michael Klar, Stefan Feuerriegel2026-05-08
🤖 AI

Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems

यह शोध पत्र एजेंटिक सक्सेस रेट (ASR) को प्रस्तुत करता है, जो एक ट्रैजेक्टरी-फिडेलिटी मीट्रिक है जो एलएलएम-आधारित भुगतान प्रणालियों में महत्वपूर्ण वर्कफ़्लो विचलन को प्रकट करता है जो पारंपरिक परिणाम-आधारित मीट्रिक्स के लिए अदृश्य हैं, यह प्रदर्शित करते हुए कि इस तरह का सूक्ष्म मूल्यांकन एजेंट व्यवहार के निदान और विनियमित डोमेन में सिस्टम प्रदर्शन में महत्वपूर्ण सुधार के लिए आवश्यक है।

Donghao Huang, Joon Kiat Chua, Zhaoxia Wang2026-05-08
📊 statistics

Q-MMR: Off-Policy Evaluation via Recursive Reweighting and Moment Matching

यह शोध पत्र Q-MMR प्रस्तुत करता है, जो परिमित-क्षितिज (finite-horizon) MDPs के लिए एक नवीन ऑफ-पॉलिसी मूल्यांकन ढांचा है, जो लक्ष्य Q-फंक्शन की यथार्थता (realizability) के तहत डाइमेंशन-मुक्त परिमित-नमूना गारंटी प्राप्त करने के लिए रिकर्सिव मोमेंट मैचिंग के माध्यम से इंडक्टिव स्केलर वेट्स सीखता है, जबकि कवरेज और इम्पोर्टेंस सैंपलिंग जैसे मौजूदा तरीकों के साथ नए सैद्धांतिक अंतर्दृष्टि और संबंध प्रदान करता है।

Xiang Li, Nan Jiang2026-05-08
💬 NLP

Litespark Inference on Consumer CPUs: Custom SIMD Kernels for Ternary Neural Networks

यह शोध पत्र Litespark-Inference को प्रस्तुत करता है, जो एक pip-installable फ्रेमवर्क है जो मैट्रिक्स गुणन (matrix multiplication) को पूर्णांक जोड़ और घटाव (integer addition and subtraction) से बदलकर उपभोक्ता CPUs पर टेनरी न्यूरल नेटवर्क इन्फरेंस को त्वरित करने के लिए कस्टम SIMD कर्नेल का लाभ उठाता है, जिससे मानक PyTorch कार्यान्वयन की तुलना में महत्वपूर्ण गति वृद्धि और मेमोरी में कमी प्राप्त होती है।

Nii Osae Osae Dade, Tony Morri, Moinul Hossain Rahat, Sayandip Pal2026-05-08
🤖 machine learning

Operator-Guided Invariance Learning for Continuous Reinforcement Learning

यह शोध पत्र VPSD-RL का प्रस्ताव करता है, जो एक निरंतर सुदृढीकरण लर्निंग (continuous reinforcement learning) फ्रेमवर्क है जो डेटा दक्षता को बढ़ाने और व्यर्थ परिवर्तनशीलता (nuisance variability) के विरुद्ध मजबूती प्रदान करने के लिए ली-ग्रुप ऑपरेटर्स (Lie-group operators) और पुलबैक मैपिंग्स (pullback mappings) के माध्यम से सटीक और अनुमानित मान-संरक्षण संरचनाओं (value-preserving structures) की खोज करता है।

Zuyuan Zhang, Fei Xu Yu, Tian Lan2026-05-08
🔢 mathematics

Learning to Cut: Reinforcement Learning for Benders Decomposition

यह शोध पत्र RLBD का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो पारंपरिक और पर्यवेक्षित शिक्षण (supervised learning) दृष्टिकोणों की तुलना में दो-चरणीय स्टोकेस्टिक प्रोग्राम्स को हल करने की कम्प्यूटेशनल दक्षता और सामान्यीकरण में उल्लेखनीय सुधार करने के लिए एक न्यूरल नेटवर्क पॉलिसी के माध्यम से अनुकूल रूप से बेंडर्स कट्स (Benders cuts) का चयन करता है।

Haochen Cai, Xian Yu2026-05-08
🤖 machine learning

On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR

यह शोध पत्र प्रकट करता है कि सत्यापन योग्य पुरस्कारों के साथ सुदृढीकरण सीखना (RLVR) निहित पुरस्कार ओवरफिटिंग प्रदर्शित करता है और लो-रैंक डायनेमिक्स के माध्यम से संचालित होता है, जहाँ उन्नत तर्क क्षमताएं रैंक-1 घटकों में केंद्रित होती हैं जो एक विशिष्ट हेवी-टेल्ड सिंगुलर स्पेक्ट्रम को अनुकूलित करती हैं जबकि अन्य मॉडल ज्ञान को त्याग देती हैं।

Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang, Ning Lv, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua2026-05-08
🤖 machine learning

Coordination Matters: Evaluation of Cooperative Multi-Agent Reinforcement Learning

यह शोध पत्र तर्क देता है कि मानक रिटर्न-आधारित मेट्रिक्स सहकारी मल्टी-एजेंट सुदृढीकरण लर्निंग (cooperative multi-agent reinforcement learning) के मूल्यांकन के लिए अपर्याप्त हैं और एक समन्वय-जागरूक (coordination-aware) मूल्यांकन ढांचे का प्रस्ताव करता है, जिसे STAT टेस्टबेड के माध्यम से कार्यान्वित किया गया है, जो एजेंट समन्वय तंत्रों और स्केलेबिलिटी चुनौतियों में महत्वपूर्ण अंतर को प्रकट करता है जिन्हें कुल प्रदर्शन स्कोर अक्सर अस्पष्ट कर देते हैं।

Maria Ana Cardei, Matthew Landers, Afsaneh Doryab2026-05-08
🤖 machine learning

Cross-Modal Navigation with Multi-Agent Reinforcement Learning

यह शोध पत्र CRONA को प्रस्तुत करता है, जो क्रॉस-मोडल नेविगेशन के लिए एक मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है, जो जटिल वातावरणों में, जहाँ सिंगल-एजेंट मॉडल संघर्ष करते हैं, रोबस्ट और कुशल एम्बॉडीड नेविगेशन प्राप्त करने के लिए एक सेंट्रलाइज्ड क्रिटिक के साथ मोडैलिटी-स्पेशलाइज्ड एजेंट्स का लाभ उठाता है।

Shuo Liu, Xinzichen Li, Christopher Amato2026-05-08
💬 NLP

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

यह शोध पत्र UniSD का प्रस्ताव करता है, जो एक एकीकृत स्व-डिस्टिलेशन (self-distillation) ढांचा है जो बड़े भाषा मॉडलों (large language models) में पर्यवेक्षण विश्वसनीयता (supervision reliability) और प्रशिक्षण स्थिरता (training stability) को संबोधित करने के लिए पूरक तंत्रों को व्यवस्थित रूप से एकीकृत करता है, जिससे अधिक शक्तिशाली बाहरी शिक्षकों (external teachers) पर निर्भर किए बिना विविध बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।

Yiqiao Jin, Yiyang Wang, Lucheng Fu, Yijia Xiao, Yinyi Luo, Haoxin Liu, B. Aditya Prakash, Josiah Hester, Jindong Wang (…)2026-05-08