🤖 machine learning

Stationary MMD Points

यह शोध पत्र सैद्धांतिक रूप से प्रदर्शित करता है कि मैक्सिमम मीन डिसक्रीपेंसी (MMD) के स्टेशनरी पॉइंट्स संख्यात्मक एकीकरण त्रुटियों (numerical integration errors) को MMD की तुलना में अधिक तेज़ी से शून्य करते हैं, और यह सिद्ध करता है कि MMD ग्रेडिएंट फ्लो इन बिंदुओं की गणना करने के लिए एक व्यावहारिक विधि प्रदान करते हैं जिसमें एक नवीन गैर-अनंत (non-asymptotic) परिमित-कण त्रुटि सीमा (finite-particle error bound) निहित है।

Zonghao Chen, Toni Karvonen, Heishiro Kanagawa, François-Xavier Briol, Chris. J. Oates2026-05-13
🤖 machine learning

Trajectory First: A Curriculum for Discovering Diverse Policies

यह शोध पत्र "ट्रैजेक्टरी फर्स्ट" (Trajectory First) प्रस्तावित करता है, जो एक दो-चरणीय करिकुलम लर्निंग फ्रेमवर्क है जो विविध, उच्च-पुरस्कार वाले व्यवहार उत्पन्न करने के लिए एक स्प्लाइन-आधारित ट्रैजेक्टरी प्रायर (spline-based trajectory prior) का लाभ उठाता है और तत्पश्चात उन्हें रिएक्टिव पॉलिसियों में संकुचित (distill) करता है, जिससे रोबोटिक मैनिपुलेशन जैसे जटिल कार्यों के लिए मौजूदा कंस्ट्रेंड-डाइवर्सिटी सुदृढीकरण शिक्षण (constrained-diversity reinforcement learning) विधियों में पाई जाने वाली सीमित अन्वेषण और व्यवहार संबंधी विविधता की समस्याओं को दूर किया जा सके।

Cornelius V. Braun, Sayantan Auddy, Marc Toussaint2026-05-13
📊 statistics

Adversarial Causal Tuning for Realistic Time-series Generation

यह शोध पत्र एडवरसेरियल कॉज़ल ट्यूनिंग (ACT) प्रस्तुत करता है, जो एक ऐसी कार्यप्रणाली है जो यथार्थवादी टाइम-सीरीज़ डेटा उत्पन्न करने के लिए इष्टतम कॉज़ल मॉडल की पहचान करने हेतु एडवरसेरियल ट्रेनिंग और AutoML का लाभ उठाती है, जो अवलोकन संबंधी और हस्तक्षेप संबंधी दोनों वितरणों को सटीक रूप से प्रतिरूपित करती है, जिससे सुदृढ़ कॉज़ल रीजनिंग और डिजिटल ट्विन अनुप्रयोग सक्षम होते हैं।

Nikolaos Gkorgkolis, Nikolaos Kougioulis, MingXue Wang, Bora Caglayan, Andrea Tonon, Dario Simionato, Ioannis Tsamardino (…)2026-05-13
⚛️ quantum physics

Deep reinforcement learning for near-deterministic preparation of cubic- and quartic-phase gates in photonic quantum computing

यह शोध पत्र प्रदर्शित करता है कि डीप रिइन्फोर्समेंट लर्निंग केवल फोटॉन-संख्या-सुलझाने वाले मापन (photon-number-resolving measurements) का उपयोग करके एक क्वांटम ऑप्टिकल सर्किट को नियंत्रित कर सकता है ताकि क्यूबिक-फेज अवस्थाओं को तैयार करने और यूनिवर्सल कंटीन्यूअस-वैरिएबल क्वांटम कंप्यूटिंग के लिए सीधे क्वार्टिक-फेज गेट्स उत्पन्न करने में 96% सफलता दर प्राप्त की जा सके।

Amanuel Anteneh, Léandre Brunel, Carlos González-Arciniegas, Olivier Pfister2026-05-13
🤖 machine learning

Strategically Deceptive Model Deployment in Performative Prediction

यह शोध पत्र डिकपल्ड परफॉर्मेटिव प्रेडिक्शन (DPP) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह प्रदर्शित करता है कि संस्थान कम परिचालन जोखिम प्राप्त करने के लिए उपयोगकर्ताओं को विभिन्न, क्यूरेटेड मॉडल प्रकट करते हुए अपने अपारदर्शी आंतरिक मॉडलों को रणनीतिक रूप से तैनात कर सकते हैं, जो उपयोगकर्ता धोखे की लागत को ध्यान में रखने के बाद भी लाभदायक बना रहता है और मॉडल प्रकटीकरण पर नियामक निरीक्षण की महत्वपूर्ण आवश्यकता पर प्रकाश डालता है।

Javier Sanguino Bautiste, Thomas Kehrenberg, Jose A. Lozano, Novi Quadrianto2026-05-13
📊 statistics

Sequential Off-Policy Learning with Logarithmic Smoothing

यह शोध पत्र एक अनुक्रमिक ऑफ-पॉलिसी लर्निंग एल्गोरिदम प्रस्तुत करता है जो संचित डेटा पर नीतियों को पुनरावृत्ति से अपडेट करने वाले सामान्य वास्तविक दुनिया के परिदृश्य को प्रभावी ढंग से संभालने के लिए लॉगरिदमिक स्मूथिंग (Logarithmic Smoothing) अनुमान को ऑनलाइन PAC-बेयसियन (PAC-Bayesian) उपकरणों के साथ जोड़ता है, जो सैद्धांतिक और अनुभवजन्य दोनों रूप से मौजूदा बैच विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Maxime Haddouche, Otmane Sakhi2026-05-13
🤖 machine learning

Focusing Influence Mechanism for Multi-Agent Reinforcement Learning

यह शोध पत्र फोकसिंग इन्फ्लुएंस मैकेनिज्म (FIM) का प्रस्ताव करता है, जो एक एंट्रॉपी-आधारित मानदंड और एलिजिबिलिटी ट्रेसेस का उपयोग करके एजेंटों को कम-अन्वेषित अवस्था क्षेत्रों की ओर निर्देशित करने और समन्वित संयुक्त व्यवहार को बनाए रखने के माध्यम से विरल पुरस्कारों (sparse rewards) के तहत सहकारी मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) को उन्नत करता है।

Yisak Park, Sunwoo Lee, Seungyul Han2026-05-13
💬 NLP

Learning Adapter Rank via Symmetry Breaking

यह शोध पत्र लो-रैंक वेरिएशनल ड्रॉपआउट (LRVD) प्रस्तुत करता है, जो एक ऐसा बेयसियन ढांचा है जो वेरिएशनल इन्फरेंस के माध्यम से LoRA की रोटेशनल सिमिट्री को तोड़ता है ताकि न्यूनतम पैरामीटर ओवरहेड के साथ प्रभावी एडैप्टर रैंक और प्रेडिक्टिव अनसर्टेन्टी को स्वचालित रूप से निर्धारित किया जा सके।

Cooper Doyle, Andy Hu, Rebecca Chan, Anna Leontjeva2026-05-13
💰 quantitative finance

Overparametrized models with posterior drift

यह शोध पत्र प्रदर्शित करता है कि पोस्टीरियर ड्रिफ्ट (posterior drift) ओवरपैरामीटराइज्ड मशीन लर्निंग मॉडल्स की आउट-ऑफ-सैंपल पूर्वानुमान सटीकता को महत्वपूर्ण रूप से कम कर देता है, विशेष रूप से वित्तीय बाजारों में जहाँ शासन परिवर्तन (regime changes) होते हैं, और अंततः स्टॉक मार्केट भविष्यवाणियों के लिए बड़े लीनियर मॉडल्स का उपयोग करते समय सावधानी बरतने की सलाह देता है क्योंकि वे पैरामीटर चयन और उप-अवधियों के प्रति संवेदनशील होते हैं।

Guillaume Coqueret, Martial Laguerre2026-05-13
📊 statistics

Localising Dropout Variance in Twin Networks

यह शोध पत्र डीप ट्विन नेटवर्क्स के लिए एक लेयर-वाइज वेरिएंस डिकंपोजिशन पद्धति प्रस्तुत करता है जो स्वतंत्र मोंटे कार्लो ड्रॉपआउट टॉगलिंग के माध्यम से एनकोडर अनिश्चितता को हेड अनिश्चितता से अलग करता है, यह प्रदर्शित करते हुए कि एनकोडर घटक प्रभावी रूप से वितरण संबंधी बदलावों (डिस्ट्रिब्यूशनल शिफ्ट्स) की पहचान करता है और बेहतर व्यक्तिगत उपचार-प्रभाव अनुमान (इंडिविजुअल ट्रीटमेंट-इफेक्ट एस्टीमेशन) के लिए डेटा संग्रह रणनीतियों को निर्देशित करता है।

Cooper Doyle2026-05-13