🤖 AI

Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation

यह शोध पत्र GLIDE को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी है जो विभिन्न प्रेडिक्शन-पावर्ड इन्फरेंस विधियों और सैंपलर्स को एक मानकीकृत API के तहत एकीकृत करती है ताकि वैध अनिश्चितता अनुमानों के साथ एजेंटिक सिस्टम के विश्वसनीय, निष्पक्ष मूल्यांकन को सक्षम बनाया जा सके और एनोटेशन लागत को महत्वपूर्ण रूप से कम किया जा सके।

Grégoire Martinon, Ibrahim Merad, Mohammed Raki2026-06-01
🤖 machine learning

The Terminal Representation in Reinforcement Learning

यह शोध पत्र टर्मिनल रिप्रेजेंटेशन (TR) को प्रस्तुत करता है, जो सुदृढीकरण शिक्षण (reinforcement learning) में सक्सेसर और डिफॉल्ट रिप्रेजेंटेशन का एक नवीन, निम्न-आयामी विकल्प है जो आइजनडीकंपोजिशन (eigendecomposition) या सममित ट्रांजिशन धारणाओं की आवश्यकता के बिना रिवॉर्ड-वेटेड प्रक्षेप पथों (trajectories) को कैप्चर करता है, जिससे विकल्प खोज (option discovery) और ट्रांसफर लर्निंग जैसे कार्यों के लिए एक गणनात्मक रूप से कुशल आधार प्राप्त होता है।

Amir Esterhuysen, Anders Jonsson2026-06-01
🤖 machine learning

Contextual Scalarisation Thompson Sampling for multi-objective decisions in public media

यह शोध पत्र कॉन्टेक्स्टुअल स्केलरिसेशन थॉमसन सैंपलिंग (CSTS) को प्रस्तुत करता है, जो एक मल्टी-ऑब्जेक्टिव कॉन्टेक्स्टुअल बैंडिट एल्गोरिदम है जो संदर्भ के आधार पर प्रतिस्पर्धी संपादकीय उद्देश्यों को भारित करने के लिए गतिशील रूप से सीखता है, और स्विस नेशनल ब्रॉडकास्टर के वास्तविक डेटा पर बेहतर प्रासंगिकता और विशेषज्ञ क्यूरेशन के साथ संरेखण प्रदर्शित करता है।

Théo Maëtz, Luc Guillet, Andrea Cavallaro2026-06-01
🤖 AI

Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation

यह शोध पत्र मल्टीट्रैक म्यूजिक ट्रांसफॉर्मर-आधारित प्रतीकात्मक संगीत सृजन (symbolic music generation) में बिना पुन: प्रशिक्षण (retraining) के, पिच और ड्यूरेशन गुणों पर व्याख्यात्मक, नियत और विसंयोजित (disentangled) नियंत्रण प्राप्त करने के लिए डिफरेंस-इन-मीन्स (Difference-in-Means) और ग्राम-श्मिट ऑर्थोगोनलाइजेशन (Gram-Schmidt Orthogonalization) का उपयोग करते हुए एक इन्फरेंस-टाइम एक्टिवेशन स्टीयरिंग फ्रेमवर्क प्रस्तावित करता है।

Ioannis Prokopiou, Pantelis Vikatos, Maximos Kaliakatsos-Papakostas, Theodoros Giannakopoulos, Themos Stafylakis2026-06-01
📊 statistics

Non-Asymptotic Convergence of Stochastic Iterative Algorithms: A Lyapunov Framework

यह शोध पत्र विभिन्न सेटिंग्स, जिनमें i.i.d. और मार्कोवियन शोर (Markovian noise) शामिल हैं, के लिए गैर-असिम्प्टोटिक अभिसरण गारंटी प्रदान करने हेतु सामान्यीकृत मोरो एनवेलप्स (generalized Moreau envelopes) का उपयोग करते हुए एक एकीकृत लियापुनोव फ्रेमवर्क प्रस्तुत करता है, जिसमें सुदृढीकरण शिक्षण (reinforcement learning) और स्टोकेस्टिक ग्रेडिएंट डिसेंट के विशिष्ट अनुप्रयोग शामिल हैं।

Zaiwei Chen, Siva Theja Maguluri2026-06-01
🤖 machine learning

Forgetting Has Neighbors: Localized Collateral Forgetting in Machine Unlearning

यह शोध पत्र "स्थानीय सहवर्ती विस्मृति" (localized collateral forgetting) की पहचान और समाधान करता है, जो एक ऐसी घटना है जहाँ मशीन अनलर्निंग विधियाँ विसंगत सरोगेट लक्ष्यों के कारण हटाए गए डेटा के निकट स्थित प्रशिक्षण उदाहरणों के लिए भविष्यवाणियों को असमान रूप से खराब कर देती हैं, और इसके समाधान के रूप में "लोकल टीचर डिस्टिलेशन" (Local Teacher Teacher Distillation) का प्रस्ताव करता है जो एक प्रभावी शमन रणनीति के रूप में अनलर्न्ड मॉडल्स को पूर्ण रिट्रेनिंग के अधिक निकट संरेखित करती है।

Polina Dolgova, Sebastian U. Stich2026-06-01
🤖 machine learning

Generalized Intention Modeling in Multi-Agent Reinforcement Learning

यह शोध पत्र एक कार्य-अनुकूलित प्रतिद्वंद्वी मॉडलिंग ढांचे (task-adaptive opponent modeling framework) का प्रस्ताव करता है जो इरादे के प्रदर्शन-संचालित मिश्रण (performance-driven mixture of intent representations) को सीखता है और प्रतिद्वंद्वी की उस जानकारी को पकड़ने के लिए एक नए पारस्परिक सूचना-आधारित प्रतिनिधित्व (mutual information-based representation) को पेश करता है जो ईगो-एजेंट के भविष्य के प्रतिफल (future returns) के लिए सबसे अधिक प्रासंगिक है, जिससे विविध मल्टी-एजेंट सुदृढीकरण शिक्षण (multi-agent reinforcement learning) कार्यों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

Mateusz Odrowaz-Sypniewski, Jasmine Bayrooti, Ajay Shankar, Amanda Prorok2026-06-01
🤖 AI

Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents

यह शोधपत्र CoSee ऑडिटिंग फ्रेमवर्क को प्रस्तुत करता है जो यह प्रकट करता है कि संसाधन-बाधित विजुअल एजेंटों के बीच सहज साझा-अवस्था सहयोग अक्सर शोर सुदृढ़ीकरण (noise reinforcement) और नीति पतन (policy-collapse) के माध्यम से मतिभ्रम (hallucinations) को बढ़ाता है, जो यह दर्शाता है कि विश्वसनीय मॉड्यूलर डिज़ाइन के लिए तर्क की गहराई के बजाय संचार निष्ठा (communication fidelity) ही महत्वपूर्ण बाधा है।

Yunpeng Zhou2026-06-01
🤖 machine learning

dashi: A Python library for Dataset Shift Characterization to Support Trustworthy AI Development and Deployment

यह शोध पत्र **dashi** को प्रस्तुत करता है, जो एक ओपन-सोर्स पायथन लाइब्रेरी है जो विश्वसनीय एआई (AI) में सुलभ डेटासेट शिफ्ट विश्लेषण की महत्वपूर्ण आवश्यकता को संबोधित करती है, और टेम्पोरल (temporal) एवं मल्टी-सोर्स डोमेन में वितरण परिवर्तनों को चित्रित करने के लिए अनसुपरवाइज्ड (unsupervised) और सुपरवाइज्ड (supervised) दोनों विधियों को प्रदान करती है, जिससे स्वास्थ्य सेवा अनुप्रयोगों में मशीन लर्निंग पाइपलाइनों की मजबूती और सुरक्षा को बढ़ाया जा सके।

David Fernández-Narro, Pablo Ferri, Ángel Sánchez-García, Juan M. García-Gómez, Carlos Sáez2026-06-01
🤖 AI

Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning

यह शोध पत्र एक नवीन मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो लेटेंट स्टेट्स को एनवायरनमेंट और टीममेट घटकों में विभाजित करके और पार्टनर की मंशा का अनुमान लगाने के लिए 'थ्योरी-ऑफ-माइंड' हेड का उपयोग करके ड्रीमर-शैली के वर्ल्ड मॉडल्स को बेहतर बनाता है, जिससे एजेंट सामाजिक व्यवहार के सिमुलेशन के माध्यम से ज़ीरो-शॉट और फ्यू-शॉट कोआर्डिनेशन प्राप्त करने में सक्षम होते हैं।

Tomas Leroy-Stone2026-06-01