🤖 machine learning

Epistemic Uncertainty Quantification for Pre-trained VLMs via Riemannian Flow Matching

यह शोध पत्र REPVLM प्रस्तुत करता है, जो प्री-ट्रेन्ड विजन-लैंग्वेज मॉडल एम्बेडिंग्स के हाइपरस्फेरिकल मैनिफोल्ड पर प्रायिकता घनत्व (प्रोबेबिलिटी डेंसिटी) की गणना करने के लिए रिमानियन फ्लो मैचिंग का लाभ उठाता है, जिससे प्रभावी एपिस्टेमिक अनसर्टेंटी क्वांटिफिकेशन, आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन और स्वचालित डेटा क्यूरेशन सक्षम होता है।

Li Ju, Mayank Nautiyal, Andreas Hellander, Ekta Vats, Prashant Singh2026-05-21
🤖 machine learning

Learning Incentive Structures for Cooperative Resilience in Multi-Agent Systems under Social Dilemmas

यह शोधपत्र एक मल्टी-एजेंट सुदृढीकरण लर्निंग (multi-agent reinforcement learning) ढांचे का प्रस्ताव करता है जो व्यवधानों के अधीन सामाजिक दुविधा वाले परिवेशों में सहकारी लचीलेपन को बढ़ावा देने और सामूहिक कल्याण को बनाए रखने के लिए हाइब्रिड प्रोत्साहन संरचनाओं को सीखने और एकीकृत करने का कार्य करता है।

Manuela Chacon-Chamorro, Luis Felipe Giraldo, Nicanor Quijano2026-05-21
📊 statistics

Learning to Defer in Non-Stationary Time Series via Switching State-Space Models

यह शोधपत्र L2D-SLDS प्रस्तुत करता है, जो एक ऑनलाइन लर्निंग-टू-डिफर फ्रेमवर्क है जो नॉन-स्टेशनरी टाइम सीरीज़ के लिए एक स्विचिंग लीनियर-गौसियन स्टेट-स्पेस मॉडल का उपयोग करता है ताकि आंतरिक प्रेडिक्टर और बाहरी विशेषज्ञों के बीच निर्णयों को गतिशील रूप से रूट किया जा सके और रिग्रेट एवं डिफरल दरों को न्यूनतम किया जा सके।

Yannis Montreuil, Letian Yu, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi2026-05-21
🤖 machine learning

DC-LA: Difference-of-Convex Langevin Algorithm

यह शोध पत्र डिफरेंस-ऑफ-कॉन्वेक्स लैंघ्विन एल्गोरिदम (DC-LA) प्रस्तुत करता है, जो एक नवीन सैंपलिंग विधि है जो गैर-सुचारू (non-smooth), गैर-लॉग-कॉन्केव (non-log-concave) लक्ष्य वितरणों को संभालने के लिए मोरो एनवेलप्स (Moreau envelopes) और डीसी प्रोग्रामिंग का लाभ उठाता है, जबकि वासेस्टीन दूरी (Wasserstein distance) में इसकी अभिसरण (convergence) स्थापित करता है और सिंथेटिक एवं वास्तविक दुनिया के कंप्यूटेड टोमोग्राफी अनुप्रयोगों में इसकी प्रभावकारिता को प्रदर्शित करता है।

Hoang Phuc Hau Luu, Zhongjian Wang2026-05-21
💬 NLP

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

यह शोध पत्र BudgetMem को प्रस्तुत करता है, जो एक रनटाइम एजेंट मेमोरी फ्रेमवर्क है जो मेमोरी मॉड्यूल्स के माध्यम से क्वेरी-जागरूक बजट स्तरों (query-aware budget tiers) को गतिशील रूप से चुनने के लिए सुदृढीकरण लर्निंग-आधारित राउटर का उपयोग करता है, जो प्रभावी रूप से कार्य प्रदर्शन और कम्प्यूटेशनल लागत के बीच के संतुलन को अनुकूलित करता है।

Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei (…)2026-05-21
🤖 machine learning

Can Microcanonical Langevin Dynamics Leverage Mini-Batch Gradient Noise?

यह शोध पत्र एक व्यवस्थित सैद्धांतिक विश्लेषण और एक नवीन प्रीकंडीशनिंग योजना विकसित करके माइक्रोकेनोनिकल लैंग्विन मोंटे कार्लो की कम्प्यूटेशनल बाधा को संबोधित करता है जो मिनी-बैच ग्रेडिएंट नॉइज़ के प्रभावी उपयोग को सक्षम बनाता है, जिसके परिणामस्वरूप एक सुदृढ़, स्केलेबल सैंपलर (SMILE) प्राप्त होता है जो उच्च-आयामी बेयसियन अनुमान कार्यों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Emanuel Sommer, Kangning Diao, Jakob Robnik, Uros Seljak, David Rügamer2026-05-21
🤖 machine learning

CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation

CompilerKV एक ऑफलाइन-कंपाइल्ड KV रिटेंशन पॉलिसी पेश करता है जो शोर वाले ऑनलाइन एस्टीमेशन को कुशल O(1)O(1) लुकअप से बदलने के लिए क्रॉस-प्रॉम्ट रेगुलैरिटी का लाभ उठाता है, जो मौजूदा प्रीफिल-ओनली कंप्रेशन विधियों की तुलना में अत्यधिक मेमोरी बाधाओं के तहत अत्याधुनिक प्रदर्शन और बेहतर स्केलेबिलिटी प्राप्त करता है।

Ning Yang, Chengzhi Wang, Yibo Liu, Baoliang Tian, Haijun Zhang2026-05-21
💬 NLP

Bayesian Preference Learning for Test-Time Steerable Reward Models

यह शोध पत्र वेरिएशनल इन-कॉन्टेक्स्ट रिवॉर्ड मॉडलिंग (ICRM) का प्रस्ताव करता है, जो एक नवीन बेयसियन ढांचा है जो इन-कॉन्टेक्स्ट प्रदर्शनों के माध्यम से अनदेखी प्राथमिकता वितरणों के अनुकूल होकर रिवॉर्ड मॉडल्स के लिए टेस्ट-टाइम स्टीयरेबिलिटी (steerability) को सक्षम बनाता है, जिससे सटीकता, अंशांकन (calibration) और बहु-उद्देश्यीय संरेखण में सुधार होता है और साथ ही ओवर-ऑप्टिमाइज़ेशन के विरुद्ध सैद्धांतिक गारंटी भी प्रदान करता है।

Jiwoo Hong, Shao Tang, Zhipeng Wang2026-05-21
💬 NLP

Gated Normalization Removal and Scale Anchoring in Pre-Norm Transformers

यह शोध पत्र TaperNorm प्रस्तुत करता है, जो प्री-नॉर्म ट्रांसफॉर्मर्स के लिए एक गेटेड दृष्टिकोण है जो इन्फरेंस थ्रूपुट को बेहतर बनाने के लिए आंतरिक नॉर्मलाइजेशन परतों को धीरे-धीरे हटाता है और यह प्रकट करता है कि अंतिम नॉर्मलाइजेशन मुख्य रूप से प्री-लॉगिट रिप्रजेंटेशन्स के स्केल को एंकर करने का कार्य करता है, एक ऐसी भूमिका जिसे पूरी तरह से नॉर्म-फ्री मॉडल्स को सक्षम करने के लिए फिक्स्ड-टारगेट स्केलिंग द्वारा प्रतिस्थापित किया जा सकता है।

Andrei Kanavalau, Carmen Amo Alonso, Sanjay Lall2026-05-21
📊 statistics

Federated Learning of Nonlinear Temporal Dynamics with Graph Attention-based Cross-Client Interpretability

यह शोध पत्र एक ऐसा फेडरेटेड लर्निंग फ्रेमवर्क प्रस्तावित करता है जो गैररेखीय स्टेट स्पेस मॉडल्स से प्राप्त लेटेंट स्टेट्स पर ग्राफ अटेंशन नेटवर्क्स का उपयोग करता है ताकि विकेंद्रीकृत औद्योगिक प्रणालियों में क्रॉस-क्लाइंट टेम्पोरल इंटरडिपेंडेंसीज़ को सीखा और समझा जा सके, भले ही क्लाइंट्स फिक्स्ड, अपरिवर्तनीय प्रोप्राइटरी मॉडल्स का संचालन कर रहे हों।

Ayse Tursucular, Ayush Mohanty, Nazal Mohamed, Nagi Gebraeel2026-05-21