📊 statistics

Policy Optimization in Hybrid Discrete-Continuous Action Spaces via Mixed Gradients

यह शोध पत्र हाइब्रिड पॉलिसी ऑप्टिमाइज़ेशन (HPO) का प्रस्ताव करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो हाइब्रिड डिस्क्रीट-कंटीन्यूअस एक्शन स्पेस में निष्पक्ष और कुशल प्रशिक्षण सक्षम करने के लिए पाथवाइज (pathwise) और स्कोर-फंक्शन ग्रेडिएंट्स को जोड़ती है, जो उच्च-आयामी नियंत्रण और इन्वेंट्री समस्याओं में PPO जैसे मानक दृष्टिकोणों से काफी बेहतर प्रदर्शन करती है।

Matias Alvo, Daniel Russo, Yash Kanoria2026-05-15
📊 statistics

Language-Induced Priors for Domain Adaptation

यह शोध पत्र एक लैंग्वेज-इंड्यूस्ड प्रायर (LIP) फ्रेमवर्क प्रस्तावित करता है जो कोल्ड-स्टार्ट डोमेन अडैप्टेशन में सोर्स डोमेन चयन को निर्देशित करने के लिए विशेषज्ञ टेक्स्टुअल विवरणों और प्रीट्रेन्ड लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो नकारात्मक स्थानांतरण (नेगेटिव ट्रांसफर) को प्रभावी ढंग से कम करते हुए एसिम्प्टोटिक कंसिस्टेंसी सुनिश्चित करता है।

Qiyuan Chen, Jiayu Zhou, Raed Al Kontar2026-05-15
🤖 machine learning

Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry

यह शोध पत्र मैट्रिक्स-स्पेस रीइन्फोर्समेंट लर्निंग (MSRL) प्रस्तुत करता है, जो एक ज्यामितीय ढांचा है जो स्थानीय संक्रमण ज्यामिति (local transition geometry) के बीजगणितीय संयोजन और हस्तांतरण को सक्षम करने के लिए धनात्मक अर्ध-निश्चित मैट्रिक्स डिस्क्रिप्टर (positive semidefinite matrix descriptors) के माध्यम से प्रक्षेपवक्र खंडों (trajectory segments) का प्रतिनिधित्व करता है, जिससे मौजूदा विधियों की तुलना में कंपोजिशनल जनरलाइजेशन में बेहतर नमूना दक्षता और प्रदर्शन प्राप्त होता है।

Zuyuan Zhang, Carlee Joe-Wong, Tian Lan2026-05-15
🤖 machine learning

Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment

यह शोध पत्र BBCritic प्रस्तुत करता है, जो एक नया प्रतिमान (पैराडाइम) है जो GUI आलोचना को बाइनरी क्लासिफिकेशन के बजाय एक निरंतर सिमेंटिक अलाइनमेंट समस्या के रूप में पुनर्गठित करता है, और मौजूदा मॉडलों की सीमाओं को दूर करने तथा अतिरिक्त एनोटेशन के बिना बेहतर रैंकिंग प्रदर्शन प्राप्त करने के लिए कंट्रास्टिव लर्निंग का उपयोग करता है।

Yuchen Sun, Pei Fu, Shaojie Zhang, Anan Du, Xiuwen Xi, Ruoceng Zhang, Zhenbo Luo, Jian Luan, Chongyang Zhang2026-05-15
🤖 machine learning

AIM-DDI: A Model-Agnostic Multimodal Integration Module for Drug-Drug Interaction Prediction

यह शोध पत्र AIM-DDI को प्रस्तुत करता है, जो एक मॉडल-अज्ञेय (model-agnostic) मल्टीमॉडल एकीकरण मॉड्यूल है जो विषम औषधि सूचनाओं को एक साझा लेटेंट स्पेस में टोकन के रूप में निरूपित करता है ताकि विविध आर्किटेक्चरों में, विशेष रूप से अनदेखी औषधियों के लिए, ड्रग-ड्रग इंटरेक्शन भविष्यवाणी को प्रभावी ढंग से बढ़ाया जा सके।

Yerin Park, Sangseon Lee2026-05-15
📊 statistics

Nearest-Neighbor Radii under Dependent Sampling

यह शोध पत्र स्थापित करता है कि स्ट्रॉन्ग मिक्सिंग डिपेंडेंट सैंपलिंग के तहत नियरेस्ट-नेबर रेडाई अपनी सूचनात्मक ज्यामितीय विशेषताओं को बनाए रखती हैं, जो वितरण-मुक्त लगभग निश्चित अभिसरण (distribution-free almost sure convergence) और तीक्ष्ण गैर-अनंत मोमेंट बाउंड्स प्रदर्शित करती हैं जो एम्बिएंट डायमेंशन के बजाय स्थानीय इंट्रिन्सिक डायमेंशन पर निर्भर करते हैं।

Yuanyuan Gao, Yilong Hou, Zhexiao Lin2026-05-15
🤖 machine learning

Exemplar Partitioning for Mechanistic Interpretability

यह शोध पत्र एक्सेंप्लर पार्टिशनिंग (EP) को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड विधि है जो सीखे गए भार (weights) के बजाय प्रेक्षित एक्सेंप्लर्स (exemplars) का उपयोग करके लैंग्वेज मॉडल एक्टिवेशन्स से व्याख्या योग्य फीचर डिक्शनरीज़ का निर्माण करती है, जिससे लगभग 1,000 गुना कम ट्रेनिंग टोकन्स के साथ स्पार्स ऑटोएनकोडर्स के तुलनीय व्याख्यात्मक प्रदर्शन को प्राप्त किया जाता है और प्रत्यक्ष क्रॉस-मॉडल तुलना सक्षम की जाती है तथा अंतर्निहित आउट-ऑफ-डिस्ट्रीब्यूशन डिटेक्शन प्रदान किया जाता है।

Jessica Rumbelow2026-05-15
🤖 machine learning

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

यह शोध पत्र डिस्ट्रीब्यूशनली रोबस्ट एडेप्टिव टास्क सैंपलिंग (DRATS) को प्रस्तुत करता है, जो एक नवीन मल्टी-टास्क रीइन्फोर्समेंट लर्निंग एल्गोरिदम है जो एक मिनिमैक्स ऑब्जेक्टिव के माध्यम से कठिन कार्यों को अनुकूल रूप से प्राथमिकता देकर असंतुलित डेटा आवंटन को संबोधित करता है, जिससे MetaWorld-MT10 और MT50 जैसे बेंचमार्क पर डेटा दक्षता और सबसे खराब स्थिति के प्रदर्शन में सुधार होता है।

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna2026-05-15
⚡ electrical engineering

Randomized Atomic Feature Models for Physics-Informed Identification of Dynamic Systems

यह शोध पत्र एक भौतिकी-प्रेरित सिस्टम आइडेंटिफिकेशन फ्रेमवर्क प्रस्तुत करता है जो आवेग प्रतिक्रियाओं (इम्पल्स रिस्पॉन्स) को स्थिर डैम्प्ड एक्सपोनेंशियल के रैंडम सुपरपोजिशन के रूप में निरूपित करता है, जो समस्या को ऑपरेटर-थ्योरेटिक गारंटियों और लचीले भौतिक बाधाओं के साथ एक उत्तल अनुकूलन (कॉन्वेक्स ऑप्टिमाइज़ेशन) कार्य के रूप में तैयार करता है ताकि खराब उत्तेजना स्थितियों के तहत भी गतिशील प्रणालियों की सुदृढ़, व्याख्यात्मक और स्थिर रिकवरी सक्षम की जा सके।

Rajiv Singh, Mario Sznaier, Lennart Ljung2026-05-15
🤖 machine learning

Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces

यह शोध पत्र "मिनिमल कोर्स" (minimal cores) की अवधारणा प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि लैंग्वेज मॉडल के रीजनिंग ट्रेसेस (reasoning traces) काफी हद तक ओवरकम्प्लीट (overcomplete) हैं, जो यह प्रकट करते हैं कि चरणों का एक छोटा उपसमुच्चय (subset) भविष्यवाणात्मक सटीकता को बनाए रखते हुए अंतर्निहित तर्क प्रक्रिया का एक स्वच्छ, निम्न-आयामी ज्यामितीय प्रतिनिधित्व प्रदान करता है।

Sanjoy Chowdhury, Dinesh Manocha2026-05-15