🤖 machine learning

Augmented Lagrangian Method for Last-Iterate Convergence for Constrained MDPs

यह शोध पत्र एक इनएक्सैक्ट ऑगमेंटेड लैग्रेंजियन विधि पर आधारित एक सामान्य ढांचे का प्रस्ताव करता है जो टैबुलर, लॉग-लीनियर और जटिल गैर-रेखीय नीति सेटिंग्स में बाधाओं वाले मार्कोव निर्णय प्रक्रियाओं के लिए सिद्ध वैश्विक अंतिम-इटरेशन अभिसरण (global last-iterate convergence) प्राप्त करता है, जो मौजूदा मिश्रण-नीति दृष्टिकोणों की व्यावहारिक सीमाओं को संबोधित करता है।

Michael Lu, Max Qiushi Lin, Mo Chen, Sharan Vaswani2026-05-13
🤖 machine learning

Unlocking Compositional Generalization in Continual Few-Shot Learning

यह शोध पत्र एक नवीन निरंतर अल्प-नमना (continual few-shot) शिक्षण ढांचे का प्रस्ताव करता है जो समग्र वर्ग पहचान के लिए प्रशिक्षण के दौरान स्लॉट निरूपणों को अनुकूलित करने और अनुमान के दौरान नवीन अवधारणाओं के लिए उन्हें गतिशील रूप से संयोजित करने हेतु स्व-पर्यवेक्षित विजन ट्रांसफॉर्मर के पैच-स्तरीय ज्यामिति का लाभ उठाकर प्रतिनिधित्व शिक्षण को संरचनात्मक अनुमान से अलग करता है, जिससे विनाशकारी विस्मृति (catastrophic forgetting) को कम करते हुए अत्याधुनिक सामान्यीकरण प्राप्त किया जाता है।

Phu-Quy Nguyen-Lam, Phu-Hoa Pham, Dao Sy Duy Minh, Chi-Nguyen Tran, Huynh Trung Kiet, Long Tran-Thanh2026-05-13
🤖 machine learning

Debiased Model-based Representations for Sample-efficient Continuous Control

यह शोध पत्र DR.Q का प्रस्ताव करता है, जो एक डिबायस्ड मॉडल-आधारित प्रतिनिधित्व एल्गोरिदम (debiased model-based representation algorithm) है जो स्टेट-एक्शन पेयर्स और नेक्स्ट स्टेट्स के बीच म्यूचुअल इंफॉर्मेशन को अधिकतम करके और ओवरफिटिंग एवं रिप्रेजेंटेशन बायस को कम करने के लिए फेड ड प्राथमिकता प्राप्त अनुभव पुनरावृत्ति (faded prioritized experience replay) का उपयोग करके निरंतर नियंत्रण (continuous control) में सैंपल दक्षता को बढ़ाता है।

Jiafei Lyu, Zichuan Lin, Scott Fujimoto, Kai Yang, Yangkun Chen, Saiyong Yang, Zongqing Lu, Deheng Ye2026-05-13
🤖 machine learning

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

यह शोध पत्र पर्सोना-कंडीशन्ड एडवरसैरियल प्रॉम्प्टिंग (PCAP) को प्रस्तुत करता है, जो एक रेड-टीमिंग फ्रेमवर्क है जो ट्रांसफर करने योग्य जेलब्रेक्स खोजने और समृद्ध, मेटाडेटा-युक्त डेटासेट उत्पन्न करने के लिए विविध हमलावर पर्सोना का लाभ उठाता है, जिससे प्रभावी स्वचालित संरेखण सक्षम होता है और लक्षित फाइन-ट्यूनिंग के माध्यम से मॉडल की मजबूती में महत्वपूर्ण सुधार होता है।

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith2026-05-13
🤖 machine learning

Online Continual Learning with Dynamic Label Hierarchies

यह शोध पत्र विकसित होती लेबल पदानुक्रमों (label hierarchies) के साथ ऑनलाइन निरंतर शिक्षण (online continual learning) के लिए DHOCL समस्या सेटिंग प्रस्तुत करता है और HALO का प्रस्ताव देता है, जो आंशिक पर्यवेक्षण (partial supervision) और सूक्ष्मता-निर्भर हस्तक्षेप (granularity-dependent interference) को दूर करने के लिए अनुकूलन योग्य वर्गीकरण शीर्षों (adaptive classification heads) और संगठित पदानुक्रमित प्रोटोटाइप (organized hierarchical prototypes) का उपयोग करता है, जिससे पदानुक्रमित सटीकता और स्थिरता में उत्कृष्ट प्रदर्शन प्राप्त होता है।

Xinrui Wang, Shao-Yuan Li, Bartłomiej Twardowski, Alexandra Gomez-Villa, Songcan Chen2026-05-13
🤖 machine learning

WorldComp2D: Spatio-semantic Representations of Object Identity and Location from Local Views

WorldComp2D एक नवीन, हल्का ढांचा (framework) है जो वस्तु की पहचान और स्थानिक स्थिति दोनों को कुशलतापूर्वक कैप्चर करने के लिए मल्टीस्केल लोकल रिसेप्टिव फील्ड्स का उपयोग करके लेटेंट स्पेस ज्योमेट्री को स्पष्ट रूप से संरचित करता है, जिससे वास्तविक समय के प्रदर्शन को बनाए रखते हुए पैरामीटर्स और कम्प्यूटेशनल लागत में महत्वपूर्ण कमी आती है।

SeongMin Jin, Doo Seok Jeong2026-05-13
🤖 machine learning

Federated Client Selection under Partial Visibility: A POMDP Approach with Spatio-Temporal Attention

यह शोध पत्र आंशिक दृश्यता के तहत फेडरेटेड लर्निंग में क्लाइंट चयन की चुनौती को संबोधित करता है, जिसमें समस्या को पार्शियली ऑब्जर्वेबल मार्कोव डिसीजन प्रोसेस (POMDP) के रूप में स्वरूपित किया गया है और एक नवीन स्थानिक-कालिक अटेंशन-आधारित सुदृढीकरण लर्निंग फ्रेमवर्क प्रस्तावित किया गया है जो विषम वातावरणों में बेहतर प्रदर्शन प्राप्त करने के लिए ऐतिहासिक वैश्विक मॉडलों और क्लाइंट एम्बेडिंग्स का लाभ उठाता है।

Qijun Hou, Yuchen Shi, Pingyi Fan, Khaled B. Letaief2026-05-13
📊 statistics

One-Step Generative Modeling via Wasserstein Gradient Flows

यह शोध पत्र W-Flow को प्रस्तुत करता है, जो एक वन-स्टेप (one-step) जनरेटिव मॉडलिंग फ्रेमवर्क है जो 1.29 FID के साथ स्टेट-ऑफ-द-आर्ट ImageNet जनरेशन और मल्टी-स्टेप डिफ्यूजन मॉडल्स की तुलना में लगभग 100×\times तेज़ सैंपलिंग प्राप्त करने के लिए वॉसरस्टीन ग्रेडिएंट फ्लो (Wasserstein gradient flows) को एक एकल न्यूरल नेटवर्क इन्फरेंस में संकुचित करता है।

Jiaqi Han, Puheng Li, Qiushan Guo, Renyuan Xu, Stefano Ermon, Emmanuel J. Candès2026-05-13
🧬 biology

Decomposing the Generalization Gap in PROTAC Activity Prediction: Variance Attribution and the Inter-Laboratory Ceiling

यह शोध पत्र PROTAC गतिविधि भविष्यवाणी में सामान्यीकरण अंतराल (generalization gap) का विश्लेषण करता है, जिसमें अंतर-प्रयोगशाला माप भिन्नता (inter-laboratory measurement variance) को प्रमुख सीमित कारक के रूप में पहचाना गया है जो लगभग 0.67 AUROC के आसपास एक प्रदर्शन सीमा उत्पन्न करता है, साथ ही इन मूल्यांकन चुनौतियोंों को संबोधित करने के लिए PROTAC-Bench डेटासेट और अंशांकन प्रोटोकॉल (calibration protocols) प्रस्तुत करता है।

Thor Klamt, Wolfgang Nejdl, Ming Tang2026-05-13
🤖 machine learning

Is Monotonic Sampling Necessary in Diffusion Models?

यह शोध पत्र व्यवस्थित रूप से इस बात की जांच करता है कि क्या गैर-एकदिष्ट (non-monotonic) शोर शेड्यूल्स डिफ्यूजन मॉडल जनरेशन में सुधार कर सकते हैं, यह पाते हुए कि हालांकि ऐसे शेड्यूल्स सार्वभौमिक रूप से एकदिष्ट बेसलाइन की तुलना में प्रदर्शन करने में विफल रहते हैं, फिर भी इसके परिणामस्वरूप होने वाले प्रदर्शन दंड की गंभीरता संरचनात्मक अंतरों के कारण विभिन्न आर्किटेक्चर (DDPM, फ्लो मैचिंग, और EDM) में काफी भिन्न होती है, जो एक नव-प्रस्तावित 'शेड्यूल सेंसिटिविटी कोएफिशिएंट' द्वारा परिमाणित की गई है।

Muhammad Haris Khan2026-05-13