🤖 AI

Modular Reinforcement Learning For Cooperative Swarms

यह शोध पत्र एक मॉड्यूलर सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) दृष्टिकोण प्रस्तावित करता है जो कम्प्यूटेशनल रूप से सीमित रोबोट झुंडों की स्मृति सीमाओं को दूर करने के लिए स्थानिक अंतःक्रिया अवस्थाओं को अलग-अलग शिक्षण प्रक्रियाओं में विभाजित करता है, और सहयोगात्मक खोज कार्यों में इसकी प्रभावशीलता को प्रदर्शित करता है।

Erel Shtossel, Gal A. Kaminka2026-05-07
🤖 AI

DART: A Vision-Language Foundation Model for Comprehensive Rope Condition Monitoring

DART एक नवीन विजन-लैंग्वेज फाउंडेशन मॉडल है जो सिंथेटिक फाइबर रस्सियों के लिए क्षति वर्गीकरण (damage classification), निरंतर गंभीरता अनुमान (continuous severity estimation) और स्वचालित रिपोर्टिंग को एक एकीकृत रूप में प्रस्तुत करता है, जो विशिष्ट फ्यूजन और लॉस मैकेनिज्म के साथ एक JEPA-आधारित आर्किटेक्चर का लाभ उठाकर कार्य-विशिष्ट फाइन-ट्यूनिंग के बिना कई निरीक्षण कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Anju Rani, Daniel Ortiz-Arroyo, Petar Durdevic2026-05-07
🤖 machine learning

EP-GRPO: Entropy-Progress Aligned Group Relative Policy Optimization with Implicit Process Guidance

यह शोध पत्र EP-GRPO को प्रस्तुत करता है, जो एक विस्तारित ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) फ्रेमवर्क है, जो इंट्रिन्सिक एंट्रॉपी (intrinsic entropy) और पॉलिसी डायवर्जेंस (policy divergence) का लाभ उठाकर GRPO की क्रेडिट असाइनमेंट त्रुटियों को संबोधित करता है ताकि सघन, स्व-पर्यवेक्षित टोकन-स्तरीय नियंत्रण प्रदान किया जा सके, जिससे गणितीय तर्क कार्यों में बेहतर सटीकता और दक्षता प्राप्त होती है।

Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang2026-05-07
🤖 machine learning

Skill Neologisms: Towards Skill-based Continual Learning

यह लेख "स्किल नियोलॉजिज़्म" (skill neologisms) का प्रस्ताव करता है, जो एक एलएलएम (LLM) की शब्दावली में एकीकृत अनुकूलित सॉफ्ट-टोकेन्स (soft-tokens) हैं, जो निरंतर सीखने के लिए एक स्केलेबल समाधान के रूप में कार्य करते हैं जो मॉडल को वेट अपडेट (weight updates) या कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) के बिना नए कौशल प्राप्त करने और उन्हें संयोजित करने में सक्षम बनाता है।

Antonin Berthon, Nicolas Astorga, Mihaela van der Schaar2026-05-07
💬 NLP

Why Geometric Continuity Emerges in Deep Neural Networks: Residual Connections and Rotational Symmetry Breaking

यह लेख स्पष्ट करता है कि डीप न्यूरल नेटवर्क में ज्यामितिक निरंतरता (geometric continuity), रेसिडुअल कनेक्शनों, जो परतों के बीच भार अपडेट (weight updates) को संरेखित करते हैं, और सिमेट्री-ब्रेकिंग नॉनलिनियैरिटीज़ (symmetry-breaking nonlinearities), जो रोटेशनल ड्रिफ्ट को रोकने के लिए परतों को एक सामान्य समन्वय फ्रेम (common coordinate frame) तक सीमित करती हैं, के संयुक्त प्रभावों का परिणाम है।

Kyungwon Jeong, Won-Gi Paeng, Honggyo Suh2026-05-07
🤖 AI

On-line Learning in Tree MDPs by Treating Policies as Bandit Arms

यह शोध पत्र ट्री मार्कोव डिसीजन प्रॉब्लम्स (Tree Markov Decision Problems) के लिए एक ऑनलाइन लर्निंग फ्रेमवर्क प्रस्तावित करता है जो नीतियों (policies) को बैंडिट आर्म्स (bandit arms) के रूप में मानता है, जो साझा-डेटा कॉन्फिडेंस बाउंड्स (shared-data confidence bounds) को डिजाइन करके घातांकीय नीति स्थान (exponential policy space) पर विजय प्राप्त करता है ताकि PAC और रिग्रेट-मिनिमाइजेशन (regret-minimization) दोनों सेटिंग्स में बहुपद-समय गणना (polynomial-time computation) और बेहतर सैंपल कॉम्प्लेक्सिटी (sample complexity) प्राप्त की जा सके।

Anvay Shah, Ramsundar Anandanarayanan, Sharayu Moharir, Shivaram Kalyanakrishnan2026-05-07
🤖 machine learning

Federated Learning for Early Prediction of EV Charging Demand

यह लेख फेडरेटेड लर्निंग के लिए एक ऐसे ढांचे का प्रस्ताव करता है जो न्यूनतम सत्र डेटा के साथ इलेक्ट्रिक वाहन चार्जिंग मांग का सटीक, गोपनीयता-अनुपालन प्रारंभिक पूर्वानुमान सक्षम करता है, और डेटा को चार्जिंग स्टेशनों पर स्थानीय रखते हुए भी केंद्रीकृत मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है।

Vasilis Perifanis, Foteini Nikolaidou, Nikolaos Pavlidis, Panagiotis Thomakos, Andreas Sendros2026-05-07
🤖 AI

Uno-Orchestra: Parsimonious Agent Routing via Selective Delegation

Uno-Orchestra एक एकीकृत, सुदृढीकरण शिक्षण (reinforcement learning) आधारित ऑर्केस्ट्रेशन पॉलिसी पेश करता है जो विविध बेंचमार्क पर कठोर मल्टी-एजेंट सिस्टम की तुलना में काफी अधिक सटीकता और कम लागत प्राप्त करने के लिए टास्क डिकंपोजिशन डेप्थ, वर्कर सिलेक्शन और इन्फरेंस बजट को संयुक्त रूप से अनुकूलित करता है।

Zhiqing Cui, Haotong Xie, Jiahao Yuan, Cheng Yang, Hanqing Wang, Yuxin Wu, Yifan Wu, Siru Zhong, Tao Yu, Yifu Guo, Siyu (…)2026-05-07
🤖 AI

Position: Embodied AI Requires a Privacy-Utility Trade-off

यह स्थिति पत्र (position paper) तर्क देता है कि एम्बॉडीड एआई (Embodied AI) घटकों को अलग-थलग रूप से अनुकूलित करना वास्तविक दुनिया के परिनियोजन में प्रणालीगत गोपनीयता जोखिम उत्पन्न करता है, और एक SPINE ढांचे का प्रस्ताव करता है जो गोपनीयता को एक गतिशील, जीवन-चक्र-स्तर के वास्तुशिल्प प्रतिबंध के रूप में व्यवहार करता है जो क्रॉस-स्टेज संवेदनशीलता को व्यवस्थित करता है।

Xiaoliang Fan, Jiarui Chen, Zhuodong Liu, Ziqi Yang, Peixuan Xu, Ruimin Shen, Junhui Liu, Jianzhong Qi, Cheng Wang2026-05-07
🤖 AI

Local Intrinsic Dimension Unveils Hallucinations in Diffusion Models

यह शोध पत्र प्रस्तावित करता है कि डिफ्यूजन मॉडल्स में संरचनात्मक मतिभ्रम (structural hallucinations), मॉडल-प्रेरित मैनिफोल्ड पर उच्च स्थानीय अंतर्निहित आयाम (high local intrinsic dimension - LID) द्वारा संचालित अस्थिरताओं से उत्पन्न होते हैं, और 'इंट्रिंसिक क्वेंचिंग' (Intrinsic Quenching - IQ) नामक एक विधि पेश करता है जो LID को कम करने और विशेष रूप से मेडिकल इमेजिंग में शारीरिक निरंतरता (anatomical consistency) में सुधार करते हुए इन विसंगतियों को प्रभावी ढंग से कम करने के लिए है।

Bartlomiej Sobieski, Matthew Tivnan, Dawid Płudowski, Michał Jan Włodarczyk, Pengfei Jin, Przemyslaw Biecek, Quanzheng L (…)2026-05-07