🤖 AI

Multi-Modal World Model for Physical Robot Interactions: Simultaneous Visual and Tactile Predictions for Enhanced Accuracy

यह शोध पत्र एक मल्टी-मोडल वर्ल्ड मॉडल प्रस्तावित करता है जो स्पर्श संबंधी और दृश्य सूचनाओं को एकीकृत करता है ताकि भौतिक रूप से अस्पष्ट वातावरण में रोबोटिक एक्शन प्रेडिक्शन की सटीकता और मजबूती में महत्वपूर्ण सुधार किया जा सके, जिसे मैग्नेटिक-आधारित टैक्टाइल सेंसर का उपयोग करके एकत्र किए गए दो नवीन डेटासेट्स द्वारा समर्थित किया गया है।

Willow Mandil, Amir Ghalamzan-E2026-05-14
💻 computer science

Neural Associative Skill Memories for safer robotics and modelling human sensorimotor repertoires

यह शोध पत्र न्यूरल एसोसिएटिव स्किल मेमोरीज (Neural Associative Skill Memories) को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित प्रेडिक्टिव कोडिंग फ्रेमवर्क है जो सुरक्षित रोबोटिक्स को आगे बढ़ाने और मानव संवेदी-मोटर भंडार (sensorimotor repertoires) को मॉडल करने के लिए जैविक रूप से सुसंगत स्थानीय शिक्षण नियमों का उपयोग करते हुए एक एकल ऊर्जा-आधारित वास्तुकला के भीतर कौशल शिक्षण, संदर्भ-जागरूक अभिव्यक्ति और दोष पहचान को एकीकृत करता है।

Pranav Mahajan, Mufeng Tang, T. Ed Li, Ioannis Havoutis, Ben Seymour2026-05-14
💻 computer science

Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware

यह शोध पत्र RSR-RSMARL प्रस्तुत करता है, जो एक सुदृढ़ और सुरक्षित मल्टी-एजेंट सुदृढीकरण शिक्षण ढांचा है जो संचार, ज़ीरो-शॉट सिम-टू-रियल ट्रांसफर के लिए सुदृढ़ नीति प्रशिक्षण, और कंट्रोल बैरियर फंक्शन-आधारित सुरक्षा शील्ड को एकीकृत करता है, जो हार्डवेयर स्वायत्त वाहनों पर बेहतर समन्वय और सुरक्षा का सफलतापूर्वक प्रदर्शन करता है।

Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao2026-05-14
🤖 AI

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA एक एकीकृत रोबोट नीति ढांचा है जो निरंतर और असतत (continuous and discrete) निरूपणों को सीखने के लिए निर्देशात्मक वीडियो पर बड़े पैमाने पर प्रीट्रेनिंग का लाभ उठाता है, जिससे मौजूदा विजन-लैंग्वेज और जनरेटिव दृष्टिकोणों की तुलना में सिमुलेशन और वास्तविक दुनिया के आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों दोनों में बेहतर प्रदर्शन सक्षम होता है।

Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen2026-05-14
🤖 AI

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Systems

QuickLAP एक बेयसियन फ्रेमवर्क है जो अस्पष्ट भौतिक सुधारों को उच्च-स्तरीय भाषाई फीडबैक के साथ जोड़ने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे अर्ध-स्वायत्त प्रणालियों को वास्तविक समय में उपयोगकर्ता रिवॉर्ड फंक्शन को तेजी से और मजबूती से अनुमानित करने में सक्षम बनाया जा सके।

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu2026-05-14
⚡ electrical engineering

Unifying Entropy Regularization in Optimal Control: From and Back to Classical Objectives via Iterated Soft Policies and Path Integral Solutions

यह शोध पत्र इष्टतम नियंत्रण (optimal control) के लिए एक एकीकृत KL-नियमित ढांचे (KL-regularized framework) को प्रस्तुत करता है जो सॉफ्ट-पॉलिसी सरोगेट्स (soft-policy surrogates) के माध्यम से शास्त्रीय और जोखिम-संवेदनशील उद्देश्यों का सामान्यीकरण करता है, जिन्हें मूल लक्ष्यों को पुनः प्राप्त करने के लिए पुनरावृत्त किया जा सकता है और एक सिंक्रोनाइज़्ड मामले में, रैखिक बेलमैन ऑपरेटरों और पाथ-इंटिग्रल समाधानों को उत्पन्न कर सकता है।

Ajinkya Bhole, Mohammad Mahmoudi Filabadi, Guillaume Crevecoeur, Tom Lefebvre2026-05-14
💻 computer science

OptMap: Geometric Map Distillation via Submodular Maximization

यह शोध पत्र OptMap प्रस्तुत करता है, जो एक ऑनलाइन एल्गोरिदम है जो आकार-प्रतिबंधित, सूचनात्मक उपसमुच्चयों के चयन की NP-hard समस्या को हल करने के लिए सबमॉड्यूलर मैक्सिमाइजेशन (submodular maximization) का लाभ उठाकर, प्रमाणित रूप से निकट-इष्टतम प्रदर्शन के साथ LiDAR डेटा को एप्लिकेशन-विशिष्ट ज्यामितीय मानचित्रों में कुशलतापूर्वक संकुचित (distill) करता है।

David Thorne, Nathan Chan, Christa S. Robison, Philip R. Osteen, Brett T. Lopez2026-05-14
🤖 AI

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

प्रिस्मेटिक वर्ल्ड मॉडल (PRISM-WM), हाइब्रिड रोबोटिक सिस्टम में मोनोलिथिक लेटेंट वर्ल्ड मॉडल्स की सीमाओं को संबोधित करने के लिए, जटिल डायनेमिक्स को कंपोजेबल प्रिमिटिव्स में विघटित करने हेतु लेटेंट ऑर्थोगोनलाइजेशन के साथ एक कॉन्टेक्स्ट-अवेयर मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर का उपयोग करता है, जिससे रोलआउट ड्रिफ्ट कम होता है और विश्वसनीय लॉन्ग-होरिजन प्लानिंग सक्षम होती है।

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang2026-05-14
💻 computer science

TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance

TouchGuide एक नवीन इन्फरेंस-टाइम स्टीयरिंग फ्रेमवर्क है जो लागत प्रभावी TacUMI डेटा संग्रह प्रणाली द्वारा समर्थित, स्पर्श मार्गदर्शन (tactile guidance) के साथ मोटे विजुअल कार्यों को परिष्कृत करने के लिए कंट्रास्टिवली प्रशिक्षित कॉन्टैक्ट फिजिकल मॉडल को एकीकृत करके संपर्क-समृद्ध हेरफेर (contact-rich manipulation) के लिए प्री-ट्रेंड विसुओमोटर नीतियों को बढ़ाता है।

Zhemeng Zhang, Jiahua Ma, Xincheng Yang, Xin Wen, Yuzhi Zhang, Boyan Li, Yiran Qin, Jin Liu, Can Zhao, Li Kang, Haoqin H (…)2026-05-14
💻 computer science

Perception with Guarantees: Certified Pose Estimation via Reachability Analysis

यह शोधपत्र सुरक्षा-महत्वपूर्ण साइबर-फिजिकल एजेंटों के लिए एक प्रमाणित 3D पोज़ एस्टीमेशन विधि प्रस्तुत करता है जो केवल कैमरा छवियों और ज्ञात लक्ष्य ज्यामिति के आधार पर सबसे खराब स्थिति की सुरक्षा गारंटी प्रदान करने के लिए रीचेबिलिटी एनालिसिस और औपचारिक न्यूरल नेटवर्क सत्यापन का उपयोग करता है।

Tobias Ladner, Yasser Shoukry, Matthias Althoff2026-05-14