💻 computer science

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

यह शोधपत्र DREAM प्रस्तुत करता है, जो एक वास्तविक-रोबोट मोबाइल मैनिपुलेशन फ्रेमवर्क है जो एक हाइब्रिड SLAM बैकएंड को डायनेमिक स्पैटियो-सेमेंटिक वोक्सेल मेमोरी और लैंग्वेज-कंडीशन्ड टार्गेट लोकलाइजेशन के साथ एकीकृत करके गतिशील, मैप-लेस इनडोर वातावरण में विश्वसनीय संचालन सक्षम करता है, जिससे कंप्यूटेशनल दक्षता बनाए रखते हुए लॉन्ग-होरिज़न टास्क सफलता दर में महत्वपूर्ण सुधार होता है।

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang2026-06-02
🤖 machine learning

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

यह शोध पत्र कोर्स-टू-फाइन कंपोजिशनल डिफ्यूजन (CoFi) का प्रस्ताव करता है, जो एक इन्फरेंस-टाइम सैंपलर है जो स्थानीय योजनाओं को संरेखित करने के लिए पहले एक वैश्विक संरचनात्मक मचान (ग्लोबल स्ट्रक्चरल स्कैफोल्ड) स्थापित करके और फिर उन्हें परिष्कृत करके दीर्घकालिक नियोजन (लॉन्ग-होराइजन प्लानिंग) को बढ़ाता है, जिससे मौजूदा विधियों की तुलना में काफी कम कम्प्यूटेशनल मूल्यांकनों के साथ बेहतर वैश्विक सुसंगतता और स्थानीय गुणवत्ता प्राप्त होती है।

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen2026-06-02
💻 computer science

Make Your VLA More Robust Without More Data By Interleaving Motion Planning

यह शोध पत्र MPVI को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो बिना किसी अतिरिक्त प्रशिक्षण डेटा की आवश्यकता के, लॉन्ग-होरिज़न मोबाइल मैनिपुलेशन में रोबस्टनेस और टास्क प्रोग्रेस को महत्वपूर्ण रूप से बढ़ाने के लिए मॉडल-आधारित मोशन प्लानिंग को विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स के साथ इंटरलीव करता है।

Dan BW Choe, Sundhar Vinodh Sangeetha, Samuel Coogan, Shreyas Kousik2026-06-02
💻 computer science

Position: Good Embodied Reward Models Need Bad Behavior Data

यह स्थिति पत्र (position paper) तर्क देता है कि एम्बॉडीड एआई (embodied AI) समुदाय को उन रिवॉर्ड मॉडल्स को प्रशिक्षित करने के लिए "बुरे" रोबोट डेटा—जैसे कि विफल, उप-इष्टतम या खतरनाक व्यवहारों—को एकत्र करने और उपयोग करने को प्राथमिकता देनी चाहिए जो मानवीय प्राथमिकताओं के साथ सटीक रूप से संरेखित हों और असुरक्षित या सतही कार्यों के पूरा होने पर अत्यधिक पुरस्कार देने से बचें।

Ran Tian, Yilin Wu, Andrea Bajcsy2026-06-02
💻 computer science

Beyond Task Success: Behavioral and Representational Diagnostics for WAM and VLA

यह शोध पत्र एक मॉडल-अज्ञेय (model-agnostic) नैदानिक ढांचे को प्रस्तुत करता है जो यह प्रकट करता है कि विजन-लैंग्वेज-एक्शन (VLA) और वर्ल्ड-एक्शन मॉडल्स (WAM) व्यवहारिक गतिशीलता और आंतरिक निरूपणों में कैसे भिन्न होते हैं, यह प्रदर्शित करते हुए कि हालांकि WAMs वस्तु-स्तरीय चयनात्मकता को बढ़ा सकते हैं और भविष्य कहने वाली संरचनाओं को एनकोड कर सकते हैं, उनकी प्रभावशीलता और दक्षता काफी हद तक विशिष्ट वास्तुशिल्प विकल्पों पर निर्भर करती है।

Hung Mai, Bin Zhu, Tuan Do2026-06-02
💻 computer science

Implicit Drifting Policy: One-Step Action Generation via Conditional Expert Geometry

यह शोध पत्र इम्प्लिसिट ड्रिफ्टिंग पॉलिसी (IDP) को प्रस्तुत करता है, जो एक वन-स्टेप इमिटेशन लर्निंग फ्रेमवर्क है जो स्थानीय विशेषज्ञ ज्यामिति (local expert geometry) का लाभ उठाकर मैनिफोल्ड बाधाओं को लागू करता है ताकि इटरेटिव डिफ्यूजन मॉडल्स की लेटेंसी और एक्सप्लिसिट फील्ड एस्टीमेशन की इल-पोस्ड प्रकृति पर विजय प्राप्त की जा सके, जिससे मजबूत बेसलाइन्स के प्रतिस्पर्धी प्रदर्शन के साथ उच्च-आवृत्ति रोबोट नियंत्रण प्राप्त किया जा सके।

Zemin Yang, Yaoyu He, Yiming Zhong, Yuhao Zhang, Xinge Zhu, Yao Mu, Qingqiu Huang, Yuexin Ma2026-06-02
🔢 mathematics

Time-Optimal Collision Avoidance Via a Greedy Polynomial Backward Sweep

यह शोध पत्र एक ग्रीडी टाइम-ऑप्टिमल बैकवर्ड-स्वीप विधि प्रस्तुत करता है जो लो-थ्रस्ट अंतरिक्ष यान टकराव निवारण के लिए नवीनतम संभव युद्धाभ्यास प्रारंभ समय को कुशलतापूर्वक निर्धारित करने हेतु डिफरेंशियल अलजेब्रा का उपयोग करता है, जिससे ऑनबोर्ड कार्यान्वयन के लिए उपयुक्त रनटाइम के साथ निकट-इष्टतम सुरक्षा प्राप्त होती है।

Zeno Pavanello, Frank De Veld, Roberto Armellin2026-06-02
💻 computer science

OneVLA: A Unified Framework for Embodied Tasks

OneVLA एक एकीकृत ढांचा पेश करता है जो एक साझा एक्शन हेड और एक बहु-चरणीय प्रगतिशील प्रशिक्षण रणनीति के साथ नेविगेशन और हेरफेर को एक ही आर्किटेक्चर में एकीकृत करता है, जिससे सामान्य-उद्देश्य वाले रोबोटिक एजेंटों के विकास को आगे बढ़ाने के लिए सिम्युलेटेड और वास्तविक दुनिया दोनों वातावरणों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Lei Zhou, Shuyi Zhang, Jinkun Liu, Hongsheng Li, Chenhao Zhang, Qiang Zhang (…)2026-06-02
⚡ electrical engineering

DeepIPCv3: Event-Aware Multi-Modal Sensor Fusion for Sudden Pedestrian Crossing Avoidance

DeepIPCv3 एक नवीन मल्टी-मोडल स्वायत्त ड्राइविंग फ्रेमवर्क है जो विविध प्रकाश स्थितियों के तहत स्टेट-ऑफ-द-आर्ट, मोशन-ब्लर-मुक्त डिटेक्शन और अचानक पैदल यात्रियों के क्रॉसिंग से बचने के लिए ट्रांसफॉर्मर-प्रेरित अटेंशन मैकेनिज्म के माध्यम से LiDAR पॉइंट क्लाउड्स को डायनेमिक विजन सेंसर (DVS) इवेंट स्ट्रीम्स के साथ फ्यूज करता है।

Oskar Natan, Andi Dharmawan, Aufaclav Zatu Kusuma Frisky, Jazi Eko Istiyanto, Jun Miura2026-06-02
💻 computer science

PSG-Nav: Probabilistic Scene Graph Navigation via Multiverse Decision Making

यह शोध पत्र PSG-Nav प्रस्तुत करता है, जो एक नवीन ओपन-वोकैबुलरी नेविगेशन फ्रेमवर्क है जो एक 3D प्रोबेबिलिस्टिक सीन ग्राफ का निर्माण करके, कई विश्व सेटिंग्स में नेविगेशन लैंडमार्क्स का मूल्यांकन करने के लिए मल्टीवर्स डिसीजन मेकिंग को नियोजित करके, और ऑनलाइन अनुकूलन के लिए एक एविडेंशियल एक्सपीरियंस कैलिब्रेटर का उपयोग करके धारणा अनिश्चितता (परसेप्शन अनसर्टेन्टी) को संबोधित करता है, जिससे MP3D, HM3D और HSSD बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Rufeng Chen, Yue Chang, Xiaqiang Tang, Hechang Chen, Sihong Xie2026-06-02