💻 computer science

BEV-ODOM2: Enhanced BEV-based Monocular Visual Odometry with PV-BEV Fusion and Dense Flow Supervision for Ground Robots

BEV-ODOM2 ग्राउंड रोबॉट्स के लिए एक उन्नत मोनोकुलर विजुअल ओडोमेट्री फ्रेमवर्क है जो मोशन क्यूज़ को संरक्षित करने के लिए पर्सपेक्टिव व्यू-BEV फ्यूजन को एकीकृत करके और डेंस ऑप्टिकल फ्लो सुपरविजन पेश करके स्केल ड्रिफ्ट को समाप्त करता है और सटीकता में सुधार करता है, जिससे कई डेटासेट्स में रिलेटिव ट्रजेक्टरी एरर में 40% की कमी आती है और साथ ही रियल-टाइम एज डिप्लॉयमेंट सक्षम होता है।

Yufei Wei, Chenxiao Hu, Wangtao Lu, Sha Lu, Yuxiang Cui, Fuzhang Han, Rong Xiong, Yue Wang2026-06-03
💻 computer science

On The Computational Complexity of Minimum Aerial Photographs for Planar Region Coverage

यह शोध पत्र वर्ग और वृत्त आकृतियों के लिए विशिष्ट अप्रॉक्सिमेबिलिटी अंतराल (inapproximability gaps) को सिद्ध करते हुए हवाई फोटोग्राफों द्वारा एक समतलीय बहुभुज (planar polygon) को कवर करने की कम्प्यूटेशनल जटिलता को स्थापित करता है और साथ ही इस समस्या के लिए एक 2.828-अनुमानित एल्गोरिदम (approximation algorithm) प्रस्तुत करता है।

Si Wei Feng2026-06-03
💻 computer science

RoboCade: Gamifying Robot Data Collection

यह शोधपत्र RoboCade को प्रस्तुत करता है, जो एक गेमिफाइड रिमोट टेलीऑपरेशन प्लेटफॉर्म है जो इंटरैक्टिव इंटरफेस और टास्क डिज़ाइन के माध्यम से सामान्य उपयोगकर्ताओं को रोबोट प्रदर्शन डेटा एकत्र करने में संलग्न करता है, जिसके परिणामस्वरूप मानक तरीकों की तुलना में डाउनस्ट्रीम कार्यों पर नीति प्रदर्शन में महत्वपूर्ण सुधार और अधिक आनंददायक उपयोगकर्ता अनुभव प्राप्त होता है।

Suvir Mirchandani, Mia Tang, Jiafei Duan, Jubayer Ibn Hamid, Michael Cho, Dorsa Sadigh2026-06-03
⚡ electrical engineering

LC-SAC: Lyapunov-Constrained Soft Actor-Critic via Koopman Operator Theory for Trajectory Tracking and Stabilization

यह शोध पत्र LC-SAC का प्रस्ताव करता है, जो एक लयापुनोव-प्रतिबंधित (Lyapunov-constrained) सॉफ्ट एक्टर-क्रिटिक एल्गोरिदम है जो EDMD और DARE के माध्यम से एक क्लोज्ड-फॉर्म कंट्रोल लयापुनोव फंक्शन प्राप्त करने के लिए कूपमैन ऑपरेटर थ्योरी (Koopman operator theory) का लाभ उठाता है, और इसे क्वाड्रोटर नियंत्रण जैसे सुरक्षा-महत्वपूर्ण प्रक्षेपवक्र ट्रैकिंग कार्यों में स्थिरता सुनिश्चित करने और विचलन को रोकने के लिए एक CVaR-आधारित लैग्रेंजियन दंड (Lagrangian penalty) के रूप में एकीकृत करता है।

Dhruv S. Kushwaha, Zoleikha A. Biron2026-06-03
🤖 AI

Coupled Local and Global World Models for Efficient First Order RL

यह शोध पत्र एक नवीन डिकपल्ड फर्स्ट-ऑर्डर ग्रेडिएंट विधि प्रस्तावित करता है जो जटिल मैनिपुलेशन कार्यों के लिए सीधे इमेज स्पेस में कुशल, सिम्युलेटर-मुक्त सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) को सक्षम करने के लिए एक हाई-फिडेलिटी ग्लोबल डिफ्यूजन वर्ल्ड मॉडल को एक लाइटवेट लोकल सरोगेट के साथ जोड़ता है।

Joseph Amigo, Rooholla Khorrambakht, Nicolas Mansard, Ludovic Righetti2026-06-03
💻 computer science

RocketSmith: An Agentic System for High-Powered Rocket Design and Manufacturing

रॉकेटस्मिथ (RocketSmith) एक एजेंटिक सिस्टम है जो उच्च-शक्ति वाले रॉकेटों के डिजाइन, एडिटिव मैन्युफैक्चरिंग और अनुकूलन को स्वचालित करता है, जिसने चार विशिष्ट वाहनों के निर्माण और उड़ान परीक्षण के माध्यम से अपनी क्षमताओं को सफलतापूर्वक प्रमाणित किया है जिन्होंने स्थिर लॉन्च और उच्च सिमुलेशन सटीकता प्राप्त की।

Peter Pak, Jesse Barkley, Rumi Loghmani, Derek Baich, Ananya Pamal, Amir Barati Farimani2026-06-03
🤖 AI

AURA: Action-Gated Memory for Robot Policies at Constant VRAM

AURA-Mem रोबोट नीतियों के लिए एक एक्शन-गेटेड रिकरेंट मेमोरी तंत्र पेश करता है जो निरंतर VRAM उपयोग बनाए रखता है और केवल तभी अपडेट करके मेमोरी राइट्स को महत्वपूर्ण रूप से कम करता है जब अवलोकन भविष्य के कार्यों को प्रभावित करते हैं, जिससे यह एज हार्डवेयर पर पारंपरिक KV-कैश दृष्टिकोणों से बेहतर प्रदर्शन करता है और बड़े मॉडलों की सफलता दर से मेल खाता है।

Josef Chen2026-06-03
💬 NLP

SCOPE: Real-Time Natural Language Camera Agent at the Edge

यह शोध पत्र SCOPE प्रस्तुत करता है, जो प्राकृतिक-भाषा PTZ कैमरा नियंत्रण के लिए एक मॉड्यूलर, एज-डिप्लॉय करने योग्य एजेंट है, और एक व्यापक बेंचमार्क एवं मूल्यांकन प्रस्तुत करता है जो यह प्रदर्शित करता है कि शक्तिशाली लघु भाषा मॉडल (small language models) मतिभ्रम (hallucinations) को काफी कम कर देते हैं जबकि धारणा (perception) प्राथमिक बाधा बन जाती है, जिसमें मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) और क्वांटाइजेशन कुशल, वास्तविक समय के समाधान प्रदान करते हैं।

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra2026-06-03
🤖 AI

Towards Compact Autonomous Driving Perception with Balanced Learning and Multi-sensor Fusion

यह शोध पत्र एक नवीन कॉम्पैक्ट डीप मल्टी-टास्क लर्निंग मॉडल प्रस्तुत करता है जो एक एडेप्टिव लॉस वेटिंग एल्गोरिदम के साथ RGB, DVS और LiDAR डेटा को फ्यूज करके विविध स्वायत्त ड्राइविंग धारणा कार्यों को एक साथ निष्पादित करता है, जो मौजूदा दृष्टिकोणों की तुलना में कम मापदंडों के साथ बेहतर प्रदर्शन और दक्षता प्राप्त करता है।

Oskar Natan, Jun Miura2026-06-03
💻 computer science

MARIO: Motion-Augmented Real-Time Multi-Sensor Inertial Odometry

यह शोध पत्र MARIO को प्रस्तुत करता है, जो एक मोशन-ऑगमेंटेड रियल-टाइम मल्टी-सेंसर इनर्शियल ओडोमेट्री फ्रेमवर्क है जो एक सीखे हुए IMU-इन्फर्ड पोज़ प्रायर (pose prior) को सहायक सेंसर फ्यूजन के साथ जोड़ता है ताकि ऑगमेंटेड रियलिटी में कैमरा-रहित मानव ट्रैकिंग के लिए पोजीशनल ड्रिफ्ट को काफी कम किया जा सके और मजबूती में सुधार किया जा सके।

Yiquan Li, Taeyoung Yeon, Chenfeng Gao, Vasco Xu, Xuanyou Liu, Karan Ahuja2026-06-03