💻 computer science

Learning Control as Enabling Layer for Embodied Intelligence Research explored with Soft Robotic Swimming in diverse Flow Speeds

यह शोध पत्र यह प्रदर्शित करता है कि पारंपरिक PID नियंत्रण को लीनियर रिपिटिटिव लर्निंग एस्टीमेशन स्कीम (PID-LRLES) के साथ संवर्धित करने से विविध प्रवाह गतियों में सॉफ्ट रोबोटिक तैराकी की ट्रैकिंग सटीकता और पुनरावृत्ति में महत्वपूर्ण सुधार होता है, जिससे भविष्य के एम्बॉडीड इंटेलिजेंस अनुसंधान के लिए एक सुदृढ़ सक्षम परत प्रदान होती है।

Fabian Schwab, Federico Allione, Bingcheng Wang, Mohamed El Arayshi, Claudio Mucignat, Ivan Lunati, Cristiano Verrelli (…)2026-06-23
🤖 AI

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM एक Recap-Cue मॉड्यूल के साथ एक एपिसोडिक मेमोरी तंत्र पेश करता है जो वीडियो-वर्ल्ड-मॉडल नीतियों में संकुचित ऐतिहासिक संदर्भ (compressed historical context) को इंजेक्ट करता है, जिससे रोबोटों को नॉन-मार्कोवियन चुनौतियों से पार पाने और सिम्युलेटेड एवं वास्तविक दुनिया के कार्यों पर लॉन्ग-होरिज़न मैनिपुलेशन सफलता दरों में महत्वपूर्ण सुधार करने में सक्षम बनाया जा सके।

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang2026-06-23
💻 computer science

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo एक नवीन मॉडल-आधारित सुरक्षित सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो एक संवादात्मक वीडियो वर्ल्ड मॉडल का लाभ उठाता है ताकि विजन-लैंग्वेज-एक्शन नीतियों को कल्पना के माध्यम से सुरक्षित कार्यों को सीखने में सक्षम बनाया जा सके, जिससे मौजूदा बेसलाइनों की तुलना में सिमुलेशन और वास्तविक दुनिया के परिनियोजन दोनों में बेहतर कार्य सफलता और सुरक्षा प्रदर्शन प्राप्त किया जा सके।

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, C (…)2026-06-23
💻 computer science

Coupled Routing and Configuration Optimization for Multi-Viewpoint Robotic Inspection

यह शोध पत्र एक एकीकृत ढांचे को प्रस्तुत करता है जो एक क्लोज्ड-फॉर्म सरोगेट के साथ ग्लोबल सर्च और एक अंतिम ट्रैजेक्टरी सर्टिफिकेशन स्टेप का उपयोग करके मल्टी-व्यूपॉइंट निरीक्षण के लिए विजिटिंग ऑर्डर और रोबोट कॉन्फ़िगरेशन को संयुक्त रूप से अनुकूलित करता है, जिससे समय-इष्टतम, टकराव-मुक्त मार्ग प्राप्त होते हैं जो पारंपरिक मॉड्यूलर पाइपलाइनों से बेहतर प्रदर्शन करते हैं।

Minh Nhat Vu, Khang Nguyen, Vu Trung Tran, Vien Ngo2026-06-23
🤖 AI

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring without Lane Closure

यह शोध पत्र एक यूनिटी-आधारित डिजिटल ट्विन फ्रेमवर्क प्रस्तुत करता है जो बिना लेन बंद किए यूएवी (UAV) पेवमेंट निगरानी रणनीतियों का मूल्यांकन करने के लिए प्रक्रियात्मक रूप से उत्पन्न (procedurally generated) ट्रैफ़िक और सड़क दोषों को एकीकृत करता है, जो यह प्रदर्शित करता है कि होवर-एंड-रीचेक (hover-and-recheck) और स्किप-एंड-रीविजिट (skip-and-revisit) जैसे अनुकूलन योग्य रिकवरी तरीके विभिन्न ट्रैफ़िक घनत्वों और उड़ान ऊंचाइयों के तहत 97% से अधिक निरीक्षण कवरेज प्राप्त कर सकते हैं।

Yamil Uchani, Grace Abigail Luna Verdueta, Mauricio Figueroa, Edwin Salcedo2026-06-23
💻 computer science

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

यह शोध पत्र UNSEEN को प्रस्तुत करता है, जो अज्ञात वातावरण के लिए एक एकीकृत, केवल-दृष्टि (vision-only) आधारित नेविगेशन फ्रेमवर्क है, जो संसाधन-सीमित प्लेटफॉर्म पर मजबूत और उच्च-सटीक प्रक्षेपवक्र नियोजन (trajectory planning) प्राप्त करने के लिए स्पार्स एस्टीमेशन (sparse estimation) और अनिश्चितता प्रसार (uncertainty propagation) के माध्यम से स्थानीयकरण (localization), मानचित्रण (mapping) और नियोजन (planning) को स्पष्ट रूप से जोड़ता है।

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli2026-06-23
⚡ electrical engineering

Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction

यह शोध पत्र एक एक्टर-केंद्रित साइडकार सुपरविजन पद्धति प्रस्तावित करता है जो एक्टर रिप्रेजेंटेशन को स्पष्ट रूप से ग्राउंड करने के लिए प्रशिक्षण के दौरान विशेषाधिकार प्राप्त सिम्युलेटर-व्युत्पन्न लेबल का लाभ उठाता है, जिससे कैमरा-प्रथम ओपन-लूप वेपॉइंट प्रेडिक्शन सटीकता में महत्वपूर्ण सुधार होता है और बेसलाइन मॉडलों की तुलना में अंतिम विस्थापन त्रुटि (डिस्प्लेसमेंट एरर) में 32.6% की कमी आती है।

Feeza Khan Khanzada, Jaerock Kwon2026-06-23
🤖 AI

TriMotion: Modality-Agnostic Camera Control for Video Generation

ट्रिमोटion (TriMotion) एक मोडैलिटी-अज्ञेय (modality-agnostic) फ्रेमवर्क है जो एक नए डेटासेट और लेटेंट कंसिस्टेंसी ऑब्जेक्टिव के माध्यम से वीडियो, पोज़ और टेक्स्ट इनपुट्स को एक साझा मोशन एम्बेडिंग स्पेस में एकीकृत करता है, जिससे विषम उपयोगकर्ता इनपुट्स के माध्यम से उच्च-गुणवत्ता वाले, लचीले कैमरा-नियंत्रित वीडियो जनरेशन को सक्षम बनाया जा सके।

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng2026-06-23
🤖 AI

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA एक वास्तविक समय का ढांचा है जो एक अटेंशन-एनहैंस्ड LSTM और टेम्पोरल स्टेबिलाइज़ेशन मॉड्यूल के माध्यम से सांकेतिक भाषा के इशारों को अर्थपूर्ण निर्देशों में परिवर्तित करके मानव-रोबोट संपर्क में सुलभता को बढ़ाता है, जिससे विजन-लैंग्वेज-एक्शन मॉडल को बधिर और वाक-विकलांग उपयोगकर्ताओं के लिए रोबोटिक मैनिपुलेशन कार्यों को निष्पादित करने में सक्षम बनाया जा सके।

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe (…)2026-06-23
🤖 AI

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

यह शोध पत्र लिमा और न्यूयॉर्क शहर के मानव चालकों के प्रदर्शन की तुलना इन दो चुनौतीपूर्ण भौगोलिक क्षेत्रों के विविध ड्राइविंग परिदृश्यों में विजन-लैंग्वेज मॉडल्स (VLMs) के विरुद्ध करने के लिए रोबस्टो-2 (Robusto-2) बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि प्रश्न के प्रकार के आधार पर मानव और VLM की प्रतिक्रियाएं भिन्न होती हैं, लेकिन परिदृश्यों की उच्च आउट-ऑफ-डिस्ट्रीब्यूशन प्रकृति के कारण दोनों समूहों में विशिष्ट शहर के कारण प्रदर्शन में कोई महत्वपूर्ण भिन्नता नहीं दिखाई देती है।

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza2026-06-23