💻 computer science

SIR: Structured Image Representations for Explainable Robot Learning

यह शोध पत्र स्ट्रक्चर्ड इमेज रिप्रेजेंटेशन्स (SIR) को प्रस्तुत करता है, जो रोबोटिक पॉलिसियों के प्रदर्शन और अंतर्निहित व्याख्यात्मकता को बढ़ाने के लिए मध्यवर्ती निरूपण के रूप में सीखने योग्य, स्पार्स सीन ग्राफ का उपयोग करने वाली एक विधि है, जो ग्राफ विश्लेषण के माध्यम से डेटासेट पूर्वाग्रहों का पता लगाने में सक्षम बनाती है।

Paul Mattes, Jan Schwab, Jens Bosch, Nils Blank, Maximilian Xiling Li, Minh-Trung Tang, Moritz Haberland, Rudolf Lioutik (…)2026-06-30
🤖 machine learning

Automating the Design of Embodied AgentArchitectures

यह शोध पत्र एक व्यवस्थित खोज प्रक्रिया के माध्यम से एम्बॉडीड एजेंट आर्किटेक्चर (embodied agent architectures) के डिज़ाइन को स्वचालित करने के लिए AgentCanvas और KDLoop को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि हालांकि आर्किटेक्चर-स्तरीय खोज से दिशात्मक प्रदर्शन लाभ प्राप्त हो सकते हैं, लेकिन इसे रोलआउट शोर (rollout noise) द्वारा अनुकूलन संकेतों (optimization signals) को छिपाने और एपिसोड-स्तरीय क्रेडिट असाइनमेंट (episode-level credit assignment) की कठिनाइयों जैसी महत्वपूर्ण चुनौतियों का सामना करना पड़ता है।

Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu2026-06-30
💻 computer science

ActiveVital: Geometry-Aware Embodied Vital Signs Monitoring for Home Healthcare Robots

ActiveVital होम हेल्थकेयर रोबोट्स के लिए एक विजन-गाइडेड फ्रेमवर्क है जो सक्रिय रूप से सेंसिंग ज्योमेट्री को मानव छाती के साथ संरेखित करने के लिए रडार को समायोजित करता है, जिससे अनकन्स्ट्रेंड वातावरण में कॉन्टैक्टलेस श्वसन और हृदय गति की निगरानी की सटीकता में महत्वपूर्ण सुधार होता है।

Yuxuan Hu, Shihao Li, Yang Xiao, Gen Li, Feng Xu, Jianfei Yang2026-06-30
💻 computer science

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav एक एकीकृत विश्व-क्रिया मॉडलिंग फ्रेमवर्क पेश करता है जो 4B-स्केल बैकबोन का उपयोग करके विजन-एंड-लैंग्वेज नेविगेशन बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए स्पष्ट विश्व अवस्था मॉडलिंग (डायनामिक्स और भविष्य की स्थानिक अवस्थाओं सहित) के साथ क्रिया भविष्यवाणी को संयुक्त रूप से अनुकूलित करता है।

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei (…)2026-06-30
💻 computer science

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

यह शोध पत्र एक वास्तविक दुनिया के UR5e रोबोट पर विजन-लैंग्वेज-एक्शन मॉडल्स के हस्तांतरण की जांच करता है, जो यह प्रकट करता है कि सफल तैनाती मॉडल क्षमता पर कम और ऑफलाइन संकेतकों तथा भौतिक स्थिरता के बीच के अंतर को दूर करने के लिए संपूर्ण डेटा-मॉडल-कंट्रोल पाइपलाइन के सटीक एकीकरण पर अधिक निर्भर करती है।

Mathilde Hochedel, Marc Lalonde2026-06-30
💻 computer science

Behavior Prompting Policy: Demonstrations as Prompts for Manipulation

यह शोध पत्र बिहेवियर प्रॉम्प्टिंग पॉलिसी (BPP) प्रस्तुत करता है, जो एक इन-कॉन्टेक्स्ट विज़ुओमोटर आर्किटेक्चर है जो रोबोट को इन्फरेंस के समय एक एकल मानव प्रदर्शन से नए हेरफेर कार्यों को सीखने में सक्षम बनाता है, जिसे iPhUMI इंटरफ़ेस के माध्यम से एकत्र किए गए एक विविध प्रशिक्षण डेटासेट द्वारा समर्थित किया गया है और नवीन मूल्यांकन बेंचमार्क के माध्यम से मान्य किया गया है।

Austin Patel, Ben Pekarek, Joel Enrique Castro Hernandez, Shuran Song2026-06-30
⚡ electrical engineering

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

यह शोध पत्र VLK प्रस्तुत करता है, जो एक ऐसा ढांचा है जो बिना मानवीय हस्तक्षेप के प्रभावी सिम-टू-रियल परसेप्शन-आधारित लोको-मैनिपुलेशन के लिए ह्यूमनॉइड रोबोट्स को प्रशिक्षित करने हेतु 3D गॉसियन स्प्लेटिंग-पुनर्निर्मित दृश्यों से विजन-लैंग्वेज-काइनेमैटिक्स पर्यवेक्षण को संश्लेषित करता है।

Yen-Jen Wang, Jiaman Li, Sirui Chen, Takara E. Truong, Pei Xu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Angjoo Kanaz (…)2026-06-30
💻 computer science

Dynamic Decentralized 3D Urban Coverage and Patrol with UAVs

यह शोध पत्र आपदा परिदृश्यों में आवधिक और पूर्ण 3D शहरी कवरेज प्राप्त करने के लिए UAV झुंडों हेतु एक मॉड्यूलर, विकेंद्रीकृत ढांचे का प्रस्ताव करता है, जो क्षेत्र को बंद पथों में विविक्त (discretize) करता है और एक न्यूनतम, सुदृढ़ गश्त रणनीति का उपयोग करता है जहाँ UAV यादृच्छिक रूप से चलते हैं और उभरते हुए सहकारी व्यवहार को उत्पन्न करने के लिए एक-दूसरे से "टकराकर वापस उछलते" (bounce) हैं।

Wai Lun Leong, Jiawei Cao, Rodney Teo2026-06-29
💻 computer science

Data Scaling Laws in Imitation Learning for Robotic Manipulation

यह शोध पत्र प्रदर्शित करता है कि रोबोटिक मैनिपुलेशन में, सामान्यीकरण प्रदर्शन (generalization performance) प्रदर्शनों की विशाल मात्रा के बजाय प्रशिक्षण वातावरण और वस्तुओं की विविधता के साथ पावर-लॉ स्केलिंग का अनुसरण करता है, जो एक केंद्रित डेटा संग्रह रणनीति के माध्यम से अत्यधिक प्रभावी ज़ीरो-शॉट नीतियों को सक्षम बनाता है।

Fanqi Lin, Yingdong Hu, Pingyue Sheng, Chuan Wen, Jiacheng You, Yang Gao2026-06-29
💻 computer science

Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet?

यह शोध पत्र अत्याधुनिक ब्लैक-बॉक्स विजन-लैंग्वेज मॉडल्स का ज़ीरो-शॉट, स्टैंड-अलोन इमेज जियो-लोकलाइज़ेशन सिस्टम के रूप में मूल्यांकन करने वाला पहला व्यवस्थित अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ उनके पास मजबूत कोर्स-लेवल नेविगेशन प्रायर्स हैं, वहीं यथार्थवादी विविधताओं के तहत उनकी फाइन-ग्रेंड लोकलाइज़ेशन सटीकता और निरंतरता काफी कम हो जाती है, जो रोबोटिक परिनियोजन के लिए विश्वसनीयता संबंधी चुनौतियों को उजागर करती है।

Sania Waheed, Bruno Ferrarini, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan2026-06-29