💻 computer science

An End-to-End Decision-Aware Multi-Scale Attention-Based Model for Explainable Autonomous Driving

यह शोध पत्र एक एंड-टू-एंड, मल्टी-स्केल अटेंशन-आधारित मॉडल प्रस्तावित करता है जो स्वायत्त ड्राइविंग के लिए केस-विशिष्ट स्पष्टीकरण उत्पन्न करने हेतु ड्राइविंग निर्णयों को एक रीजनिंग घटक में एकीकृत करता है, जिसे एक नए जॉइंट F1 स्कोर मीट्रिक और BDD-OIA एवं nu-AR डेटासेट पर प्रयोगों के माध्यम से मान्य किया गया है ताकि मौजूदा स्टेट-ऑफ-द-आर्ट मॉडलों पर बेहतर प्रदर्शन प्रदर्शित किया जा सके।

Maryam Sadat Hosseini Azad, Shahriar Baradaran Shokouhi, Amir Abbas Hamidi Imani, Shahin Atakishiyev, Randy Goebel2026-05-04
💻 computer science

MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation

यह शोध पत्र MiniVLA-Nav v1 को प्रस्तुत करता है, जो चार फोटो-यथार्थवादी (photorealistic) Isaac Sim वातावरणों में 1,174 एपिसोड वाला एक सार्वजनिक रूप से उपलब्ध सिमुलेशन डेटासेट है, जो NVIDIA Nova Carter रोबोट के लिए भाषा-आधारित ऑब्जेक्ट अप्रोच नेविगेशन को बेंचमार्क करने हेतु प्राकृतिक भाषा निर्देशों को सिंक्रोनाइज़ किए गए विजुअल और एक्सपर्ट एक्शन डेटा के साथ जोड़ता है।

Ali Al-Bustami, Jaerock Kwon2026-05-04
🤖 AI

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

यह शोध पत्र हैमिल्टोनियन वर्ल्ड मॉडल्स (Hamiltonian World Models) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो प्रेक्षणों को संरचित लेटेंट फेज स्पेस (latent phase spaces) में एनकोड करता है और एम्बोडीड निर्णय लेने (embodied decision-making) के लिए भौतिक रूप से सार्थक, क्रिया-नियंत्रणीय और दीर्घ-अवधि स्थिर भविष्यवाणियां उत्पन्न करने के लिए उन्हें हैमिल्टोनियन-प्रेरित गतिकी (Hamiltonian-inspired dynamics) का उपयोग करके विकसित करता है।

Sen Cui, Jingheng Ma2026-05-04
🤖 AI

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

यह शोधपत्र इंटरलीव्ड विजन-लैंग्वेज रीजनिंग (IVLR) प्रस्तुत करता है, जो एक ऐसा पॉलिसी फ्रेमवर्क है जो तार्किक सुसंगतता को ज्यामितीय ग्राउंडिंग के साथ जोड़कर मजबूत, लॉन्ग-होरिज़न रोबोट मैनिपुलेशन को सक्षम करने के लिए टेक्स्टुअल सबगोल्स और विजुअल कीफ्रेम्स के बीच बारी-बारी से स्पष्ट ट्रेसेस जेनरेट करता है, जिससे चुनौतीपूर्ण बेंचमार्क पर स्टेट-ऑफ-द-आर्ट सफलता दर प्राप्त होती है।

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding2026-05-04
💻 computer science

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

यह शोध पत्र यह प्रदर्शित करता है कि हाई-स्पीड वीडियो का उपयोग करना, वीडियो-लैंग्वेज मॉडल्स और लार्ज लैंग्वेज मॉडल रीजनिंग को संयोजित करने वाले ट्रेनिंग-फ्री पाइपलाइन्स में एक्शन रिप्रेजेंटेशन्स की सेपरेबिलिटी और स्टेबिलिटी में सुधार करके, केंडो जैसे तीव्र मानवीय कार्यों की ज़ीरो-शॉट सिमेंटिक समझ को महत्वपूर्ण रूप से बढ़ाता है।

Yongpeng Cao, Yuji Yamakawa2026-05-04
🤖 AI

Linking Behaviour and Perception to Evaluate Meaningful Human Control over Partially Automated Driving

यह अध्ययन एक सिम्युलेटर प्रयोग के माध्यम से आंशिक रूप से स्वचालित ड्राइविंग में सार्थक मानवीय नियंत्रण का मूल्यांकन करता है जो हैप्टिक साझा नियंत्रण और ट्रेडेड नियंत्रण मोड की तुलना करता है, जिससे यह पता चलता है कि कथित नियंत्रण ऑटोमेशन-ड्राइवर संघर्षों और इरादे के बेमेल होने से नकारात्मक रूप से प्रभावित होता है, जबकि सूक्ष्म, संरेखित हैप्टिक मार्गदर्शन द्वारा इसे बढ़ाया जाता है।

Ashwin George, Lucas Elbert Suryana, Lorenzo Flipse, Bart van Arem, David A. Abbink, Simeon Craig Calvert, Luciano Caval (…)2026-05-04
💻 computer science

Recovering Hidden Reward in Diffusion-Based Policies

यह शोध पत्र EnergyFlow को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो जनरेटिव एक्शन मॉडलिंग को इन्वर्स रिइन्फोर्समेंट लर्निंग के साथ एकीकृत करता है, जिसमें विशेषज्ञ पुरस्कारों (expert rewards) को पुनः प्राप्त करने और एडवरसेरियल ट्रेनिंग के बिना पॉलिसी जनरलाइजेशन में सुधार करने के लिए एक स्केलर एनर्जी फंक्शन को पैरामीट्राइज़ किया गया है।

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu2026-05-04
🤖 AI

Joint Action is a Framework for Understanding Partnerships Between Humans and Upper Limb Prostheses

यह शोध पत्र मानव-ऊपरी अंग कृत्रिम अंग इंटरफ़ेस को एक सरल उपकरण-नियंत्रण संबंध के बजाय एक सहयोगात्मक संयुक्त क्रिया प्रणाली के रूप में पुनर्गठित करने का प्रस्ताव करता है, यह प्रदर्शित करते हुए कि यह परिप्रेक्ष्य मौजूदा नियंत्रकों का बेहतर मूल्यांकन कैसे कर सकता है और सहयोगात्मक संचार में भविष्य के सुधारों को कैसे निर्देशित कर सकता है।

Michael R. Dawson, Adam S. R. Parker, Heather E. Williams, Ahmed W. Shehata, Jacqueline S. Hebert, Craig S. Chapman, Pat (…)2026-05-01
💻 computer science

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

यह शोध पत्र CLIC को प्रस्तुत करता है, जो एक ह्यूमन-इन-द-लूप इमिटेशन लर्निंग फ्रेमवर्क है जो भंगुर पॉइंटवाइज एक्शन सुपरविजन को सुधारात्मक फीडबैक से प्राप्त सेट-वैल्यूड टारगेट्स से बदल देता है, जिससे एक मजबूत पॉलिसी लर्निंग सक्षम होती है जो शोरपूर्ण, सापेक्ष और मल्टी-मोडल मानवीय मार्गदर्शन को समाहित करती है।

Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober2026-05-01
💻 computer science

BOW: Bayesian Optimization over Windows for Motion Planning in Complex Environments

BOW प्लैनर एक स्केलेबल, ओपन-सोर्स मोशन प्लानिंग एल्गोरिदम है जो जटिल वातावरण में रोबोटों के लिए सुरक्षित, निकट-इष्टतम प्रक्षेपवक्र (ट्रैजेक्टरीज़) को कुशलतापूर्वक उत्पन्न करने के लिए एक सुलभ वेग विंडो (रीचेबल वेलोसिटी विंडो) के भीतर बाधित बेयसियन अनुकूलन (कंस्ट्रेंड बेयसियन ऑप्टिमाइज़ेशन) का लाभ उठाता है, जबकि मौजूदा विधियों की तुलना में गणना समय और नमूना दक्षता में महत्वपूर्ण सुधार करता है।

Sourav Raxit, Abdullah Al Redwan Newaz, Paulo Padrao, Jose Fuentes, Leonardo Bobadilla2026-05-01