💻 computer science

Do Open-Loop Metrics Predict Closed-Loop Driving? A Cross-Benchmark Correlation Study of NAVSIM and Bench2Drive

यह अध्ययन अत्याधुनिक विधियों (state-of-the-art methods) में NAVSIM ओपन-लूप मेट्रिक्स और Bench2Drive क्लोज्ड-लूप प्रदर्शन के बीच सहसंबंध का विश्लेषण करता है, जो यह प्रकट करता है कि जहाँ कुल NAVSIM स्कोर वास्तविक दुनिया की ड्राइविंग सफलता के साथ मजबूत लेकिन गैर-एकदिष्ट (non-monotonic) सहसंबंध दिखाते हैं, वहीं 'ईगो प्रोग्रेस' (Ego Progress) सबसे अधिक भविष्य कहने वाला एकल मीट्रिक है और एक सरल तीन-मीट्रिक सूत्र रैंकिंग उद्देश्यों के लिए पूर्ण पांच-मीट्रिक स्कोर को प्रभावी ढंग से प्रतिस्थापित कर सकता है।

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Hai Yang, Yang Chen, Hao Sun2026-05-04
💻 computer science

World Model for Robot Learning: A Comprehensive Survey

यह शोध पत्र रोबोट लर्निंग में वर्ल्ड मॉडल्स का एक व्यापक सर्वेक्षण प्रस्तुत करता है, जो उनके आर्किटेक्चर, पॉलिसी लर्निंग और प्लानिंग में उनकी कार्यात्मक भूमिकाओं, फाउंडेशन-स्केल वीडियो जनरेशन की ओर प्रगति, और नेविगेशन एवं ऑटोनॉमस ड्राइविंग में अनुप्रयोगों की व्यवस्थित रूप से समीक्षा करता है, साथ ही प्रमुख डेटासेट्स, बेंचमार्क और भविष्य की चुनौतियों का भी सारांश प्रस्तुत करता है।

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oi (…)2026-05-04
💻 computer science

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR एक जनरेटिव डेटा इंजन है जो वेब-आधारित, हेडसेट-नेटिव भौतिकी सिमुलेशन वातावरण को भौतिकी-निर्देशित वीडियो जनरेशन के साथ जोड़ता है ताकि विविध सिंथेटिक मल्टी-मोडल डेटा बनाया जा सके, जिससे इस डेटा पर पूरी तरह से प्रशिक्षित रोबोटिक मैनिपुलेशन पॉलिसियों को जटिल वास्तविक दुनिया के वातावरण में ज़ीरो-शॉट सफलतापूर्वक स्थानांतरित करने में सक्षम बनाया जा सके।

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip I (…)2026-05-04
💻 computer science

An End-to-End Decision-Aware Multi-Scale Attention-Based Model for Explainable Autonomous Driving

यह शोध पत्र एक एंड-टू-एंड, मल्टी-स्केल अटेंशन-आधारित मॉडल प्रस्तावित करता है जो स्वायत्त ड्राइविंग के लिए केस-विशिष्ट स्पष्टीकरण उत्पन्न करने हेतु ड्राइविंग निर्णयों को एक रीजनिंग घटक में एकीकृत करता है, जिसे एक नए जॉइंट F1 स्कोर मीट्रिक और BDD-OIA एवं nu-AR डेटासेट पर प्रयोगों के माध्यम से मान्य किया गया है ताकि मौजूदा स्टेट-ऑफ-द-आर्ट मॉडलों पर बेहतर प्रदर्शन प्रदर्शित किया जा सके।

Maryam Sadat Hosseini Azad, Shahriar Baradaran Shokouhi, Amir Abbas Hamidi Imani, Shahin Atakishiyev, Randy Goebel2026-05-04
💻 computer science

MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation

यह शोध पत्र MiniVLA-Nav v1 को प्रस्तुत करता है, जो चार फोटो-यथार्थवादी (photorealistic) Isaac Sim वातावरणों में 1,174 एपिसोड वाला एक सार्वजनिक रूप से उपलब्ध सिमुलेशन डेटासेट है, जो NVIDIA Nova Carter रोबोट के लिए भाषा-आधारित ऑब्जेक्ट अप्रोच नेविगेशन को बेंचमार्क करने हेतु प्राकृतिक भाषा निर्देशों को सिंक्रोनाइज़ किए गए विजुअल और एक्सपर्ट एक्शन डेटा के साथ जोड़ता है।

Ali Al-Bustami, Jaerock Kwon2026-05-04
🤖 AI

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

यह शोध पत्र हैमिल्टोनियन वर्ल्ड मॉडल्स (Hamiltonian World Models) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो प्रेक्षणों को संरचित लेटेंट फेज स्पेस (latent phase spaces) में एनकोड करता है और एम्बोडीड निर्णय लेने (embodied decision-making) के लिए भौतिक रूप से सार्थक, क्रिया-नियंत्रणीय और दीर्घ-अवधि स्थिर भविष्यवाणियां उत्पन्न करने के लिए उन्हें हैमिल्टोनियन-प्रेरित गतिकी (Hamiltonian-inspired dynamics) का उपयोग करके विकसित करता है।

Sen Cui, Jingheng Ma2026-05-04
🤖 AI

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

यह शोधपत्र इंटरलीव्ड विजन-लैंग्वेज रीजनिंग (IVLR) प्रस्तुत करता है, जो एक ऐसा पॉलिसी फ्रेमवर्क है जो तार्किक सुसंगतता को ज्यामितीय ग्राउंडिंग के साथ जोड़कर मजबूत, लॉन्ग-होरिज़न रोबोट मैनिपुलेशन को सक्षम करने के लिए टेक्स्टुअल सबगोल्स और विजुअल कीफ्रेम्स के बीच बारी-बारी से स्पष्ट ट्रेसेस जेनरेट करता है, जिससे चुनौतीपूर्ण बेंचमार्क पर स्टेट-ऑफ-द-आर्ट सफलता दर प्राप्त होती है।

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding2026-05-04
💻 computer science

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

यह शोध पत्र यह प्रदर्शित करता है कि हाई-स्पीड वीडियो का उपयोग करना, वीडियो-लैंग्वेज मॉडल्स और लार्ज लैंग्वेज मॉडल रीजनिंग को संयोजित करने वाले ट्रेनिंग-फ्री पाइपलाइन्स में एक्शन रिप्रेजेंटेशन्स की सेपरेबिलिटी और स्टेबिलिटी में सुधार करके, केंडो जैसे तीव्र मानवीय कार्यों की ज़ीरो-शॉट सिमेंटिक समझ को महत्वपूर्ण रूप से बढ़ाता है।

Yongpeng Cao, Yuji Yamakawa2026-05-04
🤖 AI

Linking Behaviour and Perception to Evaluate Meaningful Human Control over Partially Automated Driving

यह अध्ययन एक सिम्युलेटर प्रयोग के माध्यम से आंशिक रूप से स्वचालित ड्राइविंग में सार्थक मानवीय नियंत्रण का मूल्यांकन करता है जो हैप्टिक साझा नियंत्रण और ट्रेडेड नियंत्रण मोड की तुलना करता है, जिससे यह पता चलता है कि कथित नियंत्रण ऑटोमेशन-ड्राइवर संघर्षों और इरादे के बेमेल होने से नकारात्मक रूप से प्रभावित होता है, जबकि सूक्ष्म, संरेखित हैप्टिक मार्गदर्शन द्वारा इसे बढ़ाया जाता है।

Ashwin George, Lucas Elbert Suryana, Lorenzo Flipse, Bart van Arem, David A. Abbink, Simeon Craig Calvert, Luciano Caval (…)2026-05-04
💻 computer science

Recovering Hidden Reward in Diffusion-Based Policies

यह शोध पत्र EnergyFlow को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो जनरेटिव एक्शन मॉडलिंग को इन्वर्स रिइन्फोर्समेंट लर्निंग के साथ एकीकृत करता है, जिसमें विशेषज्ञ पुरस्कारों (expert rewards) को पुनः प्राप्त करने और एडवरसेरियल ट्रेनिंग के बिना पॉलिसी जनरलाइजेशन में सुधार करने के लिए एक स्केलर एनर्जी फंक्शन को पैरामीट्राइज़ किया गया है।

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu2026-05-04