🤖 AI

Li-ViP3D++: Query-Gated Deformable Camera-LiDAR Fusion for End-to-End Perception and Trajectory Prediction

Li-ViP3D++ एक क्वेरी-गेटेड डिफॉर्मेबल फ्यूजन फ्रेमवर्क पेश करता है जो एंड-टू-एंड धारणा और प्रक्षेपवक्र भविष्यवाणी (ट्रैजेक्टरी प्रेडिक्शन) को संयुक्त रूप से अनुकूलित करने के लिए क्वेरी स्पेस में मल्टी-व्यू कैमरा और LiDAR डेटा को पूर्णतः डिफरेंशियल रूप से एकीकृत करता है, जिससे पूर्ववर्ती विधियों की तुलना में nuScenes बेंचमार्क पर बेहतर सटीकता और दक्षता प्राप्त होती है।

Matej Halinkovic, Nina Masarykova, Alexey Vinel, Marek Galinski2026-07-21
🔬 applied physics

SoMA: A Real-to-Sim Neural Simulator for Robotic Soft-body Manipulation

यह शोध पत्र SoMA को प्रस्तुत करता है, जो एक 3D गॉसियन स्प्लेट-आधारित न्यूरल सिम्युलेटर है जो पूर्व-निर्धारित भौतिक मॉडलों पर निर्भर किए बिना सटीक, स्थिर और सामान्यीकरण योग्य रियल-टू-सिम सॉफ्ट-बॉडी मैनिपुलेशन प्राप्त करने के लिए लेटेंट स्पेस में डिफॉर्मेबल डायनेमिक्स, पर्यावरणीय बलों और रोबोटिक क्रियाओं को एकीकृत करता है।

Mu Huang, Hui Wang, Kerui Ren, Linning Xu, Yunsong Zhou, Mulin Yu, Bo Dai, Jiangmiao Pang2026-07-21
💻 computer science

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

Hierarchical Memory System को पेश करके, MemVLN ओपन-सोर्स ज़ीरो-शॉट विज़न-एंड-लैंग्वेज नेविगेशन में "नेविगेशन एम्नेशिया" (Navigation Amnesia) की समस्या का समाधान किया है, जो दीर्घकालिक स्थानीयकरण (long-term localization) और विज़ुअल रिकॉल को महत्वपूर्ण रूप से बढ़ाता है, जिससे मौजूदा अत्याधुनिक ओपन-सोर्स विधियों के प्रदर्शन को लगभग दोगुना कर दिया गया है।

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan (…)2026-07-21
💻 computer science

Geometrically Approximated Modeling for Emitter-Centric Ray-Triangle Filtering in Arbitrarily Dynamic LiDAR Simulation

यह शोध पत्र ज्यामितीय रूप से अनुमानित मॉडलिंग (GRCA) एल्गोरिदम प्रस्तुत करता है, जो पारंपरिक रे-ट्रेसिंग को उलट देता है और उत्सर्जक-केंद्रित ज्यामितीय अनुमानों के आधार पर यह निर्धारित करता है कि कौन सी किरणें प्रत्येक त्रिकोण (ट्रायंगल) से टकरा सकती हैं, जिससे अत्यधिक गतिशील दृश्यों में बिना किसी महंगे त्वरण संरचना पुनर्निर्माण (एक्सेलेरेशन स्ट्रक्चर रीबिल्ड) की आवश्यकता के, काफी तेज़ वास्तविक समय LiDAR सिमुलेशन प्राप्त किया जा सकता है।

Rabin Gajmer, Joonas Haapala, Zoltan Beck2026-07-21
💻 computer science

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA एक प्रिमिटिव-केंद्रित ढांचे (primitive-centric framework) को पेश करके विजन-लैंग्वेज-एक्शन मॉडल्स की डेटा अक्षमता और खराब सामान्यीकरण (generalization) को संबोधित करता है, जो प्रदर्शनों (demonstrations) को एक साझा मल्टीमॉडल प्रतिनिधित्व के माध्यम से पुन: प्रयोज्य मोशन प्रिमिटिव्स में विघटित करता है और अनुमान (inference) के दौरान उन्हें पुन: संयोजित करता है, जिससे जटिल कार्यों में अधिक कुशल शिक्षण और मजबूत ज़ीरो-शॉट सामान्यीकरण सक्षम होता है।

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji (…)2026-07-21
💻 computer science

Learning Stable In-Grasp Manipulation in a Non-Dropping Action Space

यह शोध पत्र जटिल दक्ष कौशल (dexterous skills) को सरल घटकों में विभाजित करके स्थिर इन-ग्रैस्प मैनिपुलेशन (in-grasp manipulation) सीखने के एक कुशल दृष्टिकोण का प्रस्ताव करता है, जिन्हें शास्त्रीय भौतिकी और नियंत्रण सिद्धांत से प्राप्त बाधाओं और मार्गदर्शन के साथ प्रशिक्षित किया जाता है, जिससे पारंपरिक एंड-टू-एंड सुदृढीकरण लर्निंग (reinforcement learning) की अस्थिरता और अक्षमता को दूर किया जा सके।

Ha Thang Long Doan, Hikaru Arita, Kazuto Nakashima, Kenji Tahara2026-07-21
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

यह शोध पत्र LH-AVLN पेश करता है, जो लॉन्ग-होरिज़ोन ऑडियो-विजुअल-लैंग्वेज नेविगेशन के लिए एक नया बेंचमार्क है जो एजेंटों को ध्वनिक रूप से समृद्ध इनडोर वातावरण में मल्टी-गोल मिशनों के साथ चुनौती देता है, और PAG-Nav का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री एजेंट है जो खोज के लिए बाइनोरल ऑडियो का प्रभावी ढंग से लाभ उठाता है जबकि लक्ष्य पूर्णता के लिए विजुअल-सिमेंटिक सत्यापन पर निर्भर रहता है।

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie2026-07-21
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE एक खुला, समुदाय-संचालित डेटासेट और टूलचेन है जो 2,000 घंटों के संरचित हेरफेर (manipulation) डेटा के साथ-साथ विभिन्न रोबोट लर्निंग मॉडल्स को प्रोसेस करने, रिटारगेटिंग करने और प्रशिक्षित करने के लिए एक व्यापक पाइपलाइन प्रदान करके, स्केलेबल स्मार्टफोन-आधारित एर्गोसेंट्रिक (egocentric) वीडियो कैप्चर और एम्बॉडीड एआई (embodied AI) प्रशिक्षण के बीच के अंतर को पाटता है।

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Z (…)2026-07-21
💻 computer science

Algorithmic Accuracy as a Motivational Driver in Robot-Mediated Learning: A Comparative Study of Cross-Correlation and CNN-Based Sound Detection in an Interactive Quiz Game

यह अध्ययन प्रदर्शित करता है कि रोबोट-मध्यस्थ शैक्षिक सेटिंग्स में, एक CNN की तुलना में अधिक सटीक क्रॉस-कोरिलेशन (Cross-Correlation) ध्वनि पहचान एल्गोरिदम का उपयोग करने से इंटरैक्टिव क्विज़ गेम्स के दौरान कथित निष्पक्षता और सक्षमता में सुधार करके छात्र प्रेरणा को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

Rezaul Tutul, Ilona Buchem, Niels Pinkwart2026-07-21
💻 computer science

xperception -- Making Robotic Grasping Easier

xperception एक ज़ीरो-शॉट 6D पोज़ एस्टीमेशन सिस्टम है जो CAD मॉडल्स और फाउंडेशन मॉडल फीचर्स का लाभ उठाकर हाई-मिक्स लो-वॉल्यूम मैन्युफैक्चरिंग में मिलीमीटर-सटीक, सुदृढ़ रोबोटिक ग्रैस्पिंग को सक्षम बनाता है, जिसके लिए ऑब्जेक्ट-विशिष्ट प्रशिक्षण या डेटा एनोटेशन की आवश्यकता नहीं होती है।

Matteo Bortolon, Andrea Caraffa, Alice Fasoli, Fabio Poiesi2026-07-21