🤖 machine learning

ASCII Art Turns LLMs into VLA Controllers

यह शोध पत्र यह प्रदर्शित करता है कि विज़ुअल ऑब्जर्वेशन को ASCII टेक्स्ट में बदलकर, टेक्स्ट-ओनली लार्ज लैंग्वेज मॉडल्स को भारी मल्टीमॉडल बैकबोन की आवश्यकता के बिना सिमुलेशन और वास्तविक दुनिया के रोबोटिक मैनिपुलेशन में कुशल कार्य नियोजन और निष्पादन हेतु विज़न-लैंग्वेज-एक्शन कंट्रोलर्स में प्रभावी ढंग से अनुकूलित किया जा सकता है।

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom2026-06-23
💻 computer science

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA एक एकीकृत मल्टीव्यू विजन-लैंग्वेज-एक्शन मॉडल है जो मानक दो-कैमरा अवलोकनों से छिपे हुए संकेतों और भविष्य के दृश्य विकास का अनुमान लगाने के लिए एक वर्ल्ड मॉडल का लाभ उठाता है, जिससे बिना किसी अतिरिक्त हार्डवेयर या स्पष्ट 3D पुनर्निर्माण की आवश्यकता के, अवरोध-केंद्रित कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu2026-06-23
💻 computer science

A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving

यह शोध पत्र एक हल्का मॉडल स्टिचिंग दृष्टिकोण प्रस्तावित करता है जो अपडेट किए गए धारणा मॉड्यूल और फ्रीज़्ड डाउनस्ट्रीम पॉलिसियों के बीच लेटेंट रिप्रेजेंटेशन को संरेखित करता है, जो पारंपरिक रिट्रेनिंग विधियों की तुलना में अनुकूलन समय को काफी कम करते हुए विविध धारणा परिवर्तनों के बावजूद ड्राइविंग प्रदर्शन को प्रभावी ढंग से बनाए रखता है।

Yueyuan Li, Yifei Xiao, Mingyang Jiang, Xiang Zuo, Songan Zhang, Ming Yang2026-06-23
💻 computer science

Robot Critics that Sweat the Small Stuff

यह शोध पत्र विज़न-लैंग्वेज मॉडल क्रिटिक्स को सफलता और विफलता वाले रोलआउट्स से पेयरवाइज प्रोग्रेस सुपरविज़न का उपयोग करके फाइन-ट्यून करने की एक विधि प्रस्तुत करता है, जो उन्हें सूक्ष्म दृश्य अंतरों का पता लगाने में सक्षम बनाता है और रोबोट नीतियों को वास्तविक दुनिया और सिम्युलेटेड कार्यों में सफलता दर को महत्वपूर्ण रूप से सुधारने के लिए निर्देशित करता है।

Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan, Pavel Tokmakov, Richard Zemel, Carl Vondrick2026-06-23
💻 computer science

Online Learning of Robust Legged Odometry with Minimal Exteroceptive Supervision

यह शोध पत्र एक प्लग-एंड-प्ले, सुदृढ़ लेग्ड ओडोमेट्री प्रणाली प्रस्तुत करता है जो एक्सटेरोसेप्टिव संकेतों का उपयोग करके प्रोप्रियोसेप्टिव डेटा पर एक ऑनलाइन न्यूरल नेटवर्क को प्रशिक्षित करके स्पष्ट सेंसर अंशांकन या काइनेमैटिक मॉडलिंग की आवश्यकता को समाप्त करती है, जिससे पर्यावरणीय स्थितियाँ खराब होने पर प्रोप्रियोसेप्शन-ओनली एस्टीमेशन में निर्बाध रूप से फॉलबैक सक्षम होता है।

Abhijeet M. Kulkarni, Yuze Du, Guoquan Huang2026-06-23
🤖 AI

Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models

यह शोध पत्र ग्राउंडेड लेटेंट-एक्शन वर्ल्ड मॉडल्स (GLAM) को प्रस्तुत करता है, जो एक साझा, प्रेडिक्शन-ग्राउंडेड लेटेंट एक्शन स्पेस सीखने के लिए एक फ्रेमवर्क है ताकि भिन्न या लुप्त एक्शन लेबल्स वाले विषम डेटा स्रोतों से मजबूत इमिटेशन लर्निंग को सक्षम किया जा सके, जो सिमुलेशन और वास्तविक दुनिया के मैनिपुलेशन कार्यों में मौजूदा बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

Tianyou Wang, Anson Lei, Joe Watson, Ingmar Posner2026-06-23
💻 computer science

Rotation-Aware Point-Cloud Embeddings for Vision-Based In-Hand Reorientation

यह शोध पत्र एक रोटेशन-अवेयर पॉइंट-क्लाउड एम्बेडिंग प्रस्तुत करता है जो यूक्लिडियन लेटेंट डिस्टेंस को SO(3) ओरिएंटेशन एरर के अनुरूप कैलिब्रेट करता है, जिससे मॉडल-फ्री रिइन्फोर्समेंट लर्निंग पॉलिसीज़ को स्पष्ट पोज़ एस्टीमेशन, डेंस फ्लो फीचर्स, या टीचर सुपरविजन की आवश्यकता के बिना, रॉ पॉइंट-क्लाउड गोल्स से सीधे इन-हैंड रियोरिएंटेशन करने में सक्षम बनाया जा सके।

Yashom Dighe, Karthik Dantu2026-06-23
🤖 AI

THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion

यह शोध पत्र THREAD को प्रस्तुत करता है, जो हाइब्रिड रिजिड-सॉफ्ट मैनिपुलेटर्स के लिए एक डिफ्यूजन-आधारित प्रक्षेपवक्र (ट्रैजेक्टरी) प्लानर है, जो संकीर्ण स्थानों में सफलतापूर्वक नेविगेट करने के लिए स्थानीय परिवेश की ज्यामिति पर आधारित एक जनरेटिव प्रायर सीखता है, जिससे टकराव काफी कम हो जाते हैं और उच्च क्रॉस-एम्बोडिमेंट ट्रांसफ़रेबिलिटी प्राप्त होती है।

Shivani Kamtikar, Pranav Asthana, Naveen Kumar Uppalapati, Girish Krishnan, Girish Chowdhary2026-06-23
💻 computer science

Deep RL- Tuned Mo del-Free Adaptive Control for Lower-Limb Exoskeletons During Sit-to-Stand Transitions

यह शोध पत्र एक डीप आरएल-ट्यून्ड मॉडल-फ्री एडेप्टिव कंट्रोल रणनीति प्रस्तावित करता है जो एक द्विपक्षीय लोअर-लिम्ब एक्सोस्केलेटन के लिए गेन्स को गतिशील रूप से समायोजित करने हेतु ट्विन डिलेड डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (TD3) एजेंट को एकीकृत करता है, जिससे सिट-टू-स्टैंड ट्रांज़िशन के दौरान अत्याधुनिक नियंत्रकों की तुलना में बेहतर प्रक्षेपवक्र ट्रैकिंग सटीकता और मजबूती प्राप्त होती है।

Ranjeet Kumbhar, Appaso M. Gadade, Rajmeet Singh, Ashish Singla, Ravinder Kumar2026-06-23
💻 computer science

GeoFlow-SLAM++: A Robust Multi-Camera Visual-Inertial SLAM System with Relocalization

GeoFlow-SLAM++ एक सुदृढ़, टाइटली कपल्ड मल्टी-कैमरा विजुअल-इनर्शियल SLAM सिस्टम है जो परिवर्तनीय ORB या न्यूरल नेटवर्क-आधारित फ्रंट-एंड के माध्यम से ट्रैकिंग, मैपिंग और रिलोकेलाइजेशन को एकीकृत करता है, जिससे विविध डेटासेट्स में चुनौतीपूर्ण वातावरण में LiDAR-तुलनीय प्रदर्शन और बढ़ी हुई लचीलापन प्राप्त होता है।

Wei Fen, Tingyang Xiao, Liu Liu, Xiaolin Zhou, Zhizhong Su2026-06-23