🤖 machine learning

NAC: Neural Action Codec for Vision-Language-Action Models

यह शोध पत्र न्यूरल एक्शन कोडक (NAC) को प्रस्तुत करता है, जो एक न्यूरल ऑडियो कोडक से प्रेरित आर्किटेक्चर है जो रोबोटिक एक्शन ट्राजेक्टरीज को मल्टी-चैनल 1D सिग्नल्स के रूप में मानता है ताकि मौजूदा टोकेनाइजेशन विधियों की तुलना में विजन-लैंग्वेज-एक्शन मॉडल्स में उच्च-सटीकता वाली संपीड़न और बेहतर डाउनस्ट्रीम प्रदर्शन प्राप्त किया जा सके।

Ahad Jawaid, Yu Xiang2026-06-23
💻 computer science

Overcoming Imperfect Kinematics in Surgical Robotics Through Sim-to-Real Visuomotor Learning

यह शोध पत्र एक शिक्षक-छात्र (teacher-student) शिक्षण ढांचे को प्रस्तुत करता है जो विज़ुअल फीडबैक को एक सीखे हुए नियंत्रण नीति (learned control policy) के साथ जोड़कर सर्जिकल रोबोटों को अंतर्निहित गतिकीय अशुद्धियों और अविश्वसनीय आंतरिक सेंसरों पर विजय पाने में सक्षम बनाता है, जो da Vinci Research Kit पर वास्तविक समय में त्रुटि मुआवजे का सफलतापूर्वक प्रदर्शन करता है।

Zhaoxuan Yan, Kaizhong Deng, Zhaoyang Jacopo Hu, George P. Mylonas, Daniel S. Elson2026-06-23
💻 computer science

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav एक मस्तिष्क-प्रेरित, कॉम्पैक्ट प्रक्षेपवक्र स्मृति (trajectory memory) को पेश करके विजन-लैंग्वेज नेविगेशन में स्पार्स फ्रेम चयन की सीमाओं को संबोधित करता है, जो एक Bi-GRU एनकोडर और कंट्रास्टिव लर्निंग के माध्यम से संरचित गति इतिहास को एक एकल टोकन में संकुचित करता है, जिससे टोकन लागत बढ़ाए बिना प्रभावी दीर्घ-क्षितिज तर्क (long-horizon reasoning) सक्षम होता है।

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin2026-06-23
💻 computer science

Robot Self-Improvement via Human-Video Dynamics Models

यह शोध पत्र डायनेमिक्स-गाइडेड एक्शन करेक्शन (DGAC) को प्रस्तुत करता है, जो मानव-वीडियो प्रायर्स (human-video priors) का लाभ उठाने वाला एक प्रशिक्षण-मुक्त तरीका है ताकि एम्बॉडीमेंट-अज्ञेय (embodiment-agnostic) मॉडल सीखे जा सकें, जिससे रोबोटों को विफलताओं को स्वायत्त रूप से सुधारने और विभिन्न एम्बॉडीमेंट्स में उनकी हेरफेर सफलता दरों को महत्वपूर्ण रूप से बेहतर बनाने में सक्षम बनाया जा सके।

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger2026-06-23
💻 computer science

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding

यह तकनीकी रिपोर्ट ICRA 2026 GOOSE 2D फाइन-ग्रेन्ड सेमेंटिक सेगमेंटेशन चैलेंज के लिए एक सबमिशन का विवरण देती है जो बड़े ट्रेनिंग क्रॉप्स, क्वेरी-आधारित Mask2Former आर्किटेक्चर में संक्रमण और आउटडोर सीन अंडरस्टैंडिंग को बेहतर बनाने के लिए टेस्ट-टाइम ऑगमेंटेशन के साथ एक SegFormer बेसलाइन को उन्नत करके 69.6% mIoU प्राप्त करता है।

David Pascual-Hernández, Roberto Calvo-Palomino, Inmaculada Mora-Jiménez, Jose María Cañas-Plaza2026-06-23
💻 computer science

Manipulider: A Multi-Engine Buoyancy-Controlled Robot for Thrusterless Underwater Gliding and Manipulation

मैनिपुलिडर (Manipulider) एक बहु-इंजन, उत्प्लावकता-नियंत्रित (buoyancy-controlled) अंतर्जलीय रोबोट है जो एक चुंबकीय मॉड्यूलर इंटरफेस और चार सिरिंज-संचालित उत्प्लावकता इंजनों के माध्यम से थ्रस्टर रहित ग्लाइडिंग और अभिवृत्ति-आधारित हेरफेर (attitude-based manipulation) प्राप्त करता है, जो प्रोपेलर के बिना स्थिर बड़े-कोण वाले झुकाव और पेलोड परिवहन को सक्षम बनाता है।

Yitao Jiang, Yewei Huang, Weizhi Cao, Mingi Jeong, Alberto Quattrini Li, Luyang Zhao, Muhao Chen, Devin Balkcom2026-06-23
🤖 machine learning

ASCII Art Turns LLMs into VLA Controllers

यह शोध पत्र यह प्रदर्शित करता है कि विज़ुअल ऑब्जर्वेशन को ASCII टेक्स्ट में बदलकर, टेक्स्ट-ओनली लार्ज लैंग्वेज मॉडल्स को भारी मल्टीमॉडल बैकबोन की आवश्यकता के बिना सिमुलेशन और वास्तविक दुनिया के रोबोटिक मैनिपुलेशन में कुशल कार्य नियोजन और निष्पादन हेतु विज़न-लैंग्वेज-एक्शन कंट्रोलर्स में प्रभावी ढंग से अनुकूलित किया जा सकता है।

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom2026-06-23
💻 computer science

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA एक एकीकृत मल्टीव्यू विजन-लैंग्वेज-एक्शन मॉडल है जो मानक दो-कैमरा अवलोकनों से छिपे हुए संकेतों और भविष्य के दृश्य विकास का अनुमान लगाने के लिए एक वर्ल्ड मॉडल का लाभ उठाता है, जिससे बिना किसी अतिरिक्त हार्डवेयर या स्पष्ट 3D पुनर्निर्माण की आवश्यकता के, अवरोध-केंद्रित कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu2026-06-23
💻 computer science

A Stitch in Time Saves Nine: Preserving Policy Compatibility Under Perception Updates in End-to-End Autonomous Driving

यह शोध पत्र एक हल्का मॉडल स्टिचिंग दृष्टिकोण प्रस्तावित करता है जो अपडेट किए गए धारणा मॉड्यूल और फ्रीज़्ड डाउनस्ट्रीम पॉलिसियों के बीच लेटेंट रिप्रेजेंटेशन को संरेखित करता है, जो पारंपरिक रिट्रेनिंग विधियों की तुलना में अनुकूलन समय को काफी कम करते हुए विविध धारणा परिवर्तनों के बावजूद ड्राइविंग प्रदर्शन को प्रभावी ढंग से बनाए रखता है।

Yueyuan Li, Yifei Xiao, Mingyang Jiang, Xiang Zuo, Songan Zhang, Ming Yang2026-06-23
💻 computer science

Robot Critics that Sweat the Small Stuff

यह शोध पत्र विज़न-लैंग्वेज मॉडल क्रिटिक्स को सफलता और विफलता वाले रोलआउट्स से पेयरवाइज प्रोग्रेस सुपरविज़न का उपयोग करके फाइन-ट्यून करने की एक विधि प्रस्तुत करता है, जो उन्हें सूक्ष्म दृश्य अंतरों का पता लगाने में सक्षम बनाता है और रोबोट नीतियों को वास्तविक दुनिया और सिम्युलेटेड कार्यों में सफलता दर को महत्वपूर्ण रूप से सुधारने के लिए निर्देशित करता है।

Sruthi Sudhakar, Junbang Liang, Sreehari Rammohan, Pavel Tokmakov, Richard Zemel, Carl Vondrick2026-06-23