💻 computer science

SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

यह शोध पत्र SARM का प्रस्ताव करता है, जो एक स्टेज-अवेयर, वीडियो-आधारित रिवॉर्ड मॉडलिंग फ्रेमवर्क है जो टी-शर्ट फोल्डिंग जैसे लॉन्ग-होरिज़ॉन, कॉन्टैक्ट-रिच कार्यों के लिए सुसंगत सुपरविजन उत्पन्न करने हेतु प्राकृतिक भाषा एनोटेशन का लाभ उठाता है, जो एक नवीन रिवॉर्ड-अलाइन्ड बिहेवियर क्लोनिंग (RA-BC) पद्धति के माध्यम से डाउनस्ट्रीम पॉलिसी ट्रेनिंग को महत्वपूर्ण रूप से बढ़ाता है।

Qianzhong Chen, Justin Yu, Mac Schwager, Pieter Abbeel, Yide Shentu, Philipp Wu2026-04-28
💻 computer science

Using Language Models as Closed-Loop High-Level Planners for Robotics Applications: A Brief Overview and Benchmarks

यह शोध पत्र रोबोटिक्स में क्लोज्ड-लूप हाई-लेवल प्लानर्स के रूप में लार्ज लैंग्वेज मॉडल्स (LLMs) और विजन लैंग्वेज मॉडल्स (VLMs) को एकीकृत करने की व्यावहारिक रणनीतियों की अनुभवजन्य जांच करता है, जो विशेष रूप से योजना बनाने के प्रदर्शन और मजबूती में सुधार के लिए कार्रवाई योग्य सिफारिशें प्रदान करने हेतु कंट्रोल होराइजन और वार्म-स्टार्टिंग के प्रभाव का विश्लेषण करता है।

Hao Wang, Sathwik Karnik, Bea Lim, Somil Bansal2026-04-28
🤖 machine learning

SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding

SPEAR-1 एक रोबोटिक फाउंडेशन मॉडल है जो बड़े पैमाने पर, 3D-एनोटेटेड गैर-रोबोटिक डेटा पर प्रशिक्षित 3D स्थानिक तर्क क्षमताओं के साथ एक प्रीट्रेंड विजन-लैंग्वेज मॉडल को बढ़ाकर उत्कृष्ट एम्बोडीड कंट्रोल प्राप्त करता है, जिससे यह 20×\times कम रोबोटिक प्रदर्शनों का उपयोग करते हुए भी अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करने में सक्षम होता है।

Nikolay Nikolov, Giuliano Albanese, Sombit Dey, Aleksandar Yanev, Luc Van Gool, Jan-Nico Zaech, Danda Pani Paudel2026-04-28
🤖 machine learning

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV एक काइनेमैटिक-रेक्टिफाइड स्पेकुलेटिव डिकोडिंग फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स के लिए है, जो महंगी री-इन्फरेंस के बजाय काइनेमैटिक प्रेडिक्शन्स के माध्यम से टोकन त्रुटियों की भरपाई करके रोबोट कंट्रोल इन्फरेंस को त्वरित करने के लिए कलमन फिल्टर और एक डायनेमिक एडजस्टमेंट स्ट्रैटेजी का उपयोग करता है।

Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen2026-04-28
💻 computer science

SwarmDrive: Semantic V2V Coordination for Latency-Constrained Cooperative Autonomous Driving

स्वार्मड्राइव (SwarmDrive) एक सिमेंटिक V2V समन्वय ढांचा है जो क्लाउड-आधारित या विशुद्ध रूप से स्थानीय दृष्टिकोणों की तुलना में ओक्लूडेड (occluded) परिदृश्यों में स्वायत्त ड्राइविंग सफलता दर में सुधार करने और विलंबता (latency) को कम करने के लिए स्थानीय स्मॉल लैंग्वेज मॉडल्स (SLMs) और इवेंट-ट्रिगर्ड संचार का उपयोग करता है।

Anjie Qiu, Donglin Wang, Zexin Fang, Sanket Partani, Hans D. Schotten2026-04-28
💻 computer science

Airspeed Forward-Invariance for Unpowered Fixed-Wing Aircraft

यह शोध पत्र एक व्यवहार्यता-आधारित ढांचे का प्रस्ताव करता है जो उड़ान पथ कोण (फ्लाइट पाथ एंगल) कमांड्स पर पवन-निर्भर बाधाओं को प्राप्त करने के लिए नागुमो की टेंगेंसी स्थिति (नागुमो की स्पर्शता स्थिति) का उपयोग करता है, जिससे यह सुनिश्चित होता है कि एक बिना शक्ति वाला फिक्स्ड-विंग विमान प्रमाणित मैनोवर प्रिमिटिव्स के माध्यम से एक सुरक्षित एयरस्पीड एनवेलप बनाए रखता है।

Huseyin Emre Tekaslan, Ella M. Atkins2026-04-28
💻 computer science

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

यह सर्वेक्षण तर्क देता है कि विजन-लैंग्वेज-एक्शन (VLA) मॉडलों का भविष्य डेटा इंफ्रास्ट्रक्चर—विशेष रूप से डेटासेट, बेंचमार्क और डेटा इंजन—को स्केलेबिलिटी, सामान्यीकरण और भौतिक ग्राउंडिंग में वर्तमान सीमाओं को दूर करने के लिए एक प्राथमिक अनुसंधान प्राथमिकता के रूप में मानने पर निर्भर करता है।

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, An (…)2026-04-28
💻 computer science

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

यह शोध पत्र **DeLock** प्रस्तुत करता है, जो विज़न-लैंग्वेज-एक्शन (VLA) नीतियों के लो-डेटा पोस्ट-ट्रेनिंग के दौरान इंस्ट्रक्शन-फॉलोइंग और जनरलाइजेशन के नुकसान यानी "लॉक-इन" को रोकने के लिए एक विधि है, जो प्री-ट्रेंड विजुअल ग्राउंडिंग को सुरक्षित रखता है और स्टीयरेबिलिटी बनाए रखने के लिए टेस्ट-टाइम कॉन्ट्रास्टिव प्रॉम्ट गाइडेंस का उपयोग करता है।

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg2026-04-28
💻 computer science

An Efficient Beam Search Algorithm for Active Perception in Mobile Robotics

यह शोध पत्र मोबाइल रोबोटिक्स के लिए एक कुशल सक्रिय धारणा (active perception) ढांचे का प्रस्ताव करता है जो सिमुलेशन और वास्तविक दुनिया दोनों परिदृश्यों में मौजूदा विधियों से बेहतर प्रदर्शन करने के लिए एक नवीन नोड-वाइज बीम सर्च (NBS) एल्गोरिदम, बेहतर अन्वेषण के लिए एक अपेक्षित लाभ मीट्रिक और एक रैपिडली-एक्सप्लोरिंग रैंडम एनुलस ग्राफ (RRAG) को जोड़ता है।

Kaixian Qu, Han Wang, Victor Klemm, Cesar Cadena, Marco Hutter2026-04-28
💻 computer science

Large Language Model based Interactive Decision-Making for Autonomous Driving

यह शोध पत्र एक लार्ज लैंग्वेज मॉडल-आधारित ढांचे का प्रस्ताव करता है जो सिमेंटिक सीन मॉडलिंग के लिए ऑब्जेक्ट-प्रोसेस मेथोडोलॉजी, निर्णय लेने के लिए इंटेंट-अवेयर रीजनिंग, और सुरक्षा, दक्षता एवं मानव-समान इंटरैक्शन में सुधार के लिए एक बाहरी ह्यूमन-मशीन इंटरफेस के माध्यम से नेचुरल-लैंग्वेज कम्युनिकेशन का उपयोग करके जटिल मिश्रित-ट्रैफिक परिदृश्यों में स्वायत्त ड्राइविंग को बढ़ाता है।

Xinwei Dong, Jiyang Li, Jiabin Xie, Yang Yi, Tianshang Jia, Shiyu Fang, Ye Tian, Peng Hang2026-04-28