💻 computer science

Masquerade: Learning from In-the-wild Human Videos using Data-Editing

मैस्करेड (Masquerade) आर्म इनपेंटिंग (arm inpainting) और रोबोट ओवरले (robot overlay) के माध्यम से इन-द-वाइल्ड (in-the-wild) मानव वीडियो को संपादित करके रोबोट प्रदर्शनों को संश्लेषित करके रोबोट डेटा की कमी को संबोधित करता है, जो एक सह-प्रशिक्षण (co-training) रणनीति को सक्षम बनाता है जो लॉन्ग-होरिज़न द्विपक्षीय कार्यों (long-horizon bimanual tasks) पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

Marion Lepert, Jiaying Fang, Jeannette Bohg2026-05-29
🤖 machine learning

Contrastive Representation Regularization for Vision-Language-Action Models

यह शोध पत्र रोबोट स्टेट-अवेयर कॉन्ट्रास्टिव लॉस (RS-CL) का परिचय देता है, जो एक हल्का प्रतिनिधित्व नियमितीकरण (representation regularization) तकनीक है जो विजन-लैंग्वेज-एक्शन मॉडल के प्रतिनिधित्व को रोबोटिक प्रोप्रियोसेप्टिव अवस्थाओं के साथ संरेखित करता है, जिससे सिम्युलेटेड और वास्तविक दुनिया के मैनिपुलेशन बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin2026-05-29
💻 computer science

A Sliding-Window Filter for Online Continuous-Time Continuum Robot State Estimation

यह शोधपत्र कॉन्टिन्यूम रोबोट्स के लिए पहला स्टोकेस्टिक स्लाइडिंग-विंडो फ़िल्टर प्रस्तुत करता है जो मौजूदा डिस्क्रीट-टाइम अनुमानों और ऑफलाइन विधियों की सीमाओं को पार करते हुए, वास्तविक समय से तेज़ गति पर सटीक, ऑनलाइन, निरंतर-समय अवस्था अनुमान (स्टेट एस्टीमेशन) सक्षम बनाता है।

Spencer Teetaert, Sven Lilge, Jessica Burgner-Kahrs, Timothy D. Barfoot2026-05-29
💻 computer science

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

यह शोध पत्र DUST का प्रस्ताव करता है, जो एक डुअल-स्ट्रीम डिफ्यूजन फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स को वर्ल्ड मॉडल्स के साथ संवर्धित करता है ताकि मोडैलिटी अंतराल को दूर किया जा सके और रोबोटिक पॉलिसी लर्निंग में सुधार किया जा सके, जो क्रॉस-मोडल कॉज़ल लर्निंग और एसिंक्रोनस सैंपलिंग के माध्यम से सिम्युलेटेड और वास्तविक दुनिया के कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin2026-05-29
💻 computer science

SurfFill: Completion of LiDAR Point Clouds via Gaussian Surfel Splatting

SurfFill एक नवीन LiDAR पॉइंट क्लाउड कंप्लीशन विधि है जो बीम डाइवर्जेंस के कारण उत्पन्न होने वाले संदिग्ध क्षेत्रों की पहचान करने और उन्हें सघन बनाने के लिए गॉसियन सर्फेल स्प्लेटिंग का लाभ उठाती है, जो प्रभावी रूप से LiDAR की ज्यामितीय सटीकता को कैमरा-आधारित विवरण रिकवरी के साथ जोड़कर मौजूदा पुनर्निर्माण तकनीकों से बेहतर प्रदर्शन करती है।

Svenja Strobel, Matthias Innmann, Bernhard Egger, Marc Stamminger, Linus Franke2026-05-29
💻 computer science

Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery

सेंटिनल-वीएलए (Sentinel-VLA) एक मेटाकॉग्निटिव विजन-लैंग्वेज-एक्शन मॉडल है जिसमें ऑन-डिमांड डायनेमिक रीजनिंग और एरर रिकवरी के लिए एक एक्टिव स्टेटस मॉनिटरिंग मॉड्यूल है, जिसे ऑटोमैटिकली जेनरेटेड डेटा पर प्रशिक्षित किया गया है और स्टेट-ऑफ-द-आर्ट मॉडल्स की तुलना में सफलता दर में 30% सुधार प्राप्त करने के लिए एक सेल्फ-इवॉल्विंग कॉन्टिनुअल लर्निंग एल्गोरिदम के साथ उन्नत किया गया है।

Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu2026-05-29
💻 computer science

VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

यह शोध पत्र VLA-ATTC को प्रस्तुत करता है, जो एक अनिश्चितता-आधारित "कॉग्निटिव क्लच" (cognitive clutch) और युग्मवार क्रिया चयन के लिए एक नवीन 'रिलेटिव एक्शन क्रिटिक' (Relative Action Critic) के माध्यम से अडैप्टिव टेस्ट-टाइम कंप्यूट के साथ विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जो बिना किसी मैनुअल एनोटेशन के जटिल हेरफेर कार्यों में विफलता दर को महत्वपूर्ण रूप से कम करता है।

Wenhao Li, Xiu Su, Yichao Cao, Hongyan Xu, Xiaobo Xia, Shan You, Yi Chen, Chang Xu2026-05-29
🤖 machine learning

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

यह शोध पत्र फ्लो-एंकोर्ड नॉइज़-कंडीशन्ड क्यू-लर्निंग (FAN) प्रस्तुत करता है, जो एक कुशल ऑफलाइन रीइन्फोर्समेंट लर्निंग एल्गोरिदम है जो फ्लो पॉलिसियों और डिस्ट्रीब्यूशनल क्रिटिक्स को केवल एक इटरेशन और नॉइज़ सैंपल की आवश्यकता के लिए अनुकूलित करके रोबोटिक कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है, जिससे सटीकता से समझौता किए बिना कम्प्यूटेशनल लागतों को काफी कम किया जा सकता है।

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali2026-05-29
💻 computer science

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

यह शोध पत्र पहला व्यवस्थित ब्लैक-बॉक्स अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि स्वायत्त ड्राइविंग के लिए रीजनिंग-सक्षम विजन-लैंग्वेज-एक्शन मॉडल यथार्थवादी टेक्स्ट इनपुट व्यवधानों के प्रति अत्यधिक संवेदनशील हैं, जो तर्क करने की क्षमताओं और ड्राइविंग सुरक्षा को महत्वपूर्ण रूप से कम कर देते हैं, जिससे मजबूत मूल्यांकन ढांचे और बेहतर सुरक्षा उपायों की तत्काल आवश्यकता रेखांकित होती है।

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr2026-05-29
💻 computer science

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

ElegantVLA एक प्लग-इन, फेज़-एडेप्टिव इन्फरेंस फ्रेमवर्क है जो टेम्पोरल स्टेबिलिटी और टास्क प्रोग्रेस के आधार पर परसेप्शन और एक्शन मॉड्यूल्स के बीच कंप्यूटेशनल रिसोर्सेस को डायनामिकली शेड्यूल करके विजन-लैंग्वेज-एक्शन मॉडल्स को तेज़ करता है, जिससे बेस मॉडल को फिर से ट्रेन किए बिना कंट्रोल फ्रीक्वेंसी में महत्वपूर्ण रूप से वृद्धि होती है।

Ye Li, Huanan Liu, Kangye Ji, Yuan Meng, Jiajun Fan, Yuansong Wang, Shiyu Qin, Chenglei Wu, Shu-Tao Xia, Zhi Wang2026-05-29