💻 computer science

VISOR: A Vision-Language Model-based Test Oracle for Testing Robots

यह शोधपत्र VISOR को प्रस्तुत करता है, जो एक विज़न-लैंग्वेज मॉडल-आधारित टेस्ट ऑरेकल है जो अनिश्चितता को परिमाणित करते हुए रोबोट कार्य की शुद्धता और गुणवत्ता के मूल्यांकन को स्वचालित करता है, यह प्रदर्शित करते हुए कि जबकि जेमिनी और GPT जैसे मॉडल पूरक प्रदर्शन क्षमताएं प्रदान करते हैं, उनके अनिश्चितता अनुमान वर्तमान में मूल्यांकन की शुद्धता का विश्वसनीय रूप से पूर्वानुमान लगाने में विफल रहते हैं।

Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini2026-05-19
🤖 AI

Support-Safe Variational Hybrid Filtering for Contact-Mode and Sparse-Law Recovery

यह शोध पत्र VHYDRO को प्रस्तुत करता है, जो एक सपोर्ट-सेफ वेरिएशनल हाइब्रिड फ़िल्टरिंग फ्रेमवर्क है जो सीखे गए प्रस्तावों (learned proposals) को व्यवहार्य संक्रमणों (feasible transitions) के साथ मिश्रित करके संपर्क-समृद्ध रोबोट डायनेमिक्स में ब्रांच लॉस को रोकता है, जिससे निरंतर अवस्थाओं और असतत संपर्क मोड के सुदृढ़ संयुक्त अनुमान (joint inference) को सक्षम बनाया जा सके और साथ ही स्पार्स पोर्ट-हैमिल्टोनियन भौतिक नियमों की रिकवरी को सुगम बनाया जा सके।

Marios Papamichalis, Regina Ruane2026-05-19
🤖 AI

MR-SLAM: Immersive Spatial Supervision for Multi-Robot Mapping via Mixed Reality

यह शोध पत्र MR-SLAM प्रस्तुत करता है, जो एक मिश्रित वास्तविकता (mixed reality) प्रणाली है जो मेटा क्वेस्ट 3 पासथ्रू (Meta Quest 3 passthrough) और स्थानिक रूप से एंकर किए गए डैशबोर्ड का लाभ उठाकर ऑपरेटरों को उपभोक्ता हार्डवेयर पर उच्च अधिभोग निरंतरता (high occupancy consistency) और कम विलंबता (low latency) के साथ तीन रोबोटों के बेड़े की वास्तविक समय में मल्टी-रोबोट मैपिंग को प्रभावी ढंग से पर्यवेक्षण और टेलीऑपरेट करने में सक्षम बनाती है।

Prakash Aryan, Cem Erdogdu, Kavinaya Kumarchokkappan, Timo Kehrer, Sebastiano Panichella2026-05-19
💻 computer science

Nori Bot: A Sub-$1,000 Floor-to-Counter Mobile Manipulator

यह शोध पत्र नोरि बॉट (Nori Bot) का परिचय देता है, जो एक $947 का ओपन-सोर्स 17-DoF मोबाइल मैनिपुलेटर है जो 600mm वर्टिकल लिफ्ट, ओपनक्लॉ (OpenClaw) रनटाइम के माध्यम से स्वायत्त सक्रिय नियंत्रण और सर्वो बर्नआउट को रोकने के लिए एक सॉफ्टवेयर-आधारित सुरक्षा स्टैक की विशेषता के साथ मौजूदा कम लागत वाले प्लेटफार्मों की सीमाओं को दूर करता है।

Antonio Li, Sungjoon Park, Wen Ni Chew2026-05-19
⚡ electrical engineering

Policy Library CBF: Finite-Horizon Safety at Runtime via Parallel Rollouts

यह शोध पत्र पॉलिसी लाइब्रेरी कंट्रोल बैरियर फंक्शन (PL-CBF) का प्रस्ताव करता है, जो एक रनटाइम सेफ्टी फ़िल्टर है जो समानांतर रोलआउट्स के माध्यम से फॉलबैक पॉलिसियों के पुस्तकालय का मूल्यांकन करके और सबसे कम आक्रामक सुरक्षित क्रिया का चयन करके असंरचित वातावरण में परिमित-क्षिति (finite-horizon) सुरक्षा सुनिश्चित करता है, जिससे मिलीसेकंड-स्तर की निष्पादन गति बनाए रखते हुए एकल-पॉलिसी फिल्टरों की तुलना में बेहतर सुरक्षा कवरेज प्रदान किया जाता है।

Taekyung Kim, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Dimitra Panagou2026-05-19
🤖 machine learning

EfficientTDMPC: Improved MPC Objectives for Sample-Efficient Continuous Control

EfficientTDMPC एक सैंपल-कुशल (sample-efficient) मॉडल-आधारित सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम है जो औसत रिटर्न अनुमानों और अनिश्चितता दंडों (uncertainty penalties) के साथ डायनेमिक्स मॉडल्स के एक समूह (ensemble) का उपयोग करके TD-MPC परिवार को उन्नत करता है ताकि कम-डेटा वाले निरंतर नियंत्रण (continuous control) बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Thomas Evers, Cristian Meo, Wendelin Bohmer, Justin Dauwels, Yaniv Oren2026-05-19
💻 computer science

DriveSafer: End-to-End Autonomous Driving with Safety Guidance

DriveSafer एंड-टू-एंड ऑटोनॉमस ड्राइविंग के लिए एक नवीन सुरक्षा ढांचा है जो प्रशिक्षण-समय की बाधाओं और अनुमान-समय के मार्गदर्शन के माध्यम से जनरेटिव प्लानर्स को स्पष्ट रूप से सुरक्षित व्यवहारों की ओर निर्देशित करता है, जो NAVSIM बेंचमार्क पर अत्याधुनिक मॉडलों की तुलना में विनाशकारी विफलताओं और अनुपालन उल्लंघनों को काफी कम कर देता है।

Shounak Sural, Raj Rajkumar2026-05-19
💻 computer science

LACE: Latent Visual Representation for Cross-Embodiment Learning

LACE एक ऐसा फ्रेमवर्क है जो मानव और रोबोटिक स्वरूपों के बीच के दृश्य अंतर को कम करने के लिए उनके लेटेंट विजुअल रिप्रेजेंटेशन को विरल, स्वचालित रूप से उत्पन्न शरीर के अंगों के पत्राचार के माध्यम से संरेखित करता है, जिससे रोबट सीमित रोबोट-विशिष्ट प्रशिक्षण डेटा के बावजूद नीति सीखने के लिए प्रचुर मानव प्रदर्शन डेटा का प्रभावी ढंग से लाभ उठा पाते हैं।

Yoo Sung Jang, Kanchana Ranasinghe, Cristina Mata, Yichi Zhang, Jorge Mendez-Mendez, Michael S. Ryoo2026-05-19
🤖 machine learning

Plan First, Diffuse Later: Extrinsic Graph Guidance for Long-Horizon Diffusion Planning

यह शोधपत्र XDiffuser प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो एक्सट्रिंसिक ग्राफ-आधारित खोज (extrinsic graph-based search) का उपयोग करके एक हल्का प्लान (lightweight plan) तैयार करता है जो डिनोइजिंग प्रक्रिया को निर्देशित करता है, जिससे इंट्रिंसिक खोज (intrinsic search) के कम्प्यूटेशनल ओवरहेड के बिना वैश्विक सुसंगतता और जटिल कार्यों पर प्रदर्शन में सुधार करके लॉन्ग-होरिज़न डिफ्यूजन प्लानिंग को बढ़ाता है।

Yaniv Hassidof, Adir Morgan, Yilun Du, Kiril Solovey2026-05-19
💻 computer science

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

यह शोधपत्र DeMiAn को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो VLM-जनित सघन, बहु-आयामी भाषाई एनोटेशन का लाभ उठाकर बिना किसी नए प्रदर्शन डेटा की आवश्यकता के विविध कार्यों में रोबोट नीति शिक्षण और सामान्यीकरण को महत्वपूर्ण रूप से सुधारता है।

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu2026-05-19