💻 computer science

Object-Informed Model Predictive Path Integral Control for Non-Prehensile Robot Manipulation

यह शोध पत्र एक पदानुक्रमित मॉडल प्रेडिक्टिव पाथ इंटीग्रल (MPPI) नियंत्रण ढांचे का प्रस्ताव करता है जो रोबोट-स्तर के नियोजन को निर्देशित करने के लिए एक सरलीकृत ऑब्जेक्ट-लेवल योजना का लाभ उठाता है, जो सिमुलेशन और वास्तविक दुनिया के हार्डवेयर दोनों में दीर्घ-क्षित (long-horizon) गैर-पकड़ (non-prehensile) हेरफेर कार्यों के लिए सफलता दर और कम्प्यूटेशनल दक्षता में महत्वपूर्ण सुधार करता है।

Nikola Raicevic, Bharath Raam Radhakrishnan, Chenbin Yu, Ki Myung Brian Lee, Nikolay Atanasov2026-06-01
🤖 AI

Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring

यह शोध पत्र **Hide-and-Seek** को प्रस्तुत करता है, जो केवल प्रक्षेपवक्र-स्तर (trajectory-level) के लेबल का उपयोग करके विजन-लैंग्वेज-एक्शन (VLA) मॉडल के लिए विफलता-सूचक क्रियाओं को स्थानीयकृत करने और टेम्पोरल रूप से संरचित विफलता संकेतों को उत्पन्न करने वाला एक कोर्सली सुपरवाइज्ड (coarsely supervised) फ्रेमवर्क है, जिससे महंगे रीसैंपलिंग या स्टेप-लेवल एनोटेशन की आवश्यकता के बिना मजबूत, वास्तविक समय में विफलता का पता लगाना सक्षम होता है।

Seongheon Park, Wendi Li, Changdae Oh, Samuel Yeh, Zsolt Kira, Michael Hagenow, Sharon Li2026-06-01
💻 computer science

Wall-OSS-0.5 Technical Report

यह शोध पत्र Wall-OSS-0.5 को प्रस्तुत करता है, जो एक ओपन-सोर्स 4B विजन-लैंग्वेज-एक्शन मॉडल है जो यह प्रदर्शित करता है कि VLA प्रीट्रेनिंग स्वयं विविध एम्बॉडिमेंट्स (embodiments) के बीच सीधे निष्पादन योग्य ज़ीरो-शॉट रोबोट व्यवहार उत्पन्न करती है और साथ ही डाउनस्ट्रीम फाइन-ट्यूनिंग प्रदर्शन को बढ़ाती है तथा ग्राउंडेड विजन-लैंग्वेज क्षमताओं को सुरक्षित रखती है।

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerr (…)2026-06-01
💻 computer science

Seeing Fast and Slow: Bimodal 3D Scene Graphs for Open-set Tasks

यह शोध पत्र BiMoSG पेश करता है, जो एक द्वि-मोडल (bimodal) 3D सीन ग्राफ जनरेशन फ्रेमवर्क है जो कुशल, वास्तविक समय के ओपन-सेट कार्य निष्पादन को सक्षम करने के लिए एक तेज़, मोटे (coarse) मोड और एक धीमे, सूक्ष्म-स्तरीय (fine-grained) ओपन-वोकैबुलरी मोड के बीच गतिशील रूप से स्विच करता है।

Marcel Bartholomeus Prasetyo, Shrutika Vishal Thengane, A Manicka Praveen, Yi Loo, Malika Meghjani2026-06-01
💻 computer science

NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving

यह शोध पत्र न्यूरल टोकन रिकंस्ट्रक्शन (NTR) को प्रस्तुत करता है, जो एक धारणा-मुक्त (perception-free) एंड-टू-एंड ड्राइविंग फ्रेमवर्क है जो सेल्फ-डिस्टिलेशन मास्क रिकंस्ट्रक्शन ऑब्जेक्टिव और फाउंडेशन-मॉडल-व्युत्पन्न सिमेंटिक प्रायर्स के माध्यम से कॉम्पैक्ट सीन टोकन लर्निंग को बढ़ाता है, जो इन्फरेंस-टाइम प्लानर को बदले बिना बॉटलनेक को समृद्ध और कम रेडंडेंट विजुअल जानकारी संरक्षित करने के लिए मजबूर करके कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Jiahui Li, Jiawei Sun, Zixiang Ren, Ming Liu, Jiamin Shi, Ruiteng Zhao, Zhiyang Liu, Liying Liu, Zuoguan Wang, Kaidi Yan (…)2026-06-01
🤖 machine learning

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

यह शोध पत्र "Don't Fool Me Twice" प्रस्तावित करता है, जो एक निरंतर सीखने वाला (continual learning) ढांचा है जो ऑनलाइन व्यवधान अवलोकन (online disturbance observation), विजन-लैंग्वेज मॉडल तर्क (vision-language model reasoning), और कर्नेल रिग्रेशन (kernel regression) को जोड़कर मोबाइल एम्बोडेड एजेंटों को अनदेखी, एम्बोडिमेंट-विशिष्ट प्रतिकूलताओं के अनुकूल होने में सक्षम बनाता है ताकि वे विसंगतियों से सीख सकें और भविष्य के नियोजन एवं सुधार (planning and recovery) में सुधार कर सकें।

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer2026-06-01
💬 NLP

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

यह शोधपत्र TouchSafeBench प्रस्तुत करता है, जो Habitat 3.0 में एक भौतिकी-आधारित बेंचमार्क है जो सुरक्षित मानव-रोबोट सहयोग के लिए टकराव के जोखिमों का अनुमान लगाने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करता है, जिससे यह पता चलता है कि वर्तमान मॉडल्स में सुरक्षित, टकराने वाली और आसन्न संपर्क अवस्थाओं के बीच विश्वसनीय रूप से अंतर करने के लिए आवश्यक भौतिक जवाबदेही और स्पष्ट ज्यामितीय तर्क का अभाव है।

Jun Wang, Xiaohao Xu, Xiaonan Huang2026-06-01
💻 computer science

Before Parc Fermé: RL-Time Pruning for Efficient Embodied LLMs in Autonomous Driving

यह शोध पत्र "बिफोर पार्स फर्मे" (BPF) का प्रस्ताव करता है, जो एक नवीन प्रूनिंग रणनीति है जो स्वायत्त ड्राइविंग के लिए एम्बोडीड एलएलएम (embodied LLM) नियंत्रकों को अनुकूलित करने के लिए सुदृढीकरण शिक्षण (Reinforcement Learning) के दौरान पुनरावृत्ति मॉडल संपीड़न (iterative model compression) करती है, जिससे पोस्ट-ट्रेनिंग प्रूनिंग या छोटे डेंस मॉडल चुनने की तुलना में बेहतर प्रदर्शन-मेमोरी ट्रेड-ऑफ और 27% तक अधिक डिकोड थ्रूपुट प्राप्त होता है।

Luca Benfenati, Ali Azimi, Matteo Risso, Fabio Carapellese, Daniele Jahier Pagliari, Alessio Burrello2026-06-01
💻 computer science

Surface Constraint Policy for Learning Surface-Constrained and Dynamically Feasible Robot Skills

यह शोध पत्र एक सरफेस कंस्ट्रेंट पॉलिसी (SCP) प्रस्तावित करता है जो मुक्त-रूप सतह ज्यामिति को एनकोड करने के लिए एक द्वि-आयामी भारित गॉसियन कर्नेल को डिफ्यूजन-आधारित मॉडल और डायनेमिक मूवमेंट प्रिमिटिव्स के साथ एकीकृत करता है ताकि ऐसे रोबोटिक क्रियाएं उत्पन्न की जा सकें जो जटिल हेरफेर कार्यों के दौरान विश्वसनीय सतह संरेखण और गतिशील व्यवहार्यता सुनिश्चित करती हैं।

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Jie Pan, Han Ding2026-06-01
💻 computer science

LiftNav: Path Planning via Semantic Lifting in TSDF-Guided Gaussian Splatting

LiftNav एक हाइब्रिड नेविगेशन फ्रेमवर्क है जो अज्ञात इनडोर वातावरणों में सुरक्षित, ऑब्जेक्ट-अवेयर पाथ प्लानिंग को सक्षम करने के लिए TSDF-गाइडेड गॉसियन स्प्लेटिंग को रियल-टाइम सिमेंटिक लिफ्टिंग और B-स्प्लाइन ऑप्टिमाइज़ेशन के साथ एकीकृत करता है, जो रेडिएंस फील्ड बेसलाइन्स की तुलना में 100% व्यवहार्यता दर और छोटे प्रक्षेप पथ (ट्रैजेक्टरीज) के साथ बेहतर प्रदर्शन करता है।

Hannah Schieber, Dominik Frischmann, Victor Schaack, Angela P. Schoellig, Daniel Roth2026-06-01