💻 computer science

Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving

यह शोध पत्र एक आउटकम-गाइडेड डिस्टिलेशन फ्रेमवर्क प्रस्तावित करता है जो ग्राउंड-ट्रुथ सुपरविजन के माध्यम से विजन-लैंग्वेज मॉडल की तर्क क्षमता को परिष्कृत करने के लिए टीचर-स्टूडेंट आर्किटेक्चर का लाभ उठाता है, जो एंड-टू-एंड ऑटोनॉमस ड्राइविंग सिस्टम में ज़ीरो-शॉट जनरलाइजेशन, व्याख्यात्मकता और वेपॉइंट सटीकता को महत्वपूर्ण रूप से बढ़ाता है।

Zeyu Dong, Yimin Zhu, Yu Wu, Yu Sun2026-08-03
🤖 AI

ActFovea: Runtime Safeguarding for VLA Policies via Spatiotemporal Visual-Action Consistency

ActFovea एक प्लग-एंड-प्ले रनटाइम सेफगार्डिंग फ्रेमवर्क है जो विजुअल ओवरले और एक्शन ड्रिफ्ट जैसे व्यवधानों के विरुद्ध विजन-लैंग्वेज-एक्शन (VLA) पॉलिसियों की मजबूती को बढ़ाता है, जो अंतर्निहित पॉलिसी को संशोधित किए बिना विफलताओं का पता लगाने और रिकवरी या सेफ-स्टॉप तंत्र को ट्रिगर करने के लिए स्थानिक-काल्पनिक (spatiotemporal) विजुअल-एक्शन निरंतरता को लागू करता है।

Wenda Yu, Tianshi Wang, Fengling Li, Xin Li, Jingjing Li, Lei Zhu2026-08-03
🤖 AI

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

यह शोध पत्र CLIFT को प्रस्तुत करता है, जो एक गैर-आक्रामक क्लोज्ड-लूप इटरेटिव फाइन-ट्यूनिंग विधि है जो क्लोज्ड-वेट फाउंडेशन मॉडल्स (जैसे Gemini Robotics On-Device) का उपयोग करने वाले ह्यूमनॉइड रोबॉट्स को, डिप्लॉयमेंट-टाइम रिवॉर्ड फीडबैक को API-आधारित पॉलिसी इम्प्रूवमेंट के लिए सुपरवाइज्ड डेटा में बदलकर, कार्य में लगभग पूर्ण महारत हासिल करने में सक्षम बनाती है, जिससे मॉडल के इंटरनल्स तक पहुंच की आवश्यकता के बिना शुद्ध इमिटेशन लर्निंग की सीमाओं को दूर किया जा सके।

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Th (…)2026-08-03
⚡ electrical engineering

MROPE: A Multi-Robot Safe Cooperative Strategy via combined Predictive Safety Filters and Ellipse-based Constraint Compression

यह शोध पत्र MROPE का प्रस्ताव करता है, जो एक पदानुक्रमित बहु-रोबोट रणनीति है जो गतिशील दीर्घवृत्त-आधारित बाधा संपीड़न (ellipse-based obstacle compression) और वितरित भविष्य कहनेवाला सुरक्षा फिल्टर (distributed predictive safety filters) के माध्यम से सहयोगात्मक निगरानी को स्थानीय सुरक्षा से अलग करके, अव्यवस्थित वातावरण में सुरक्षित और स्केलेबल ड्रोन झुंड ट्रैकिंग सुनिश्चित करता है।

Alice Rosetti, Lorenzo Pichierri, Domenico Cappello, Fabrizio Schiano, Giuseppe Notarstefano2026-08-03
💻 computer science

CorrelationFlow: A Training-Free Geometric Approach for LiDAR Scene Flow Estimation

CorrelationFlow एक नवीन, प्रशिक्षण-मुक्त ज्यामितीय ढांचे को पेश करता है जो LiDAR सीन फ्लो अनुमान के लिए स्व-पर्यवेक्षित (self-supervised) डीप लर्निंग के प्रचलित मोनोकल्चर को कनेक्टेड-कंपोनेंट लेबलिंग और कोरिलेशन मैक्सिमाइजेशन जैसे शास्त्रीय कंप्यूटर विज़न ऑपरेशन्स से बदल देता है, जो मौजूदा धारणाओं को बढ़ाने के बजाय समस्या पर मौलिक रूप से प्रश्न उठाने और उसे पुनर्गठित करने के माध्यम से Argoverse 2 2026 चैलेंज पर मजबूत प्रदर्शन और सुgraceful डिग्रेडेशन प्राप्त करता है।

Minh-Quan Dao, Yancong Lin, Julie Stephany Berrio Perez, Holger Caesar2026-08-03
💻 computer science

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

यह शोध पत्र SAGP को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) ग्रैस्प प्लानिंग फ्रेमवर्क है जो PCA और DBSCAN के माध्यम से वस्तुओं को मोटे स्थानिक क्षेत्रों (coarse spatial zones) में विभाजित करके उच्च-स्तरीय सिमेंटिक रीजनिंग और ज्यामितीय नियोजन (geometric planning) के बीच एक सेतु बनाता है, जिससे एक पूर्व-प्रशिक्षित विजन-लैंग्वेज मॉडल को सूक्ष्म-स्तर के भाग विभाजन (fine-grained part segmentation) की आवश्यकता के बिना कार्यात्मक रूप से उपयुक्त ग्रैस्प्स के चयन में मार्गदर्शन करने में सक्षम बनाया जा सके।

Muhayy Ud Din, Irfan Hussain2026-08-03
💻 computer science

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

TransGraspNet एक नवीन फ्रेमवर्क है जो सीमा (boundary), सतह (surface) और भौतिकी (physics) की निरंतरता के माध्यम से धारणा (perception) और निष्पादन (execution) को एकीकृत करके पारदर्शी तरल से भरे कांच के बर्तनों के भौतिक और ज्यामितीय रूप से सुसंगत रोबोटिक हेरफेर को सुनिश्चित करता है, जिससे वास्तविक दुनिया के परिदृश्यों में उच्च सफलता दर और शून्य रिसाव प्राप्त होता है।

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou2026-08-03
💬 NLP

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

यह शोध पत्र वर्ल्ड क्रिटिक मॉडल (WCM) प्रस्तुत करता है, जो विजन-लैंग्वेज-एक्शन सुदृढीकरण शिक्षण (reinforcement learning) के लिए एक नवीन दृष्टिकोण है जो भविष्य के लेटेंट स्टेट्स (latent states) की संयुक्त रूप से भविष्यवाणी करने और मूल्यों का अनुमान लगाने के लिए एक हल्के LeJEPA आर्किटेक्चर का लाभ उठाता है, जिससे सिंगल-फ्रेम क्रिटिक्स की सीमाओं को दूर करते हुए विविध रोबोटिक मैनिपुलेशन कार्यों में अत्याधुनिक प्रदर्शन और सामान्यीकरण प्राप्त किया जा सके।

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu2026-08-03
💻 computer science

Bootstrapping Self-Supervised Learning of Binary Classification Using Error Bounds: A Case Study on a Robotic Insertion Task

यह शोधपत्र रोबोटिक इंसर्शन कार्यों के लिए एक स्व-पर्यवेक्षित (self-supervised) डेटा इंजन प्रस्तुत करता है जो त्रुटि दरों को नियंत्रित करने और समय के साथ सत्यापन आवश्यकताओं को धीरे-धीरे कम करने के लिए विल्सन-स्कोर (Wilson-Score) कॉन्फिडेंस बाउंड्स का उपयोग करते हुए, तेज़ मॉडल भविष्यवाणियों और महंगी सत्यापन प्रक्रियाओं के बीच गतिशील रूप से संतुलन बनाता है।

Zebin Duan, Norbert Krüger, Juan Heredia, Thorbjørn Mosekjær Iversen, Frederik Hagelskjær2026-08-03
💻 computer science

Towards Safer Robot-Assisted Surgery: A Markerless Augmented Reality Framework

यह शोध पत्र एक मार्करलेस ऑगमेंटेड रियलिटी फ्रेमवर्क प्रस्तावित करता है जो सर्जिकल उपकरणों और रक्त वाहिकाओं के बीच न्यूनतम दूरी का पता लगाने के लिए उन्नत स्टीरियो पुनर्निर्माण और सेगमेंटेशन को एकीकृत करता है, जिससे सर्जन पर अतिरिक्त भार डाले बिना टकराव को रोककर रोबोट-असिस्टेड सर्जरी के दौरान सुरक्षा को बढ़ाया जा सकता है।

Ziyang Chen, Laura Cruciani, Ke Fan, Matteo Fontana, Elena Lievore, Ottavio De Cobelli, Gennaro Musi, Giancarlo Ferrigno (…)2026-07-31