💻 computer science

ActMVS: Active Scene Reconstruction with Monocular Multi-View Stereo

ActMVS मोनोक्यूलर एक्टिव सीन रिकंस्ट्रक्शन के लिए पहला फ्रेमवर्क है जो व्यू फैक्टर ग्राफ कंस्ट्रक्शन और ग्लोबल डेप्थ ऑप्टिमाइजेशन को एकीकृत करता है ताकि रोबोट और UAVs महंगे डेप्थ सेंसर पर निर्भर हुए बिना सुरक्षित ट्रेजेक्टरी प्लानिंग के लिए रीयल-टाइम में उच्च-गुणवत्ता वाले, ग्लोबली कंसिस्टेंट डेंस डेप्थ मैप्स जेनरेट कर सकें।

Guo Pu, Yixuan Han, Zhouhui Lian2026-06-02
💻 computer science

A Sonar-Visual Dataset for Cross-Modal Underwater Robot Perception

यह शोध पत्र SOVIS को प्रस्तुत करता है, जो पानी के नीचे के वातावरण से एकत्र किया गया एक बड़े पैमाने का सोनार-विजुअल युग्मित डेटासेट है, जिसके साथ एक एंड-टू-एंड प्रोसेसिंग पाइपलाइन और एनोटेशन टूल भी दिया गया है, ताकि क्रॉस-मोडल डेटा की कमी को दूर किया जा सके और मछली का पता लगाने जैसे पानी के नीचे के धारणा कार्यों में महत्वपूर्ण सुधार प्रदर्शित किया जा सके।

Weitung Chen, Phil Tinn, Per Gunnar Auran, Martin Ludvigsen, Peter Halland Haro2026-06-02
💻 computer science

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

यह शोध पत्र LEGS प्रस्तुत करता है, जो एक हाइब्रिड सिम्युलेटर है जो 3D गॉसियन स्प्लेटिंग बैकग्राउंड्स को मेश फोरग्राउंड्स के साथ जोड़ता है ताकि स्केलेबल, टेलीऑपरेशन-मुक्त सिंथेटिक डेटा उत्पन्न किया जा सके जो विजन-लैंग्वेज-एक्शन पॉलिसियों को ह्यूमनॉइड लोको-मैनिपुलेशन कार्यों में मानव-प्रदर्शन-प्रशिक्षित बेसलाइन्स से बेहतर प्रदर्शन करने में सक्षम बनाता है।

Hojune Kim, Timothy Chen, Jiankai Sun, Lars W. Osterberg, Qianzhong Chen, Ke Wang, Mac Schwager2026-06-02
⚡ electrical engineering

Global Convergence of a Line-Search Filter Differential Dynamic Programming Method

यह शोधपत्र FilterDDP एल्गोरिदम के वैश्विक अभिसरण (global convergence) को स्थापित करता है, जो एक लाइन-सर्च फ़िल्टर विधि है जो गैररेखीय बाधाओं (nonlinear constraints) को संभालने के लिए डिस्क्रीट-टाइम डिफरेंशियल डायनेमिक प्रोग्रामिंग का विस्तार करती है, यह प्रदर्शित करते हुए कि इसकी बैकवर्ड-फॉरवर्ड ट्रायल पॉइंट गणना न्यूटन स्टेप के अनुरूप आवश्यक गुणों को संतुष्ट करती है।

Ming Xu, Iman Shames2026-06-02
⚡ electrical engineering

FlipItRight: Stable Pose-Targeted Throw-Flip Across Diverse Objects

यह शोध पत्र FlipItRight प्रस्तुत करता है, जो एक मॉडल-मुक्त ढांचा है जो विविध वस्तुओं के लिए स्थिर, पोज़-लक्षित थ्रो-फ्लिप कार्यों में 90% सफलता दर प्राप्त करता है, जो बिना किसी पूर्व डेटा या अंशांकन (कैलिब्रेशन) की आवश्यकता के मजबूती सुनिश्चित करने के लिए निरंतर एंड-इफेक्टर वेगों का उपयोग करते हुए समस्या को ऑब्जेक्ट-लेवल रिलीज़ स्टेट प्लानिंग और रोबोट-लेवल स्विंग मोशन निष्पादन में विभाजित करता है।

Axel Dawne, Shinkyu Park2026-06-02
💻 computer science

DisFlow: Scene Flow from Distance Field for Object Pose, Velocity Tracking, and Dynamic Object Reconstruction

DisFlow एक नवीन रियल-टाइम फ्रेमवर्क है जो डिस्टेंस फील्ड्स से सीन फ्लो का अनुमान लगाने के लिए गॉसियन प्रोसेस इमप्लिसिट सर्फेसेस का लाभ उठाता है, जिससे ऑब्जेक्ट फ्रेम में प्रोबेबिलिस्टिक फ्यूजन के माध्यम से समवर्ती 6DoF डायनेमिक ऑब्जेक्ट पोज़ एस्टीमेशन, मोशन ट्रैकिंग और उच्च-गुणवत्ता वाले सरफेस रिकंस्ट्रक्शन को सक्षम बनाया जा सके।

Lan Wu, Sheila Sutjipto, Jennifer Wakulicz, Teresa Vidal-Calleja2026-06-02
💻 computer science

Set-Supervised Diffusion Policy: Learning Action-Chunking Diffusion through Corrections

यह शोध पत्र सेट-सुपरवाइज्ड डिफ्यूजन पॉलिसी (SDP) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो डिफ्यूजन पॉलिसियों को प्रशिक्षित करने के लिए युग्मित मानव सुधारात्मक और रोबोट अवांछित एक्शन-चंक्स पर कंट्रास्टिव लर्निंग का लाभ उठाता है ताकि वे वितरण संबंधी बदलाव (डिस्ट्रीब्यूशनल शिफ्ट) और शोर वाले डेटा के प्रति अधिक सुदृढ़ हो सकें।

Zhaoting Li, Gang Chen, Javier Alonso-Mora, Cosimo Della Santina, Jens Kober2026-06-02
💻 computer science

RoboSemanticBench: Diagnosing Semantic Grounding in Action Prediction for VLA Models

यह शोध पत्र RoboSemanticBench प्रस्तुत करता है, जो एक एम्बॉडीड (embodied) बेंचमार्क है जो प्री-ट्रेन्ड बैकबोन की सिमेंटिक सक्षमता और विजन-लैंग्वेज-एक्शन मॉडल्स की एक्शन प्रेडिक्शन क्षमताओं के बीच एक महत्वपूर्ण अंतर को प्रकट करता है, क्योंकि कई पॉलिसियाँ सफल ग्रैस्पिंग (grasping) के बावजूद जटिल निर्देश सिमेंटिक्स के आधार पर भौतिक लक्ष्यों का सही चयन करने में विफल रहती हैं।

Bin Yu, Yao Zhang, Haishan Liu, Shijie Lian, Yuliang Wei, Xiaopeng Lin, Zhaolong Shen, Changti Wu, Ruina Hu, Bailing Wan (…)2026-06-02
💻 computer science

FATE-VLA:Failue-aware test generation for vision-language-action models

FATE-VLA विज़न-लैंग्वेज-एक्शन मॉडलों के मूल्यांकन में पारंपरिक स्थिर बेंचमार्क की सीमाओं को संबोधित करने के लिए मूल्यांकन को एक सक्रिय विफलता-खोज समस्या के रूप में पुनर्गठित करता है, जो पारंपरिक तरीकों की तुलना में काफी अधिक विफलताओं और विविध कमजोरी पैटर्न को उजागर करने के लिए विविधता-संचालित अन्वेषण और सरोगेट मॉडल का उपयोग करता है।

Arusa Kanwal, Pablo Valle, Shaukat Ali, Aitor Arrieta2026-06-02
💻 computer science

Intercepting the Future: Latent-Space Predictive World Model for Dynamic VLA Manipulation

यह शोध पत्र AHEAD को प्रस्तुत करता है, जो एक 'प्रिडिक्ट-देन-एक्ट' (predict-then-act) फ्रेमवर्क है जो फ्रोजन विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स को भविष्य के विजुअल टोकन्स का पूर्वानुमान लगाने के लिए एक लाइटवेट, मोशन-अवेयर लेटेंट वर्ल्ड मॉडल के साथ संवर्धित करता है, जिससे सिमुलेटेड और फिजिकल रोबोट्स दोनों पर सुदृढ़ डायनेमिक मैनिपुलेशन सक्षम होता है जहाँ मौजूदा बेसलाइन्स विफल हो जाते हैं।

Shahram Najam Syed, Arthur Jakobsson, Haoran Hao, Jeffrey Ichnowski2026-06-02