💻 computer science

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

यह शोध पत्र इस धारणा को चुनौती देता है कि विजन-लैंग्वेज-एक्शन (VLA) मॉडलों में पैरामीटर रेडंडेंसी (parameter redundancy) समान होती है, और VLM-से-VLA अनुकूलन के दौरान संरचित विचलन पैटर्न (structured divergence patterns) को प्रकट करते हुए एक नवीन मल्टी-मॉड्यूल जॉइंट प्रूनिंग रणनीति प्रस्तुत करता है जो बिना किसी पोस्ट-प्रूनिंग रिकवरी की आवश्यकता के मूल प्रदर्शन का 90% बनाए रखते हुए महत्वपूर्ण पैरामीटर कमी (12%–30%) प्राप्त करता है।

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu2026-07-01
💻 computer science

Robust Autonomous UAV Landing on Maritime Platforms via Multimodal Agentic AI and Active Wave Compensation

यह शोध पत्र एक डिकपल्ड (decoupled), मल्टी-व्हीकल लैंडिंग फ्रेमवर्क प्रस्तावित करता है जो उच्च-सटीकता वाले समुद्री सिमुलेशन में लहरों के प्रभाव को कम करते हुए 100% सफलता दर के साथ मजबूत, वेव-कंपनसेटेड (wave-compensated) स्वायत्त लैंडिंग प्राप्त करने के लिए ड्यूल डीप रिइन्फोर्समेंट लर्निंग एजेंटों का उपयोग करके एक USV-माउंटेड 3-RPU स्टेबलाइज्ड प्लेटफॉर्म को एक UAV के साथ सिंक्रोनाइज़ करता है।

Francisco S. Neves, Pedro N. Pereira, Raul D. S. G. Campilho, Andry M. Pinto2026-07-01
💻 computer science

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

यह शोध पत्र HABIT को प्रस्तुत करता है, जो 10,000 से अधिक मानव-उपस्थित रोबोट हेरफेर प्रकरणों (episodes) का एक बड़े पैमाने का डेटासेट है जिसे सहयोगी (Collaborator), सहकर्मी (Coworker), और पर्यवेक्षक (Supervisor) भूमिकाओं में व्यवस्थित किया गया है, जो नीतियों को सिंक्रोनाइज़ेशन (synchronization), रास्ता देना (yielding), और जेस्चर ग्राउंडिंग (gesture grounding) जैसे आवश्यक मानव-जागरूक व्यवहार सीखने में सक्षम बनाता है जो पारंपरिक मानव-अनुपस्थित डेटासेट्स में अनुपस्थित होते हैं।

Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee2026-07-01
💻 computer science

Autonomous UAV Navigation for Individual Wildlife Re-Identification

यह शोध पत्र एक स्वायत्त यूएवी (UAV) नेविगेशन प्रणाली प्रस्तुत करता है जो व्यक्तिगत वन्यजीव पुन: पहचान के लिए इमेज कैप्चर को सक्रिय रूप से अनुकूलित करने हेतु YOLOv11 डिटेक्शन और DINOv2-आधारित पोज़ वर्गीकरण को एकीकृत करता है, जिससे स्केलेबल पारिस्थितिक निगरानी में सहायता के लिए जेब्रा, जिराफ, बाघ और हाथी जैसे पैटर्न वाले प्रजातियों के उच्च-गुणवत्ता वाले पार्श्व दृश्यों (lateral views) को सुनिश्चित किया जा सके।

Claire Sun, Tanya Berger-Wolf, Jenna Kline2026-07-01
🤖 AI

Bridging Local Observation and Global Simulation in Closed-Loop Traffic Modeling

यह शोध पत्र CRAFT का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो स्व-पर्यवेक्षित विफलता खोज (self-supervised failure discovery) का उपयोग करके एक 'कॉन्टेक्स्टुअल प्रेफरेंस इवैल्यूएटर' को प्रशिक्षित करता है, जो ऑटोरेग्रेसिव ट्रैफिक सिमुलेटर्स में स्थानीय-से-वैश्विक संदर्भ बेमेल (local-to-global context mismatch) को कम करता है और टेस्ट-टाइम डिकोडिंग को वैश्विक रूप से सुसंगत व्यवहारों की ओर निर्देशित करता है, जिससे बेस मॉडल को पुन: प्रशिक्षित किए बिना टकराव और यातायात नियमों के उल्लंघन को काफी हद तक कम किया जा सकता है।

Ziyan Wang, Tan Xiang, Peng Chen, Xintao Yan2026-07-01
🤖 AI

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1 एक सुदृढीकरण शिक्षण (reinforcement learning) पोस्ट-ट्रेनिंग फ्रेमवर्क है जो सार्वजनिक रूप से उपलब्ध RoboCasa प्रदर्शनों पर ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) का लाभ उठाकर, बिना किसी अतिरिक्त निजी डेटा की आवश्यकता के, फ्लो-आधारित विजन-लैंग्वेज-एक्शन मॉडल्स के प्रदर्शन और सफलता दरों को महत्वपूर्ण रूप से बढ़ाता है।

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li2026-07-01
💻 computer science

Adapting Generalist Robot Policies with Semantic Reinforcement Learning

यह शोध पत्र सिमेंटिक एक्शन रीइन्फोर्समेंट लर्निंग (SARL) का प्रस्ताव करता है, जो एक ऐसी विधि है जो रॉ एक्शन्स के बजाय लैंग्वेज प्रॉम्प्ट्स को अनुकूलित करने के लिए रीइन्फोर्समेंट लर्निंग का उपयोग करके जनरलिटिस्ट रोबोट पॉलिसियों को बेहतर बनाती है, जिससे उन जटिल, लॉन्ग-होरिज़न कार्यों को हल करने के लिए प्री-ट्रेन्ड स्किल्स को कुशलतापूर्वक संयोजित किया जा सकता है जो पॉलिसी की ज़ीरो-शॉट क्षमताओं से बाहर हैं।

Jagdeep Singh Bhatia, Andrew Wagenmaker, William Chen, Sergey Levine2026-07-01
💻 computer science

OopsieVerse: A Safety Benchmark with Damage-Aware Simulation for Robot Manipulation

यह शोध पत्र OOPSIEVERSE को प्रस्तुत करता है, जो एक एकीकृत सिमुलेशन फ्रेमवर्क और बेंचमार्क है जो भौतिक क्षति का पता लगाने और उसे मापने के लिए एक भौतिक रूप से आधारित, सिम्युलेटर-अज्ञेय (simulator-agnostic) तंत्र प्रदान करके क्षति-जागरूक रोबोट हेरफेर (robot manipulation) को सक्षम बनाता है, जिससे घरेलू रोबोटों के सुरक्षित प्रशिक्षण, मूल्यांकन और परिनियोजन की सुविधा मिलती है।

Arnav Balaji, Arpit Bahety, Sriniket Ambatipudi, Daniel Lam, Junhong Xu, Roberto Martín-Martín2026-07-01
🤖 machine learning

Freeform Preference Learning for Robotic Manipulation

यह शोध पत्र फ्रीफॉर्म प्रेफरेंस लर्निंग (FPL) को प्रस्तुत करता है, जो एक ऐसी विधि है जो रोबोटिक मैनिपुलेशन पॉलिसियों को बाइनरी तुलनाओं के बजाय प्राकृतिक-भाषा वरीयता अक्षों (natural-language preference axes) से सीखने में सक्षम बनाती है, जिसके परिणामस्वरूप प्रदर्शन में महत्वपूर्ण सुधार, सघन प्रगति संकेत (dense progress signals), और बिना पुन: प्रशिक्षण के परीक्षण के समय व्यवहार को नियंत्रित करने की क्षमता प्राप्त होती है।

Marcel Torne, Anubha Mahajan, Abhijnya Bhat, Chelsea Finn2026-07-01
💻 computer science

RetrDex: Efficient Object Retrieval in Cluttered Scenes with a Dexterous Hand

RetrDex एक कुशल फ्रेमवर्क है जो बड़े पैमाने पर समानांतर सुदृढीकरण लर्निंग (reinforcement learning) और एक स्थानिक रूप से जागरूक प्रतिनिधित्व (spatially aware representation) का लाभ उठाता है ताकि दक्ष रोबोटों को विविध हेरफेर कौशल के माध्यम से अवरोधों को सक्रिय रूप से हटाने में सक्षम बनाया जा सके, जिससे अव्यवस्थित दृश्यों में वस्तुओं की सुदृढ़ प्राप्ति प्राप्त होती है और वास्तविक दुनिया के सिस्टम में सफल ज़ीरो-शॉट ट्रांसफर सुनिश्चित होता है।

Fengshuo Bai, Yu Li, Jie Chu, Tawei Chou, Runchuan Zhu, Ying Wen, Yaodong Yang, Yuanpei Chen2026-06-30