💻 computer science

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

यह शोध पत्र इस धारणा को चुनौती देता है कि रोबोट इमिटेशन लर्निंग के लिए सुव्यवस्थित विशेषज्ञ प्रदर्शन (expert demonstrations) इष्टतम होते हैं, क्योंकि यह प्रकट करता है कि वे महत्वपूर्ण संरेखण क्षणों (alignment moments) को अस्पष्ट कर देते हैं, और STAIR का प्रस्ताव करता है, जो एक स्थानिक-कालिक फीचर इंटरफेस (spatio-temporal feature interface) है जो मानक डेटा से सघन गति पर्यवेक्षण (dense motion supervision) को आसत (distill) करता है ताकि जानबूझकर धीमे किए गए प्रदर्शनों के तुलनीय प्रदर्शन प्राप्त किया जा सके।

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen2026-06-16
⚡ electrical engineering

Pixels to Proofs: Probabilistically-Safe Latent World Model Control via Parallel Conformal Robust MPC

यह शोध पत्र SLS² को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो संभाव्यता-आधारित सुरक्षा गारंटी के साथ सुरक्षित, विज़न-आधारित मोशन प्लानिंग को सक्षम करने के लिए एक्शन-कंडीशन्ड लेटेंट वर्ल्ड मॉडल्स को कॉन्फॉर्मल प्रेडिक्शन-एन्हांस्ड रोबस्ट मॉडल प्रिडिक्टिव कंट्रोल के साथ जोड़ता है।

Devesh Nath, Anutam Srinivasan, Haoran Yin, Ruitong Jiang, Jeffrey Fang, Glen Chou2026-06-16
🤖 AI

Retrieve, Don't Retrain: Extending Vision Language Action Models to New Tasks at Test Time

यह शोध पत्र एक रिट्रीवल-ऑगमेंटेड (retrieval-augmented) दृष्टिकोण का प्रस्ताव करता है जो एक सस्ते एम्बॉडमेंट (embodiment) से प्रदर्शन (demonstrations) को इंडेक्स करके टेस्ट के समय फ्रोजन विजन-लैंग्वेज-एक्शन मॉडल्स को नए कार्यों तक विस्तारित करता है, जिससे अनसीन टास्क और एम्बॉडमेंट्स पर बेहतर प्रदर्शन प्राप्त करते हुए प्रति-कार्य फाइन-ट्यूनिंग की आवश्यकता समाप्त हो जाती है।

Jeongeun Park, Juhan Park, Taekyung Kim, Sungjoon Choi, Dongyoon Han, Sangdoo Yun2026-06-16
💻 computer science

Learning New Tasks via Reusable Skills: Skill-Compositional Experts for Embodied Continual Learning

यह शोध पत्र SCE, एक स्किल-कंपोजिशनल एक्सपर्ट्स फ्रेमवर्क का प्रस्ताव करता है जो कंपोजिशनल स्किल ग्राउंडिंग के माध्यम से कार्यों को पुन: प्रयोज्य कौशलों में विघटित करके और ड्यूल एक्जीक्यूशन-एंड-ट्रांजिशन एक्सपर्ट्स के माध्यम से उनके निष्पादन और संक्रमणों को समन्वित करके एम्बोडीड कॉन्टिनुअल लर्निंग में कैटास्ट्रोफिक फॉरगेटिंग को कम करता है।

Shuaike Zhang, Shaokun Wang, Haoyu Tang, Jianlong Wu, Liqiang Nie2026-06-16
💬 NLP

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

यह शोध पत्र बहुभाषी भाषा बैकबोन के बावजूद गैर-अंग्रेजी निर्देशों को संसाधित करते समय विजन-लैंग्वेज-एक्शन मॉडलों में एक महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करने वाला पहला व्यवस्थित अध्ययन प्रस्तुत करता है, और इस समस्या को प्रभावी ढंग से कम करने के लिए एक मल्टीलिंगुअल प्रिंसिपल कंपोनेंट एलाइनमेंट फाइन-ट्यूनिंग रणनीति का प्रस्ताव करता है।

Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan2026-06-16
🤖 machine learning

LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors

LoComposition एक लर्निंग-आधारित फ्रेमवर्क पेश करता है जो टास्क स्पेसिफिकेशन, ऑपरेशनल लिमिट्स, गेट प्रेफरेंस और टेरेन अडैप्टेशन को अलग-अलग मैकेनिज्म में विभाजित करता है, जिससे भौतिक रोबोट्स के लिए ज़ीरो-शॉट ट्रांसफर सक्षम होता है और पारंपरिक कॉम्प्लेक्स-रिवॉर्ड बेसलाइन्स की तुलना में ऊर्जा दक्षता में उल्लेखनीय सुधार और बाधा उल्लंघन (कन्स्ट्रेंट वायलेशन) में कमी आती है।

Loukas Kordos, Leonard T. Franz, Simon Rappenecker, Oliver Hausdoerfer, Angela P. Schoellig, Pavel Kolev, Georg Martius2026-06-16
⚡ electrical engineering

A Smart-Scheduled Hybrid (SSH) EKF-FGO State Estimation

यह शोध पत्र एक स्मार्ट-शेड्यूल्ड हाइब्रिड (SSH) EKF-FGO ढांचे के भीतर अनुकूलन शेड्यूलिंग (optimization scheduling) को एक महत्वपूर्ण, स्वतंत्र डिज़ाइन चर के रूप में प्रयोगात्मक रूप से अभिलक्षित करता है, जो यह प्रदर्शित करता है कि बैच अनुकूलन (batch optimization) के समय को रणनीतिक रूप से निर्धारित करना अवस्था अनुमान (state estimation) में वैश्विक निरंतरता के अधिकांश लाभों को बनाए रखते हुए कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम कर सकता है।

Eric Levi, Soosan Beheshti2026-06-16
💻 computer science

Scaling Short-Term Memory of Visuomotor Policies for Long-Horizon Tasks

यह शोध पत्र PRISM को प्रस्तुत करता है, जो गेटेड अटेंशन (gated attention) और पदानुक्रमित संपीड़न (hierarchical compression) वाला एक ट्रांसफॉर्मर-आधारित आर्किटेक्चर है जो लंबी अवधि के कार्यों के लिए विज़ुओमोटर पॉलिसियों (visuomotor policies) में अल्पकालिक स्मृति को प्रभावी ढंग से स्केल करता है, साथ ही व्यवस्थित मूल्यांकन के लिए ReMemBench बेंचमार्क भी प्रदान करता है, जो बड़े पैमाने पर प्रीट्रेनिंग पर निर्भर हुए बिना मौजूदा बेसलाइनों की तुलना में महत्वपूर्ण प्रदर्शन सुधार प्राप्त करता है।

Rutav Shah, Rajat Kumar Jenamani, Xiaohan Zhang, Lingfeng Sun, Roberto Martín-Martín, Yuke Zhu, Deva Ramanan, Karl Schme (…)2026-06-16
🤖 AI

EgoPhys: Learning Generalizable Physics Models of Deformable Objects from Egocentric Video

EgoPhys एक ऐसा फ्रेमवर्क है जो एकल-दृश्य (single-view) एगोसेंट्रिक RGB वीडियो से नियंत्रणीय विरूपणीय (deformable) डिजिटल ट्विन्स बनाने के लिए सामान्यीकरण योग्य भौतिकी मॉडल सीखता है, जो जटिल गतिकी (dynamics) के शून्य-शॉट (zero-shot) पूर्वानुमान को सक्षम बनाता है और प्रति-वस्तु अनुकूलन (per-object optimization) के बिना वास्तविक-विश्व रोबोटिक योजना की सुविधा प्रदान करता है।

Hyunjin Kim, Ri-Zhao Qiu, Guangqi Jiang, Xiaolong Wang2026-06-16
💻 computer science

ATHENA: Accelerated Multi-Task Heterogeneous Influence Functions for Robot Data Curation

यह शोध पत्र ATHENA का प्रस्ताव करता है, जो एक स्केलेबल इन्फ्लुएंस फंक्शन फ्रेमवर्क है जो क्रोनेकर संरचनाओं (Kronecker structures) और रैंक-r सन्निकटन (rank-r approximations) का लाभ उठाकर बिलियन-पैरामीटर मल्टीटास्क विजन-लैंग्वेज-एक्शन मॉडल्स के लिए डेटा क्यूरेशन को त्वरित करता है, जिससे काफी कम प्रदर्शनों (demonstrations) के साथ पूर्ण-डेटा प्रदर्शन से मेल खाते हुए महत्वपूर्ण गति प्राप्त होती है।

Tao Xu, Jiaxin Wang, Runhao Zhang, Jiayi Guan, Xianchao Zeng, Weixi Song, Xinyu Zhou, Zhetao Chen, Guang Chen, Yong-Lu L (…)2026-06-16