🤖 machine learning

Characterizing Replay Retention Under Dynamics Shift in Model-Based Reinforcement Learning

यह शोधपत्र डायनेमिक्स शिफ्ट (dynamics shifts) के तहत निरंतर मॉडल-आधारित सुदृढीकरण लर्निंग (continual model-based reinforcement learning) में रिप्ले रिटेंशन (replay retention) को कैसे अनुकूलित किया जाए, इस पर अन्वेषण करता है, जो परिवर्तन की परिमाण (change magnitude) और ट्रांज़िशन की आयु (transition age) के बीच के संतुलन को स्पष्ट करते हुए यह प्रदर्शित करता है कि एक एस्टिमेटर (estimator) इस आधार पर पुराने डेटा को रखने या हटाने का प्रभावी ढंग से मार्गदर्शन कर सकता है कि डायनेमिक्स में परिवर्तन स्थायी हैं या आवर्ती।

Everest Yang, Skye Thompson, George D. Konidaris2026-09-17
💻 computer science

Approximating High Dimensional Self-Motion Manifolds via Deep Generative Models

यह शोध पत्र रेडंडेंट मैनिपुलेटर्स के उच्च-आयामी सेल्फ-मोशन मैनिफोल्ड्स को अनुमानित करने के लिए डीप जेनरेटिव मॉडल्स का उपयोग करते हुए एक डाइमेंशन-इंडिपेंडेंट प्रोबेबिलिस्टिक फ्रेमवर्क प्रस्तावित करता है, जो सफलतापूर्वक उन जटिल 4-डी समाधान सेट्स को रिकवर करता है जहाँ मौजूदा कर्व-आधारित विधियाँ विफल हो जाती हैं।

Haitao Gao, Yang Song, Liao Wu2026-09-17
💻 computer science

TacBPM: A Tactile-conditioned Behavior Prior Model for Dexterous Reorientation

यह शोध पत्र TacBPM को प्रस्तुत करता है, जो एक स्पर्श-सशर्त व्यवहार पूर्व मॉडल (tactile-conditioned behavior prior model) है जो जटिल डेक्सट्रस इन-हैंड ओरिएंटेशन और आर्म-हैंड मैनिपुलेशन कार्यों के लिए प्रशिक्षण को त्वरित करने और स्थिर, सफल सिम-टू-रियल ट्रांसफर को सक्षम करने हेतु मल्टी-स्केल स्फीयर स्पेशलिस्ट्स को एक लेटेंट कंट्रोलर में संकुचित (distill) करता है।

Jie Yin, Wanli Xing, Zeyuan Zhao, Xuezhou Zhu, Zhijie Deng, Kaifeng Zhang2026-09-17
💻 computer science

WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors

यह शोध पत्र WholeBodyWAM को प्रस्तुत करता है, जो एक ह्यूमनॉइड वर्ल्ड-एक्शन मॉडल है जो एक बड़े पैमाने के, विषम मोशन कॉर्पस (UniMotion-4K) का लाभ उठाकर एक हस्तांतरणीय मोशन प्रायर को प्रीट्रेन करता है, जो असिमेट्रिक मिक्सचर-ऑफ-ट्रांसफॉर्मर्स अटेंशन के माध्यम से वीडियो और एक्शन एक्सपर्ट्स के साथ एकीकृत होने पर डेटा दक्षता और डाउनस्ट्रीम मैनिपुलेशन प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Z (…)2026-09-17
🤖 machine learning

Reinforcement Learning for Real-Time Vision-Language-Action Policies

यह शोध पत्र Real-Time EXPO-FT को प्रस्तुत करता है, जो एक सुदृढीकरण अधिगम (reinforcement learning) ढांचा है जो धीमी, अभिव्यंजक क्रिया पीढ़ी (expressive action generation) को तेज़, प्रतिक्रियाशील क्रिया संपादन (reactive action editing) से अलग करता है ताकि इन्फरेंस विलंबता (inference latency) के बावजूद वास्तविक दुनिया की गतिशीलता के लिए बड़े विज़न-लैंग्वेज-एक्शन मॉडलों का नमूना-कुशल (sample-efficient), उच्च-प्रदर्शन अनुकूलन सक्षम किया जा सके।

Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn2026-09-17
💻 computer science

CANTABILE: Learning Expressive Dynamics for Robotic Piano Performance

यह शोध पत्र CANTABILE को पेश करता है, जो रोबोटिक पियानो प्रदर्शन के लिए एक डायनेमिक्स-अवेयर फ्रेमवर्क है जो स्कोर-टू-कॉन्टैक्ट लूप को बंद करके, वेलोसिटी-फिडेलिटी के साथ ऑनसेट-कवरेज रिवार्ड्स को जोड़कर, और फिंगर-ओनली रेसिडुअल्स के साथ पॉलिसियों को परिष्कृत करके अभिव्यंजक सटीकता में महत्वपूर्ण सुधार करता है, जिससे EXPRESSIVE-51 बेंचमार्क पर पिच, ऑनसेट और इंटेंसिटी मेट्रिक्स पर पर्याप्त लाभ प्राप्त होता है।

Woosik Kim, Wonhyeok Choi, Sunghoon Im2026-09-17
💬 NLP

M2{M}^2Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models

यह शोध पत्र M2\mathcal{M}^2Tok का प्रस्ताव करता है, जो एक नवीन मल्टी-हेड मल्टी-कोडबुक एक्शन टोकेनाइज़र है जो सूक्ष्म-स्तरीय एक्शन डायनेमिक्स को बेहतर ढंग से पकड़ने के लिए स्वतंत्र कोडबुक्स के साथ विशिष्ट हेड्स में लेटेंट फीचर्स को विभाजित करके पुनर्निर्माण त्रुटि (reconstruction error) को महत्वपूर्ण रूप से कम करता है और विजन-लैंग्वेज-एक्शन मॉडल के प्रदर्शन को बढ़ाता है।

Chunpu Xu, Zhixuan Liang, Yuhao Zhang, Chi-Min Chan, Jessie Wang, Yang Xiao, Mengkang Hu, Xiaokang Yang, Yao Mu2026-09-17
⚡ electrical engineering

Indicators of resilience for autonomous control systems

यह शोध पत्र स्वायत्त नियंत्रण प्रणालियों के लिए 'क्रिटिकल स्लोइंग डाउन' (critical slowing down) पर आधारित जेनेरिक लचीलापन संकेतकों (resilience indicators) को व्यवस्थित रूप से डिजाइन करने की एक विधि प्रस्तावित करता है, जो सिमुलेशन और वास्तविक क्वाड्रोटर प्रयोगों के माध्यम से यह प्रदर्शित करता है कि ये संकेतक विनाशकारी विफलता होने से पहले क्रमिक क्षरण के कारण होने वाली आसन्न अस्थिरता की पूर्व चेतावनी प्रदान कर सकते हैं।

Jasper van Beers, Da-Hwi Kim, Prashant Solanki, Coen de Visser2026-09-17
💻 computer science

RAFAIL: Relationship-Aware Failure Detection for Robotic Manipulation

RAFAIL एक नवीन ढांचा है जो पॉइंट-क्लाउड रिप्रजेंटेशन और रिलेशनशिप-विशिष्ट OOD डिटेक्टर्स का उपयोग करके संस्थाओं के बीच कार्य-प्रासंगिक संबंधों में विसंगतियों की पहचान करके रोबोटिक मैनिपुलेशन विफलताओं का पता लगाता है, जो बिना किसी विफलता डेटा या रनटाइम VLM इन्फरेंस की आवश्यकता के उच्च सटीकता प्राप्त करता है।

Loris Schneider, Edgar Welte, Rania Rayyes2026-09-17
💻 computer science

GraphPoint: Semantic Entity Graphs and Point Trajectories for Compositional Robot Manipulation

यह शोधपत्र GraphPoint प्रस्तुत करता है, जो रोबोटिक हेरफेर में निर्देश-निर्भर सामान्यीकरण (instruction-dependent generalization) में सुधार के लिए अनुमानित ग्रिपर प्रक्षेप पथों (gripper trajectories) के माध्यम से सिमेंटिक एंटिटी ग्राफ को ज्यामितीय नियंत्रण से जोड़ता है, जिसे नए CoMani बेंचमार्क द्वारा मान्य किया गया है जो उप-कार्यों (subtasks) के बीच और उप-कार्यों के भीतर संरचनात्मक पुन: उपयोग (compositional reuse) का परीक्षण करने के लिए डिज़ाइन किया गया है।

Kang Luo, Hesheng Wang2026-09-17