🤖 machine learning

Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance

यह शोध पत्र एक संचार-कुशल सुरक्षित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो नियंत्रण नीतियों के साथ अनुकूलन योग्य क्रियान्वयन समय (एक्चुएशन टाइमिंग) को सीखता है, जिसमें स्थिरता की गारंटी देने के लिए लाइपुनोव-आधारित बैकअप के साथ एक रन-टाइम आश्वासन परत का उपयोग किया गया है, जो विभिन्न रोबोटिक प्रणालियों में फिक्स्ड-रेट और एक्सपेक्टेशन-आधारित सुरक्षा विधियों से काफी बेहतर प्रदर्शन करता है।

Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming, Tristan Schuler2026-05-14
💻 computer science

Action Emergence from Streaming Intent

यह शोध पत्र "स्ट्रीमिंग इंटेंट" (Streaming Intent) प्रस्तुत करता है, जो एक नवीन एंड-टू-एंड स्वायत्त ड्राइविंग फ्रेमवर्क है जो एक चेन-ऑफ-थॉट मैकेनिज्म के माध्यम से सिमेंटिकली स्ट्रीम किए गए इंटेंट को कॉज़ली (causally) व्युत्पन्न करके एक्शन इमर्जेंस को सक्षम बनाता है ताकि एक फ्लो-मैचिंग एक्शन जनरेटर को निर्देशित किया जा सके, जिससे वेमो (Waymo) बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन और अभूतपूर्व इंटेंट-फेथफुल कंट्रोलेबिलिटी प्राप्त होती है।

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Xie Yan, Benjin Zhu2026-05-14
💻 computer science

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1 एक एकीकृत स्ट्रीमिंग विजन-लैंग्वेज-एक्शन आर्किटेक्चर पेश करता है जो स्वायत्त ड्राइविंग के लिए एक साझा बैकबोन और मेमोरी चैनल के माध्यम से ऑटोरेग्रेसिव लैंग्वेज रीजनिंग को फ्लो-मैचिंग कंटीन्यूअस एक्शन जनरेशन के साथ एकीकृत करता है, जिससे भाषा-निर्देशित प्रक्षेपवक्र नियंत्रण (ट्रैजेक्टरी कंट्रोल) सक्षम होता है जो वास्तविक समय की थ्रूपुट बनाए रखते हुए WOD-E2E बेंचमार्क पर मानव प्रदर्शन से बेहतर प्रदर्शन करता है।

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li2026-05-14
💻 computer science

Driving Intents Amplify Planning-Oriented Reinforcement Learning

यह शोध पत्र DIAL को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा (framework) है जो निरंतर-एक्शन ड्राइविंग नीतियों में मोड कोलैप्स (mode collapse) को दूर करने के लिए इंटेंट-कंडीशन्ड फ्लो मैचिंग को मल्टी-इंटेंट प्रेफरेंस RL के साथ जोड़ता है, जिससे वे प्रदर्शन में पूर्ववर्ती स्टेट-ऑफ-द-आर्ट मॉडल्स और मानव-संचालित प्रदर्शनों (human-driven demonstrations) दोनों को पछाड़ने में सक्षम होते हैं।

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu2026-05-14
💻 computer science

Multistep Belief Space Dynamics Learning For Risk-Aware Control

यह शोध पत्र वितरण संबंधी गतिशीलता (distributional dynamics) की भविष्यवाणी करने के लिए एक लर्निंग फ्रेमवर्क प्रस्तुत करता है जो वास्तविक समय में, जोखिम-जागरूक मॉडल प्रेडिक्टिव कंट्रोल (Model Predictive Control) को सक्षम बनाता है, जिसे कठोर एब्लेशन अध्ययनों और चुनौतीपूर्ण ऑफ-रोड इलाके में नेविगेट करने वाले पूर्ण आकार के वाहन पर सफल तैनाती के माध्यम से मान्य किया गया है।

Jason Gibson, Bogdan Vlahov, Patrick Spieler, Evangelos A. Theodorou2026-05-14
💻 computer science

COSMIC: Concurrent Optimization of Structure, Material, and Integrated Control for robotic systems

यह शोध पत्र COSMIC को प्रस्तुत करता है, जो एक ग्रेडिएंट-आधारित सह-डिज़ाइन ढांचा है जो एक डिफरेंशिएबल सिम्युलेटर के भीतर ट्रस-लैटिस रोबोट की टोपोलॉजी, सामग्री वितरण और नियंत्रण नीति को एक साथ अनुकूलित करता है, जो पारंपरिक पृथक डिज़ाइन दृष्टिकोणों की तुलना में बेहतर प्रदर्शन और डिज़ाइन अंतर्दृष्टि प्रदर्शित करता है।

Qinsong Guo, Liwei Wang2026-05-14
💻 computer science

3D RL-DWA: A Hybrid Reinforcement Learning and Dynamic Window Approach for Goal-Directed Local Navigation in Multi-DoF Robots

यह शोध पत्र एक नवीन हाइब्रिड फ्रेमवर्क प्रस्तुत करता है जो सुदृढीकरण लर्निंग (Reinforcement Learning) और डायनेमिक विंडो अप्रोच (Dynamic Window Approach) को संयोजित करता है ताकि उच्च-डिग्री-ऑफ-फ्रीडम वाले विरूप्य सूक्ष्म रोबोट (deformable microrobots), विरल पॉइंट क्लाउड डेटा (sparse point cloud data) का उपयोग करके जटिल, संकुचित संवहनी वातावरण में सुदृढ़, लक्ष्य-निर्देशित 3D नेविगेशन प्राप्त कर सकें।

Chiara Castellani, Enrico Turco, Domenico Prattichizzo2026-05-14
⚡ electrical engineering

Adaptive Smooth Tchebycheff Attention for Multi-Objective Policy Optimization

यह शोध पत्र एक एडेप्टिव स्मूथ चेबिचेफ (Adaptive Smooth Tchebycheff) ढांचे का प्रस्ताव करता है जो वास्तविक समय के ग्रेडिएंट इंटरफेरेंस के आधार पर अनुकूलन सुगमता (optimization smoothness) को गतिशील रूप से नियंत्रित करता है, जिससे उन बहु-उद्देश्यीय रोबोटिक कार्यों के लिए गैर-उत्तल क्षेत्रों (non-convex regions) में पारेटो-इष्टतम नीतियों की सुदृढ़ खोज सक्षम होती है जहाँ स्थिर गैर-रेखीय विधियाँ विफल हो जाती हैं और रैखिक स्केलेराइजेशन (linear scalarizations) सैद्धांतिक रूप से सीमित होते हैं।

Alejandro Murillo-Gonzalez, Mahmoud Ali, Lantao Liu2026-05-14
💻 computer science

Emotional Expression in Low-Degrees-of-Freedom Robots: Assessing Perception with Reachy Mini

यह अध्ययन प्रदर्शित करता है कि अपने सीमित, गैर-मानव रूप (non-anthropomorphic) वाले डिज़ाइन के बावजूद, रीची मिनी (Reachy Mini) रोबोट प्रभावी ढंग से व्यापक भावनात्मक अर्थ संप्रेषित कर सकता है और सामाजिक धारणाओं को प्रभावित कर सकता है, भले ही विशिष्ट भावना लेबल की पहचान असंगत बनी हुई है।

Amit Rogel, Elmira Yadollahi, Guy Laban2026-05-14
💻 computer science

BiPneu: Design and Control of a Bipolar-Pressure Pneumatic System for Soft Robots

यह शोध पत्र BiPneu को प्रस्तुत करता है, जो सॉफ्ट रोबोट्स के लिए एक स्केलेबल और लागत-कुशल बाइपोलर-प्रेशर न्यूमैटिक सिस्टम है, जो मौजूदा PID और मॉडल प्रेडिक्टिव कंट्रोल विधियों की तुलना में बेहतर दबाव विनियमन सटीकता, मजबूती और निर्बाध सॉफ्टवेयर एकीकरण प्राप्त करने के लिए एक नवीन ड्यूल-मोड स्लाइडिंग-मोड कंट्रोलर का उपयोग करता है।

Yu Mei, Xinyu Zhou, Vedant Naik, Alan Gao, Xiaobo Tan2026-05-14