⚡ electrical engineering

Unifying Entropy Regularization in Optimal Control: From and Back to Classical Objectives via Iterated Soft Policies and Path Integral Solutions

यह शोध पत्र इष्टतम नियंत्रण (optimal control) के लिए एक एकीकृत KL-नियमित ढांचे (KL-regularized framework) को प्रस्तुत करता है जो सॉफ्ट-पॉलिसी सरोगेट्स (soft-policy surrogates) के माध्यम से शास्त्रीय और जोखिम-संवेदनशील उद्देश्यों का सामान्यीकरण करता है, जिन्हें मूल लक्ष्यों को पुनः प्राप्त करने के लिए पुनरावृत्त किया जा सकता है और एक सिंक्रोनाइज़्ड मामले में, रैखिक बेलमैन ऑपरेटरों और पाथ-इंटिग्रल समाधानों को उत्पन्न कर सकता है।

Ajinkya Bhole, Mohammad Mahmoudi Filabadi, Guillaume Crevecoeur, Tom Lefebvre2026-05-14
💻 computer science

OptMap: Geometric Map Distillation via Submodular Maximization

यह शोध पत्र OptMap प्रस्तुत करता है, जो एक ऑनलाइन एल्गोरिदम है जो आकार-प्रतिबंधित, सूचनात्मक उपसमुच्चयों के चयन की NP-hard समस्या को हल करने के लिए सबमॉड्यूलर मैक्सिमाइजेशन (submodular maximization) का लाभ उठाकर, प्रमाणित रूप से निकट-इष्टतम प्रदर्शन के साथ LiDAR डेटा को एप्लिकेशन-विशिष्ट ज्यामितीय मानचित्रों में कुशलतापूर्वक संकुचित (distill) करता है।

David Thorne, Nathan Chan, Christa S. Robison, Philip R. Osteen, Brett T. Lopez2026-05-14
🤖 AI

Prismatic World Model: Learning Compositional Dynamics for Planning in Hybrid Systems

प्रिस्मेटिक वर्ल्ड मॉडल (PRISM-WM), हाइब्रिड रोबोटिक सिस्टम में मोनोलिथिक लेटेंट वर्ल्ड मॉडल्स की सीमाओं को संबोधित करने के लिए, जटिल डायनेमिक्स को कंपोजेबल प्रिमिटिव्स में विघटित करने हेतु लेटेंट ऑर्थोगोनलाइजेशन के साथ एक कॉन्टेक्स्ट-अवेयर मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर का उपयोग करता है, जिससे रोलआउट ड्रिफ्ट कम होता है और विश्वसनीय लॉन्ग-होरिजन प्लानिंग सक्षम होती है।

Mingwei Li, Xiaoyuan Zhang, Chengwei Yang, Zilong Zheng, Yaodong Yang2026-05-14
💻 computer science

TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance

TouchGuide एक नवीन इन्फरेंस-टाइम स्टीयरिंग फ्रेमवर्क है जो लागत प्रभावी TacUMI डेटा संग्रह प्रणाली द्वारा समर्थित, स्पर्श मार्गदर्शन (tactile guidance) के साथ मोटे विजुअल कार्यों को परिष्कृत करने के लिए कंट्रास्टिवली प्रशिक्षित कॉन्टैक्ट फिजिकल मॉडल को एकीकृत करके संपर्क-समृद्ध हेरफेर (contact-rich manipulation) के लिए प्री-ट्रेंड विसुओमोटर नीतियों को बढ़ाता है।

Zhemeng Zhang, Jiahua Ma, Xincheng Yang, Xin Wen, Yuzhi Zhang, Boyan Li, Yiran Qin, Jin Liu, Can Zhao, Li Kang, Haoqin H (…)2026-05-14
💻 computer science

Perception with Guarantees: Certified Pose Estimation via Reachability Analysis

यह शोधपत्र सुरक्षा-महत्वपूर्ण साइबर-फिजिकल एजेंटों के लिए एक प्रमाणित 3D पोज़ एस्टीमेशन विधि प्रस्तुत करता है जो केवल कैमरा छवियों और ज्ञात लक्ष्य ज्यामिति के आधार पर सबसे खराब स्थिति की सुरक्षा गारंटी प्रदान करने के लिए रीचेबिलिटी एनालिसिस और औपचारिक न्यूरल नेटवर्क सत्यापन का उपयोग करता है।

Tobias Ladner, Yasser Shoukry, Matthias Althoff2026-05-14
🤖 machine learning

Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance

यह शोध पत्र एक संचार-कुशल सुरक्षित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो नियंत्रण नीतियों के साथ अनुकूलन योग्य क्रियान्वयन समय (एक्चुएशन टाइमिंग) को सीखता है, जिसमें स्थिरता की गारंटी देने के लिए लाइपुनोव-आधारित बैकअप के साथ एक रन-टाइम आश्वासन परत का उपयोग किया गया है, जो विभिन्न रोबोटिक प्रणालियों में फिक्स्ड-रेट और एक्सपेक्टेशन-आधारित सुरक्षा विधियों से काफी बेहतर प्रदर्शन करता है।

Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming, Tristan Schuler2026-05-14
💻 computer science

Action Emergence from Streaming Intent

यह शोध पत्र "स्ट्रीमिंग इंटेंट" (Streaming Intent) प्रस्तुत करता है, जो एक नवीन एंड-टू-एंड स्वायत्त ड्राइविंग फ्रेमवर्क है जो एक चेन-ऑफ-थॉट मैकेनिज्म के माध्यम से सिमेंटिकली स्ट्रीम किए गए इंटेंट को कॉज़ली (causally) व्युत्पन्न करके एक्शन इमर्जेंस को सक्षम बनाता है ताकि एक फ्लो-मैचिंग एक्शन जनरेटर को निर्देशित किया जा सके, जिससे वेमो (Waymo) बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन और अभूतपूर्व इंटेंट-फेथफुल कंट्रोलेबिलिटी प्राप्त होती है।

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Xie Yan, Benjin Zhu2026-05-14
💻 computer science

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1 एक एकीकृत स्ट्रीमिंग विजन-लैंग्वेज-एक्शन आर्किटेक्चर पेश करता है जो स्वायत्त ड्राइविंग के लिए एक साझा बैकबोन और मेमोरी चैनल के माध्यम से ऑटोरेग्रेसिव लैंग्वेज रीजनिंग को फ्लो-मैचिंग कंटीन्यूअस एक्शन जनरेशन के साथ एकीकृत करता है, जिससे भाषा-निर्देशित प्रक्षेपवक्र नियंत्रण (ट्रैजेक्टरी कंट्रोल) सक्षम होता है जो वास्तविक समय की थ्रूपुट बनाए रखते हुए WOD-E2E बेंचमार्क पर मानव प्रदर्शन से बेहतर प्रदर्शन करता है।

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li2026-05-14
💻 computer science

Driving Intents Amplify Planning-Oriented Reinforcement Learning

यह शोध पत्र DIAL को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा (framework) है जो निरंतर-एक्शन ड्राइविंग नीतियों में मोड कोलैप्स (mode collapse) को दूर करने के लिए इंटेंट-कंडीशन्ड फ्लो मैचिंग को मल्टी-इंटेंट प्रेफरेंस RL के साथ जोड़ता है, जिससे वे प्रदर्शन में पूर्ववर्ती स्टेट-ऑफ-द-आर्ट मॉडल्स और मानव-संचालित प्रदर्शनों (human-driven demonstrations) दोनों को पछाड़ने में सक्षम होते हैं।

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu2026-05-14
💻 computer science

Multistep Belief Space Dynamics Learning For Risk-Aware Control

यह शोध पत्र वितरण संबंधी गतिशीलता (distributional dynamics) की भविष्यवाणी करने के लिए एक लर्निंग फ्रेमवर्क प्रस्तुत करता है जो वास्तविक समय में, जोखिम-जागरूक मॉडल प्रेडिक्टिव कंट्रोल (Model Predictive Control) को सक्षम बनाता है, जिसे कठोर एब्लेशन अध्ययनों और चुनौतीपूर्ण ऑफ-रोड इलाके में नेविगेट करने वाले पूर्ण आकार के वाहन पर सफल तैनाती के माध्यम से मान्य किया गया है।

Jason Gibson, Bogdan Vlahov, Patrick Spieler, Evangelos A. Theodorou2026-05-14