💻 computer science

μ0\mu_0: A Scalable 3D Interaction-Trace World Model

यह शोध पत्र μ0\mu_0 को प्रस्तुत करता है, जो एक स्केलेबल 3D वर्ल्ड मॉडल है जो घने पिक्सेल या विशिष्ट कार्यों के बजाय इंटरेक्शन पॉइंट्स के सुचारू प्रक्षेपवक्र (trajectories) की भविष्यवाणी करता है, जिससे एक नवीन "TraceExtract" सिस्टम के माध्यम से एम्बोडिमेंट-अज्ञेय (embodiment-agnostic) रोबोट लर्निंग सक्षम होती है जो विविध वीडियो स्रोतों से स्वचालित रूप से 3D सुपरविजन उत्पन्न करता है।

Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang (…)2026-06-15
⚡ electrical engineering

An integrated interpretable control effectiveness learning and nonlinear control allocation methodology for overactuated aircrafts

यह शोध पत्र एक ऐसी नवीन कार्यप्रणाली प्रस्तावित करता है जो ओवरएक्टुएटेड (overactuated) विमानों के लिए एक संक्षिप्त, व्याख्यात्मक और अनुकूलन योग्य नियंत्रण प्रभावशीलता मॉडल बनाने हेतु 'स्पार्स आइडेंटिफिकेशन ऑफ नॉनलीन डायनेमिक्स' को नॉनलीन कंट्रोल एलोकेशन के साथ जोड़ती है, जिससे पारंपरिक ऑनबोर्ड मॉडलों की तुलना में कम्प्यूटेशनल लागत को काफी कम करते हुए उच्च-सटीक प्रदर्शन और एक्चुएटर विफलताओं के विरुद्ध मजबूती प्राप्त होती है।

Umut Demir, Aamir Ahmad, Walter Fichter2026-06-15
💻 computer science

FlowMo-WM: A World Model with Object Momentum and Hidden Ambient Drift

FlowMo-WM एक एंड-टू-एंड ट्रेन करने योग्य विजुअल वर्ल्ड मॉडल है जो इमेज-एक्शन इतिहास को शॉर्ट-टर्म मोशन स्टेट्स और लॉन्ग-टर्म कॉन्टेक्स्ट रिप्रेजेंटेशन्स में फैक्टराइज़ करके उन ऑब्जेक्ट्स के लिए लॉन्ग-होरिज़न प्रेडिक्शन सटीकता में सुधार करता है जो हिडन एम्बिएंट ड्रिफ्ट के अधीन होते हैं, जिसमें फ्लो फील्ड्स के प्रत्यक्ष पर्यवेक्षण की आवश्यकता नहीं होती है।

Yitao Jiang, Luyang Zhao, Muhao Chen, Devin Balkcom2026-06-15
💻 computer science

Multi-Agent Embodied Autonomous Driving: From V2X Information Exchange to Shared World Models

यह सर्वेक्षण शेयर्ड वर्ल्ड मॉडल्स (SWMs) पर 380 से अधिक प्रकाशनों की समीक्षा करके स्वायत्त ड्राइविंग के मल्टी-एजेंट एम्बॉडीड सिस्टम की ओर संक्रमण का परीक्षण करता है ताकि यह विश्लेषण किया जा सके कि V2X सूचना विनिमय सहयोगात्मक धारणा और योजना को कैसे सक्षम बनाता है, जबकि वास्तविक दुनिया की सुरक्षा गारंटी और सिमुलेशन-आधारित मूल्यांकन में महत्वपूर्ण अंतराल को उजागर करता है जो भविष्य की अनुसंधान प्राथमिकताओं को परिभाषित करते हैं।

Senkang Hu, Zhengru Fang, Yihang Tao, Zihan Fang, Sam Tak Wu Kwong, Yuguang Fang2026-06-15
💻 computer science

AnyGoal: Vision-Language Guided Multi-Agent Exploration for Training-Free Lifelong Navigation

AnyGoal एक प्रशिक्षण-मुक्त (training-free), मल्टी-एजेंट नेविगेशन फ्रेमवर्क है जो लाइफलॉन्ग, ओपन-वोकेबुलरी एक्सप्लोरेशन को सक्षम करने के लिए एक विजन-लैंग्वेज मॉडल और एक साझा 2D गॉसियन बेयसियन वैल्यू मैप का लाभ उठाता है, जिससे बिना किसी रिट्रेनिंग या केंद्रीकृत नियंत्रण के GOAT-Bench पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

MoniJesu James, Marcelino Julio Fernando, Miguel Altamirano Cabrera, Dzmitry Tsetserukou2026-06-15
💻 computer science

PhysVLA: Towards Physically-Grounded VLA for Embodied Robotic Manipulation

PhysVLA एक हल्का, प्लग-एंड-प्ले इन्फरेंस-टाइम फ्रेमवर्क पेश करता है जो भौतिक सिद्धांतों को लागू करने के लिए एक चरण-जागरूक परिमित-अवस्था मशीन (phase-aware finite-state machine) और एक चयनात्मक यूलर-लैग्रेंज गेट (selective Euler-Lagrange gate) को एकीकृत करके रोबोटिक हेरफेर के लिए फ्रोजन विजन-लैंग्वेज-एक्शन (VLA) मॉडल को बढ़ाता है, जिससे बिना मॉडल पुनप्रशिक्षण के सिमुलेशन और वास्तविक हार्डवेयर दोनों में सफलता दर, स्थिरता और प्रक्षेपवक्र दक्षता में उल्लेखनीय सुधार होता है।

Namai Chandra, Shriram Damodaran, Lin Wang2026-06-15
🤖 machine learning

RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

यह शोध पत्र RT-VLA का प्रस्ताव करता है, जो एक हल्का, डिस्टिल्ड विजन-लैंग्वेज-एक्शन मॉडल है जो अत्याधुनिक SimLingo टीचर की ड्राइविंग और रीजनिंग क्षमताओं को एक कॉम्पैक्ट स्टूडेंट में स्थानांतरित करता है, जिससे प्रतिस्पर्धी क्लोज्ड-लूप प्रदर्शन को बनाए रखते हुए और पोस्ट-हॉक व्याख्यात्मकता के साथ रीयल-टाइम कंट्रोल को सक्षम करते हुए महत्वपूर्ण इन्फरेंस लेटेंसी में कमी (44.8x तक) प्राप्त की जाती है।

Xiangyu Huang, Zhenlin Hua, Han Zhou, Shounak Sural, Ragunathan Rajkumar2026-06-15✓ Author reviewed ⓘ
💻 computer science

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D एक तेज़ 4D वर्ल्ड एक्शन मॉडल है जो प्रीट्रेन किए गए ज्यामितीय प्रायों (geometric priors) को एक कॉज़ल वीडियो-एक्शन ट्रांसफार्मर में स्थानांतरित करने के लिए हल्के स्थानिक रजिस्टर टोकन का लाभ उठाता है, जिससे यह सघन ज्यामितीय डिकोडिंग की कम्प्यूटेशनल लागतों से बचते हुए कुशल अनुमान के साथ सटीक 3D मैनिपुलेशन भविष्यवाणियां प्राप्त करता है।

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, S (…)2026-06-15
💻 computer science

ReactSim-Bench: Benchmarking Reactive Behavior World Model Simulation in Autonomous Driving

यह शोध पत्र ReactSim-Bench प्रस्तुत करता है, जो एक नवीन बेंचमार्क है जो एजेंट नियंत्रण को स्वायत्त वाहन (AV) इनपुट से अलग करके स्वायत्त ड्राइविंग व्यवहार विश्व मॉडलों की प्रतिक्रियात्मक क्षमताओं का मूल्यांकन करता है, ताकि यह आकलन किया जा सके कि सिम्युलेटेड एजेंट गैर-लॉग-आधारित AV व्यवहारों के प्रति सुरक्षा, नियम अनुपालन और गतिज व्यवहार्यता मेट्रिक्स के माध्यम से कैसे प्रतिक्रिया देते हैं।

Zhiyuan Zhang, Yanlun Peng, Jianing Zhang, Xianda Guo, Zehan Huang, Haoran Liu, Qifeng Li, Shaofeng Zhang, Xiaosong Jia (…)2026-06-15
💻 computer science

Development of a 3 in Sewer Pipe Inspection Robot with an Articulated Differential Mechanism using X-shaped Linkages

यह शोध पत्र एक उन्नत 3-इंच सीवर पाइप निरीक्षण रोबोट प्रस्तुत करता है जिसमें X-आकार के लिंकेज वाला एक आर्टिकुलेटेड डिफरेंशियल मैकेनिज्म और एक वायर-नियंत्रित आपातकालीन निकासी प्रणाली है, जो एक नवीन मोटर करंट-आधारित नियंत्रण पद्धति के माध्यम से ट्रैक्शन और बाधा पार करने की क्षमताओं को महत्वपूर्ण रूप से बढ़ाता है।

Shoya Umemura, Ryota Taniguchi, Atsushi Kakogawa2026-06-15