💻 computer science

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization

यह शोध पत्र डिस्ट्रीब्यूटेड मॉडल-बेस्ड डिफ्यूजन (DMBD) का प्रस्ताव करता है, जो एक स्केलेबल सर्वर-रोबोट फ्रेमवर्क है जो मल्टी-रोबोट ट्राजेक्टरी ऑप्टिमाइज़ेशन की उच्च-आयामी अनुमान समस्या को स्थानीय सशर्त डिनोइजिंग प्रक्रियाओं में विघटित करता है, जिससे जटिल, नॉन-कॉन्वेक्स वातावरण में सब-सेकंड कंप्यूटेशन समय के साथ कुशल समन्वय सक्षम होता है।

Haejoon Lee, Xinyi Wang, Taekyung Kim, Dimitra Panagou2026-09-16
💻 computer science

Learning Manipulation-Sufficient Representations via Outcome Bottlenecks

यह शोधपत्र एक नीति-मुक्त (policy-free), एक्शन-कंडीशन्ड स्टोकेस्टिक रिप्रजेंटेशन प्रस्तावित करता है जो धारणा (perception) को 512-बाइट आउटकम बॉटलनेक में संकुचित करता है ताकि पारंपरिक सघन ज्यामितीय अवस्था प्रेषण (dense geometric state transmission) की तुलना में संचार बैंडविड्थ को काफी कम करते हुए हेरफेर सफलता दर और अनुकूलन क्षमता में उल्लेखनीय सुधार किया जा सके।

Md Selim Sarowar, Sungho Kim2026-09-16
💻 computer science

From Vision to Harvest: Benchmarking Vision-Language Models for Multi-Arm Robotic Fruit Harvesting

यह शोध पत्र मल्टी-आर्म रोबोटिक फ्रूट हार्वेस्टिंग में प्रीट्रेन विजन-लैंग्वेज मॉडल्स के मूल्यांकन के लिए पहला व्यापक ज़ीरो-शॉट बेंचमार्क प्रस्तुत करता है, जो प्रभावी हार्वेस्टिंग योजनाएं उत्पन्न करने की उनकी क्षमता को प्रदर्शित करता है और साथ ही 3D वेपॉइंट सटीकता और कोलिजन-अवेयर समन्वय में वर्तमान सीमाओं को रेखांकित करता है।

Vrishan Inukollu, Adyan Zaman, Anvi Kudaraya, Carlos Lazcano, Yuankai Zhu, Stavros Vougioukas, Xiaofan Yu2026-09-16
💻 computer science

When Do Learned Priors Help Visual Inertial Estimation? A Controlled Study of Prior Integration, Calibration, Initialization, and Backend Consistency

यह शोध पत्र एक नियंत्रित ढांचे को प्रस्तुत करता है जो यह प्रदर्शित करता है कि विजुअल-इनर्शियल एस्टिमेशन (visual-inertial estimation) में प्रदर्शन लाभ अक्सर सीखे गए प्रायर्स (learned priors) के बजाय बैकएंड, कैलिब्रेशन या इनिशियलाइजेशन कारकों द्वारा संचालित होते हैं, जो यह प्रकट करता है कि जब ये चर कड़ाई से मेल खाते हैं, तो एक MonoViT-आधारित मोशन प्रायर (motion prior) नगण्य सटीकता सुधार प्रदान करता है।

Jinchang Zhang, Guoyu Lu2026-09-16
💻 computer science

Vision-Force Admittance Learning for Peg Insertion into a Movable Hole

यह शोध पत्र एक विजन-फोर्स एडमिटेंस लर्निंग (VFAL) ढांचे का प्रस्ताव करता है जो गतिशील वातावरण में चलते हुए छेदों में मिलीमीटर-सटीक पेग-इन-होल इंसर्शन को सक्षम करने के लिए फाउंडेशन मॉडल से एसिंक्रोनस विजुअल फीडबैक को हाई-फ्रीक्वेंसी फोर्स कंट्रोल के साथ फ्यूज करता है।

Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng2026-09-16
💻 computer science

Visible Touch: Rendering Contact for Visuomotor Policies

यह शोधपत्र "विज़िबल टच" (Visible Touch) प्रस्तुत करता है, जो एक कम लागत वाले कस्टम सेंसर का उपयोग करके स्पर्श संबंधी फीडबैक को सीधे विज़ुअल फ्रेम में एकीकृत करने की एक विधि है, जिससे मौजूदा इमेज-कंडीशन्ड विसुओमोटर पॉलिसियों और प्रीट्रेन विज़न-लैंग्वेज-एक्शन मॉडल्स को बिना किसी आर्किटेक्चरल बदलाव के संपर्क संबंधी जानकारी का लाभ उठाने में सक्षम बनाया जा सके और हेरफेर (manipulation) की सफलता दर में महत्वपूर्ण सुधार किया जा सके।

Metin Alp Dogan, Edward Sun, Feng Xu, Daniel Wu, Allen Peng, Dennis Hong, Yuchen Cui2026-09-16
💻 computer science

Learning Communication-Conditioned Generative Policies for Decentralized Multi-Agent Collision Avoidance

यह शोध पत्र एक विकेंद्रीकृत, संचार-सशर्त जनरेटिव फ्रेमवर्क प्रस्तावित करता है जो विशेषाधिकार प्राप्त ऑफलाइन डेटा पर प्रशिक्षित फ्लो-मैचिंग नीतियों का उपयोग करता है ताकि सीखे गए लेटेंट इंटेंट एक्सचेंज के माध्यम से मल्टी-एजेंट कोलिजन अवॉयडेंस (बहु-एजेंट टकराव बचाव) को सक्षम किया जा सके, जो बिना किसी केंद्रीकृत नियोजन के सिमुलेशन और वास्तविक दुनिया दोनों परिदृश्यों में विशेषज्ञ-स्तरीय प्रदर्शन और मजबूत सामान्यीकरण प्राप्त करता है।

Prajwal Koirala, Mark Campbell2026-09-16
💻 computer science

BIG-CBF: Behavior-Imagination-Guided Control Barrier Function with Shared Uncertainty for Mobile Robot Navigation

यह शोधपत्र BIG-CBF को प्रस्तुत करता है, जो एक टू-रेट नेविगेशन आर्किटेक्चर है जो मोबाइल रोबोट नेविगेशन में कंट्रोल बैरियर फंक्शन्स (Control Barrier Functions) को निर्देशित करने के लिए शेयर्ड अनसर्टेन्टी मॉडलिंग के साथ बिहेवियर इमेजिनेशन को एकीकृत करता है, जिससे लगभग पूर्ण कार्य सफलता प्राप्त होती है और सेफ्टी फिल्टर हस्तक्षेपों को न्यूनतम किया जाता है।

Shibo Li, Zhongcheng Wang, Jiahe Cao, Jianhua Yang, Ke Wu2026-09-16
💻 computer science

EMoG: Emotion-Modulated Gait Generation for Expressive Humanoid Locomotion

यह शोध पत्र EMoG प्रस्तुत करता है, जो एक हल्का (lightweight) MLP उपयोग करके समायोज्य भावनात्मक शैली कोड और भौतिक कमांड के आधार पर चाल प्रक्षेपवक्र (gait trajectories) को नियंत्रित करके अभिव्यंजक, वास्तविक समय में मानव सदृश लोकोमोशन उत्पन्न करने वाला एक ढांचा है, जिसे एक बड़े पैमाने के भावना-एनोटेटेड डेटासेट और इंटरैक्टिव नियंत्रण के लिए एक LLM-आधारित पार्सर द्वारा समर्थित किया गया है।

Yi Lu, Tianhao Jiang, Honglong Tian, Yumeng Zhang, Qingrui Zhao, Zhengtao Wang, Xiao-Xiao Long, Qiu Shen, Xun Cao2026-09-16
💻 computer science

DynEoMT: Learning Object Dynamicity from Online Segmentation Queries

DynEoMT एक ऑनलाइन फ्रेमवर्क है जो ऑप्टिकल फ्लो, डेप्थ या कैमरा पोज़ की आवश्यकता के बिना क्षेत्र-स्तरीय वस्तु गतिशीलता (गतिशील बनाम स्थिर) की भविष्यवाणी करने के लिए क्वेरी-आधारित वीडियो सेगमेंटेशन को संवर्धित करता है, जो कैमरा-प्रतिपूरित (camera-compensated) ऑप्टिकल फ्लो पर प्रशिक्षित एक नवीन ऑफलाइन सुपरविजन पाइपलाइन के माध्यम से मजबूत प्रदर्शन प्राप्त करता है।

Calvin Galagain, Martyna Poreba, François Goulette2026-09-16