🤖 AI

Planning with the Views via Scene Self-Exploration

यह शोध पत्र ViewSuite प्रस्तुत करता है, जो एक 3D बेंचमार्क है जो यह दर्शाता है कि विजन-लैंग्वेज मॉडल मल्टी-टर्न प्लानिंग के लिए व्यू-एक्शन ट्रांसफॉर्मेशन को कंपोज़ करने में संघर्ष करते हैं, और एक व्यू ग्राफ डिस्टिलेशन के साथ एक इटरेटिव सेल्फ-एक्सप्लोरेशन फ्रेमवर्क प्रस्तावित करता है जो स्पार्स रिवार्ड्स को दूर करके और GPT-4o जैसे अग्रणी मॉडलों से आगे निकलकर प्लानिंग परफॉरमेंस को महत्वपूर्ण रूप से बढ़ाता है।

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Ma (…)2026-05-29
💻 computer science

VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation

यह शोध पत्र VE2VF प्रस्तुत करता है, जो एक ह्यूम-इन-द-लूप सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो विजन-सक्षम शिक्षक से ज्ञान को एक सुदृढ़, विजन-मुक्त छात्र नीति में संकुचित (distill) करता है, जिसे पूरी तरह से वास्तविक दुनिया में प्रशिक्षित किया गया है, और जो डोमेन रैंडमाइजेशन या डेटा ऑग्मेंटेशन पर निर्भर हुए बिना संपर्क-समृद्ध हेरफेर कार्यों (contact-rich manipulation tasks) पर उच्च सफलता दर और मजबूत सामान्यीकरण प्राप्त करता है।

Victor Kowalski, Chengxi Li, Dongheui Lee2026-05-29
💻 computer science

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration

यह शोध पत्र FLIP को प्रस्तुत करता है, जो बड़े पैमाने के झुंडों (swarms) के लिए एक लचीली और कुशल वितरित फॉर्मेशन प्लानिंग पद्धति है, जो अनुकूलतम स्थिति अनुक्रम गणना को पॉइंट क्लाउड रजिस्ट्रेशन समस्या में परिवर्तित करती है ताकि अत्यधिक कम्प्यूटेशनल भार के बिना तीव्र, आउटलायर-प्रतिरोधी प्रक्षेपवक्र अनुकूलन सक्षम किया जा सके।

Yuan Zhou, Guangtong Xu, Zhenyu Hou, Jialiang Hou, Fei Gao2026-05-29
💻 computer science

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

यह शोध पत्र फ्यूचर-एक्सपीरियंस कंडीशनिंग (FEC) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मल्टी-स्टेप रोबोट मैनिपुलेशन कार्यों में अन्वेषण (exploration) और पॉलिसी अनुकूलन को महत्वपूर्ण रूप से बढ़ाने के लिए LLM-निर्देशित, लघु-क्षितिज भविष्य के वीडियो अनुमानों को संरचित प्रायर्स (structured priors) के रूप में उपयोग करता है, यह प्रदर्शित करते हुए कि त्रुटिपूर्ण भविष्य के परिकल्पनाएं भी प्रदर्शन में सुधार करती हैं जबकि असंगत परिकल्पनाएं इसे कम करती हैं।

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz2026-05-29
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

Gaze2Act एक नवीन विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो मानव दृष्टि (human gaze) को एक गतिशील इरादे के संकेत के रूप में एकीकृत करके रोबोटिक हेरफेर (robot manipulation) को बढ़ाता है, जो यूनिट्री G1 ह्यूमनॉइड पर ऑब्जेक्ट डिसएम्बिग्यूएशन (object disambiguation), सूक्ष्म-स्तरीय इंटरेक्शन और गतिशील इरादा स्टीयरिंग (dynamic intent steering) प्राप्त करने के लिए ईगो-एक्सो व्यू अंतराल को पाटता है।

Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng L (…)2026-05-29
💻 computer science

A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms

यह शोध पत्र UniLab को प्रस्तुत करता है, जो एक हेट्रोजेनियस (heterogeneous) CPU-सिमुलेशन और GPU-लर्निंग आर्किटेक्चर है जो भौतिकी (physics) को पॉलिसी अपडेट से अलग करता है ताकि 3–10× तेज़ एंड-टू-एंड ट्रेनिंग दक्षता प्राप्त की जा सके और NVIDIA CUDA पर निर्भरता कम की जा सके तथा क्रॉस-प्लेटफ़ॉर्म रोबोट RL ट्रेनिंग को सक्षम बनाया जा सके।

Yufei Jia, Zhanxiang Cao, Mingrui Yu, Heng Zhang, Shenyu Chen, Dixuan Jiang, Meng Li, Xiaofan Li, Yiyang Liu, Junzhe Wu (…)2026-05-29
🤖 machine learning

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

DynaFLIP एक त्रि-मोडल डायनेमिक्स-गाइडेड प्री-ट्रेनिंग फ्रेमवर्क है जो एक नवीन सिम्प्लेक्स-वॉल्यूम मिनिमाइजेशन ऑब्जेक्टिव के माध्यम से विजुअल रिप्रेजेंटेशन्स में एक्शन-रेलेवेंट मोशन को एनकोड करके रोबोटिक मैनिपुलेशन को बढ़ाता है, जिसके परिणामस्वरूप विविध डाउनस्ट्रीम पॉलिसियों और आउट-ऑफ-डिस्ट्रीब्यूशन परिदृश्यों में बेहतर सामान्यीकरण प्राप्त होता है।

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang2026-05-29
⚡ electrical engineering

DSSE: a drone swarm search environment

DSSE एक PettingZoo-आधारित ड्रोन स्वार्म सर्च एनवायरनमेंट है जिसे उन मल्टी-एजेंट रीइन्फोर्समेंट लर्निंग एल्गोरिदम के अध्ययन को सुगम बनाने के लिए डिज़ाइन किया गया है जो प्रत्यक्ष दूरी-आधारित रिवार्ड्स के बिना लक्ष्य स्थानीयकरण के लिए डायनेमिक प्रोबेबिलिटी मैप्स का उपयोग करते हैं।

Manuel Castanares, Luis F. S. Carrete, Enrico F. Damiani, Leonardo D. M. de Abreu, José Fernando B. Brancalion, Fabrício (…)2026-05-28
💻 computer science

Imitating and Finetuning Model Predictive Control for Robust and Symmetric Quadrupedal Locomotion

यह शोध पत्र एक इमिटेटिंग एंड फाइनट्यूनिंग मॉडल प्रिडिक्टिव कंट्रोल (IFM) फ्रेमवर्क प्रस्तावित करता है जो चुनौतीपूर्ण भूभागों पर मजबूत, सममित और ऊर्जा-कुशल क्वाड्रुपेडल लोकोमोशन प्राप्त करने के लिए एक पारंपरिक MPC विशेषज्ञ नीति को इमिटेशन लर्निंग और डीप रिइन्फोर्समेंट लर्निंग के साथ जोड़ता है।

Donghoon Youm, Hyunyoung Jung, Hyeongjun Kim, Jemin Hwangbo, Hae-Won Park, Sehoon Ha2026-05-28
💻 computer science

Mixed Reality Tele-Ultrasound over 750 km: A Feasibility Study

यह व्यवहार्यता अध्ययन प्रदर्शित करता है कि एक मिश्रित वास्तविकता टेली-अल्ट्रासाउंड प्रणाली, जहाँ दूरस्थ विशेषज्ञ 754 किमी की दूरी पर हैप्टिक फीडबैक के माध्यम से नौसिखियों का मार्गदर्शन करते हैं, सकारात्मक उपयोगिता और कम कार्य भार के साथ उच्च-गुणवत्ता वाले उदर अल्ट्रासाउंड इमेजिंग को सफलतापूर्वक सक्षम बनाती है।

Ryan Yeung, David Black, Patrick B. Chen, Victoria Lessoway, Janice Reid, Sergio Rangel-Suarez, Silvia D. Chang, Septimi (…)2026-05-28