💻 computer science

AFUN: Towards an Affordance Foundation Model for Functionality Understanding

यह शोध पत्र AFUN को प्रस्तुत करता है, जो एक अफोर्डेंस फाउंडेशन मॉडल है जो RGB-D अवलोकनों और भाषा विवरणों से कार्य-सशर्त कार्यात्मक मास्क (task-conditional functional masks) और 3D पोस्ट-कॉन्टैक्ट मोशन कर्व्स का पूर्वानुमान लगाता है, जो विविध ओपन-वर्ल्ड वातावरणों में वास्तविक दुनिया के रोबोटिक हेरफेर (robot manipulation) के लिए ज़ीरो-शॉट परिनियोजन सक्षम करते हुए सेगमेंटेशन, कॉन्टैक्ट-पॉइंट प्रेडिक्शन और मोशन प्लानिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zhaoning Wang, Yi Zhong, Jiawei Fu, Henrik I. Christensen, Jun Gao2026-06-02
💻 computer science

RoboDream: Compositional World Models for Scalable Robot Data Synthesis

RoboDream एक सामान्यीकरण योग्य, एम्बोडिमेंट-केंद्रित वर्ल्ड मॉडल है जो रेंडर किए गए मोशन के साथ जनरेशन को एंकर करके नवीन वस्तुओं और दृश्यों के साथ फोटो-यथार्थवादी रोबोट प्रदर्शनों को संश्लेषित करता है, जिससे "रिट्रीवल एंड रीबर्थ" और "प्रॉप-फ्री टेलीऑपरेशन" के माध्यम से स्केलेबल डेटा सिंथेसिस सक्षम होता है, जिससे वास्तविक दुनिया में डेटा संग्रह की आवश्यकता को कम करते हुए डाउनस्ट्रीम पॉलिसी प्रदर्शन में महत्वपूर्ण सुधार होता है।

Junjie Ye, Rong Xue, Basile Van Hoorick, Runhao Li, Harshitha Rajaprakash, Pavel Tokmakov, Muhammad Zubair Irshad, Vitor (…)2026-06-02
🤖 machine learning

HUNT: High-Speed UAV Navigation and Tracking in Unstructured Environments via Instantaneous Relative Frames

यह शोध पत्र HUNT प्रस्तुत करता है, जो एक वास्तविक समय का ढांचा (framework) है जो उच्च गति वाले UAVs को केवल तात्कालिक ऑनबोर्ड अवलोकनों (observables) का उपयोग करके, वैश्विक स्थानीयकरण (global localization) की आवश्यकता को समाप्त करते हुए, अनस्ट्रक्चर्ड वातावरण में स्वायत्त रूप से नेविगेट करने और लक्ष्य ट्रैकिंग में निर्बाध रूप से संक्रमण करने में सक्षम बनाता है।

Alessandro Saviolo, Jeffrey Mao, Giuseppe Loianno2026-06-01
🤖 machine learning

Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey

यह सर्वेक्षण एम्बोडीड मैनिपुलेशन (embodied manipulation) में विजन-लैंग्वेज-एक्शन (VLA) मॉडलों की दक्षता में सुधार करने के लिए हालिया दृष्टिकोणों की व्यवस्थित रूप से समीक्षा और वर्गीकरण करता है, जो मॉडल आर्किटेक्चर, धारणा (perception), एक्शन जनरेशन, और प्रशिक्षण/अनुमान (training/inference) रणनीतियों में कम्प्यूटेशनल और मेमोरी संबंधी मांगों को कम करने पर केंद्रित है।

Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng2026-06-01
🤖 AI

Mixture of Horizons in Action Chunking

यह शोध पत्र 'मिक्सचर ऑफ होराइजन्स' (MoH) का प्रस्ताव करता है, जो एक प्लग-एंड-प्ले रणनीति है जो एक्शन चंक्स को विभिन्न क्षितिजों (horizons) वाले खंडों में पुनर्व्यवस्थित करती है ताकि दीर्घकालिक दूरदर्शिता और अल्पकालिक सटीकता को एक साथ अनुकूलित किया जा सके, जिससे विजन-लैंग्वेज-एक्शन मॉडलों में निहित अंतर्निहित ट्रेड-ऑफ पर विजय प्राप्त की जा सके और गतिशील अनुमान क्षमताओं के साथ अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Dong Jing, Gang Wang, Jiaqi Liu, Weiliang Tang, Zelong Sun, Yunchao Yao, Zhenyu Wei, Yunhui Liu, Zhiwu Lu, Mingyu Ding2026-06-01
🤖 AI

SKETCH: Semantic Key-Point Conditioning for Long-Horizon Vessel Trajectory Prediction

यह शोध पत्र SKETCH का प्रस्ताव करता है, जो एक सिमेंटिक की-पॉइंट कंडीशनिंग फ्रेमवर्क है जो कार्य को 'नेक्स्ट की-पॉइंट' के माध्यम से वैश्विक नेविगेशनल इंटेंट अनुमान और स्थानीय मोशन मॉडलिंग में विभाजित करके लॉन्ग-होरिज़न वेसल ट्रेजेक्टरी प्रेडिक्शन में सुधार करता है, जिससे अत्याधुनिक विधियों की तुलना में दिशात्मक निरंतरता में उल्लेखनीय वृद्धि होती है और ड्रिफ्ट कम होता है।

Linyong Gan, Zimo Li, Wenxin Xu, Xingjian Li, Jianhua Z. Huang, Enmei Tu, Shuhang Chen2026-06-01
💻 computer science

LangMap: A Human-Verified Benchmark for Hierarchical Open-Vocabulary Goal Navigation

यह शोध पत्र LangMap प्रस्तुत करता है, जो चार लक्ष्य स्तरों में मानव-सत्यापित पदानुक्रमित अर्थ संबंधी एनोटेशन (hierarchical semantic annotations) के साथ वाला पहला वास्तविक दुनिया का 3D इनडोर नेविगेशन बेंचमार्क है, और यह मौजूदा ओपन-वोकैबुलरी लैंग्वेज-कंडीशन्ड गोल नेविगेशन मूल्यांकनों की सीमाओं को दूर करने के लिए PlaNaVid बेसलाइन के साथ आता है।

Bo Miao, Weijia Liu, Jun Luo, Lachlan Shinnick, Jian Liu, Thomas Hamilton-Smith, Yuhe Yang, Zijie Wu, Vanja Videnovic, F (…)2026-06-01
💻 computer science

Neurosim: A Fast Simulator for Neuromorphic Robot Perception

यह शोध पत्र न्यूरोसिम (Neurosim) को प्रस्तुत करता है, जो मल्टी-मोडल सेंसर और फुर्तीली वाहन गतिशीलता (agile vehicle dynamics) के लिए एक उच्च-प्रदर्शन, वास्तविक समय का सिम्युलेटर है, और इसके साथी कॉर्टेक्स (Cortex) संचार लाइब्रेरी को, जो मिलकर न्यूरोमॉर्फिक धारणा (neuromorphic perception) और नियंत्रण एल्गोरिदम के कुशल प्रशिक्षण और क्लोज्ड-लूप परीक्षण को सक्षम करते हैं।

Richeek Das, Pratik Chaudhari2026-06-01
🤖 machine learning

Mollified Value Learning

यह शोध पत्र मॉलिफाइड वैल्यू लर्निंग (MVL) को प्रस्तुत करता है, जो एक नवीन ऑफलाइन गोल-कंडीशन्ड सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) दृष्टिकोण है जो अस्थिर पॉइंटवाइज डिफरेंशियल बाधाओं को एक स्थानिक रूप से एकत्रित अपेक्षा (स्पेशियली एग्रीगेटेड एक्सपेक्टेशन) से प्रतिस्थापित करता है ताकि मजबूत, दूरी-समान वैल्यू ज्योमेट्री प्रेरित की जा सके और उच्च-आयामी कार्यों में प्रदर्शन में सुधार किया जा सके।

Hrishikesh Viswanath, Juanwu Lu, S. Talha Bukhari, Mihir Chauhan, Damon Conover, Ziran Wang, Aniket Bera2026-06-01
💻 computer science

EBuddy: a workflow orchestrator for industrial human-machine collaboration

यह शोध पत्र EBuddy को प्रस्तुत करता है, जो एक वॉयस-गाइडेड वर्कफ़्लो ऑर्केस्ट्रेटर है जो औद्योगिक सेटिंग्स में विशेषज्ञ ज्ञान को मानकीकृत करने और मानव-रोबोट सहयोग को समन्वित करने के लिए फाइनाइट स्टेट मशीनों का लाभ उठाता है, जिससे दोहराव क्षमता और कम ऑपरेटर बोझ बनाए रखते हुए प्रक्रिया की अवधि में उल्लेखनीय कमी आती है।

Michele Banfi, Rocco Felici, Stefano Baraldo, Oliver Avram, Anna Valente2026-06-01