💻 computer science

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

थ्री-स्टेप नैव (Three-Step Nav) एक ज़ीरो-शॉट पदानुक्रमित योजनाकार (hierarchical planner) है जो फॉरवर्ड ग्लोबल प्लानिंग, करंट सब-गोल अलाइनमेंट और बैकवर्ड ट्रैजेक्टरी ऑडिटिंग के तीन-दृष्टिकोण प्रोटोकॉल को लागू करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है ताकि ड्रिफ्ट को समाप्त किया जा सके और बिना फाइन-ट्यूनिंग के R2R-CE और RxR-CE डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त करते हुए विजन-एंड-लैंग्वेज नेविगेशन में सुधार किया जा सके।

Wanrong Zheng, Yunhao Ge, Laurent Itti2026-04-30
🤖 AI

Visuo-Haptic Object Perception for Robots: An Overview

यह लेख मानव बहुविध धारणा के जैविक आधार का परीक्षण करके, संवेदी प्रौद्योगिकियों और गणनात्मक तकनीकों में प्रगति की समीक्षा करके, और वर्तमान चुनौतियों एवं भविष्य की अनुसंधान दिशाओं को रेखांकित करके, रोबोट में दृश्य-स्पर्श (visuo-haptic) वस्तु धारणा का एक व्यापक अवलोकन प्रदान करता है।

Nicolás Navarro-Guerrero, Sibel Toprak, Josip Josifovski, Lorenzo Jamone2026-04-29
🤖 machine learning

Quantifying the Effect of Feedback Frequency in Interactive Reinforcement Learning for Robotic Tasks

यह कार्य निरंतर स्थानों (continuous spaces) वाले रोबोटिक कार्यों के लिए संवादात्मक सुदृढीकरण शिक्षण (interactive reinforcement learning) में फीडबैक आवृत्ति के प्रभाव की जांच करता है और यह दर्शाता है कि कोई एकल इष्टतम आवृत्ति मौजूद नहीं है और एजेंट की बढ़ती दक्षता के अनुसार फीडबैक दरों को गतिशील रूप से अनुकूलित किया जाना चाहिए।

Daniel Harnack, Julie Pivin-Bachler, Nicolás Navarro-Guerrero2026-04-29
💻 computer science

Continual Domain Randomization

यह शोध पत्र कॉन्टिनुअल डोमेन रैंडमाइजेशन (CDR) का प्रस्ताव करता है, जो एक नवीन दृष्टिकोण है जो डोमेन रैंडमाइजेशन को कॉन्टिनुअल लर्निंग के साथ जोड़ता है ताकि सिमुलेशन मापदंडों के उपसमुच्चयों पर सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) नीतियों को क्रमिक रूप से प्रशिक्षित किया जा सके, जिससे एक साथ किए जाने वाले रैंडमाइजेशन की उप-इष्टतमता (सब-ऑप्टिमैलिटी) को दूर किया जा सके और रोबोटिक कार्यों में सुदृढ़ सिम-टू-रियल ट्रांसफर प्राप्त किया जा सके।

Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero2026-04-29
🤖 machine learning

Reinforcement Learning for Testing Interdependent Requirements in Autonomous Vehicles: An Empirical Study

यह अनुभवजन्य अध्ययन स्वायत्त वाहनों में परस्पर निर्भर आवश्यकताओं के परीक्षण के लिए सिंगल-ऑब्जेक्टिव और मल्टी-ऑब्जेक्टिव सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) की तुलना करता है, जिसमें यह पाया गया है कि जबकि दोनों दृष्टिकोण तुलनीय प्रभावशीलता प्रदर्शित करते हैं, मल्टी-ऑब्जेक्टिव आरएल (RL) बेहतर परिदृश्य विविधता और कवरेज प्रदान करता है जबकि सिंगल-ऑब्जेक्टिव आरएल (RL) उच्च-गंभीरता वाले उल्लंघन उत्पन्न करने की ओर प्रवृत्त होता है।

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali2026-04-29
💬 NLP

MiMo-Embodied: X-Embodied Foundation Model Technical Report

यह शोधपत्र MiMo-Embodied को प्रस्तुत करता है, जो पहला ओपन-सोर्स क्रॉस-एम्बोडेड फाउंडेशन मॉडल है जो मल्टी-स्टेज लर्निंग, क्यूरेटेड डेटा और CoT/RL फाइन-ट्यूनिंग का लाभ उठाकर स्वायत्त ड्राइविंग (autonomous driving) और एम्बोडेड एआई (embodied AI) दोनों में अत्याधुनिक प्रदर्शन प्राप्त करता है ताकि इन दोनों डोमेन के बीच मजबूत सकारात्मक स्थानांतरण (positive transfer) को प्रदर्शित किया जा सके।

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhu (…)2026-04-29
💬 NLP

Limited Linguistic Diversity in Embodied AI Datasets

यह शोध पत्र व्यापक रूप से उपयोग किए जाने वाले विजन-लैंग्वेज-एक्शन (VLA) डेटासेट्स का एक व्यवस्थित ऑडिट प्रस्तुत करता है, जो यह प्रकट करता है कि वे मुख्य रूप से सीमित भाषाई विविधता वाले दोहरावपूर्ण, टेम्पलेट जैसे निर्देशों पर निर्भर हैं, जिससे भाषा के कवरेज को व्यापक बनाने के लिए अधिक सिद्धांतवादी डेटासेट क्यूरेशन और रिपोर्टिंग की आवश्यकता पर बल मिलता है।

Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor2026-04-29
💻 computer science

MotionBricks: Scalable Real-Time Motions with Modular Latent Generative Model and Smart Primitives

MotionBricks एक स्केलेबल, रियल-टाइम जनरेटिव फ्रेमवर्क है जो मोशन सिंथेसिस में उद्योग की सीमाओं को दूर करने के लिए स्मार्ट प्रिमिटिव्स के साथ एक मॉड्यूलर लेटेंट बैकबोन को जोड़ता है, जो एनिमेशन प्रोडक्शन और रोबोटिक अनुप्रयोगों दोनों के लिए 15,000 FPS पर उच्च-गुणवत्ता वाला, मल्टी-मोडल नियंत्रण सक्षम करता है।

Tingwu Wang, Olivier Dionne, Michael De Ruyter, David Minor, Davis Rempe, Kaifeng Zhao, Mathis Petrovich, Ye Yuan, Chenr (…)2026-04-29
⚡ electrical engineering

VISION-SLS: Safe Perception-Based Control from Learned Visual Representations via System Level Synthesis

यह कार्य VISION-SLS प्रस्तुत करता है, जो एक स्केलेबल फ्रेमवर्क है जो उच्च-रिज़ॉल्यूशन वाली छवियों से नॉनलीनर आउटपुट फीडबैक के माध्यम से सुरक्षित, सुदृढ़ और रियल-टाइम नियंत्रण सक्षम करने के लिए सीखे गए लो-डायमेंशनल विजुअल रिप्रेजेंटेशन्स को सिस्टम-लेवल सिंथेसिस के साथ जोड़ता है, जो सिमुलेशन और हार्डवेयर प्रयोगों दोनों में बाधाओं की संतुष्टि सुनिश्चित करते हुए आंशिक अवलोकनीयता (पार्शियल ऑब्जर्वेबिलिटी) और सेंसर शोर को प्रभावी ढंग से संबोधित करता है।

Antoine P. Leeman, Shuyu Zhan, Melanie N. Zeilinger, Glen Chou2026-04-29
💻 computer science

Logic of Fuzzy Paths

यह शोधपत्र "लॉजिक ऑफ फजी पाथ्स" (Logic of Fuzzy Paths) को प्रस्तुत करता है, जो मोशन प्लानिंग के लिए एक नया टेम्पोरल लॉजिक है जो ज्यामिति को तर्क से अलग करने के लिए पथों को प्रथम श्रेणी के नागरिक (first-class citizens) के रूप में मानता है, जिससे सिग्नल टेम्पोरल लॉजिक जैसे मौजूदा ढांचों की तुलना में मानव उपयोगकर्ताओं के लिए अधिक सहज विशिष्टताएँ और प्रदर्शन से सीखने की बेहतर क्षमताएँ प्राप्त होती हैं।

Kush Grover, Pratham Gupta, Jan Křetínský2026-04-29