🤖 AI

ATLAS: An Annotation Tool for Long-horizon Robotic Action Segmentation

ATLAS एक मॉड्यूलर, कीबोर्ड-केंद्रित एनोटेशन टूल है जिसे लॉन्ग-होरिज़न रोबोटिक एक्शन सेगमेंटेशन के लिए डिज़ाइन किया गया है जो मल्टी-मोडल डेटा (वीडियो और प्रोप्रियोसेप्टिव सिग्नल्स) को सिंक्रोनाइज़ करता है ताकि मौजूदा विजन-ओनली टूल्स की तुलना में एनोटेशन दक्षता और टेम्पोरल बाउंड्री सटीकता में महत्वपूर्ण सुधार किया जा सके।

Sergej Stanovcic, Daniel Sliwowski, Dongheui Lee2026-04-30
💻 computer science

Walk With Me: Long-Horizon Social Navigation for Human-Centric Outdoor Assistance

यह शोध पत्र "वॉक विद मी" (Walk with Me) को प्रस्तुत करता है, जो एक मैप-फ्री फ्रेमवर्क है जो सिमेंटिक प्लानिंग और सुरक्षा तर्क के लिए उच्च-स्तरीय विजन-लैंग्वेज मॉडल को रूटीन निष्पादन के लिए निम्न-स्तरीय विजन-लैंग्वेज-एक्शन नीतियों के साथ जोड़कर, लंबी अवधि के, सामाजिक रूप से अनुपालन करने वाले आउटडोर रोबोट नेविगेशन को सक्षम बनाता है।

Lingfeng Zhang, Xiaoshuai Hao, Xizhou Bu, Yingbo Tang, Hongsheng Li, Jinghui Lu, Xiu-shen Wei, Jiayi Ma, Yu Liu, Jing Zh (…)2026-04-30
💻 computer science

Bi-Level Optimization for Contact and Motion Planning in Rope-Assisted Legged Robots

यह शोध पत्र एक द्वि-स्तरीय अनुकूलन ढांचे (bi-level optimization framework) को प्रस्तुत करता है जो क्रॉस-एन्ट्रॉपी विधि को ग्रेडिएंट-आधारित गैररेखीय अनुकूलन के साथ जोड़ता है ताकि ऊर्ध्वाधर सतहों पर चढ़ने वाले रस्सी-सहायता प्राप्त लेग्ड रोबोट्स के लिए लैंडिंग स्थानों का चयन करने और व्यवहार्य नियंत्रण इनपुट की गणना करने को एक साथ किया जा सके, जिसे ALPINE प्लेटफॉर्म पर मान्य किया गया है।

Ruben Malacarne, Ioannis Tsikelis, Enrico Mingo Hoffman, Michele Focchi2026-04-30
💻 computer science

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

थ्री-स्टेप नैव (Three-Step Nav) एक ज़ीरो-शॉट पदानुक्रमित योजनाकार (hierarchical planner) है जो फॉरवर्ड ग्लोबल प्लानिंग, करंट सब-गोल अलाइनमेंट और बैकवर्ड ट्रैजेक्टरी ऑडिटिंग के तीन-दृष्टिकोण प्रोटोकॉल को लागू करने के लिए मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है ताकि ड्रिफ्ट को समाप्त किया जा सके और बिना फाइन-ट्यूनिंग के R2R-CE और RxR-CE डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त करते हुए विजन-एंड-लैंग्वेज नेविगेशन में सुधार किया जा सके।

Wanrong Zheng, Yunhao Ge, Laurent Itti2026-04-30
🤖 AI

Visuo-Haptic Object Perception for Robots: An Overview

यह लेख मानव बहुविध धारणा के जैविक आधार का परीक्षण करके, संवेदी प्रौद्योगिकियों और गणनात्मक तकनीकों में प्रगति की समीक्षा करके, और वर्तमान चुनौतियों एवं भविष्य की अनुसंधान दिशाओं को रेखांकित करके, रोबोट में दृश्य-स्पर्श (visuo-haptic) वस्तु धारणा का एक व्यापक अवलोकन प्रदान करता है।

Nicolás Navarro-Guerrero, Sibel Toprak, Josip Josifovski, Lorenzo Jamone2026-04-29
🤖 machine learning

Quantifying the Effect of Feedback Frequency in Interactive Reinforcement Learning for Robotic Tasks

यह कार्य निरंतर स्थानों (continuous spaces) वाले रोबोटिक कार्यों के लिए संवादात्मक सुदृढीकरण शिक्षण (interactive reinforcement learning) में फीडबैक आवृत्ति के प्रभाव की जांच करता है और यह दर्शाता है कि कोई एकल इष्टतम आवृत्ति मौजूद नहीं है और एजेंट की बढ़ती दक्षता के अनुसार फीडबैक दरों को गतिशील रूप से अनुकूलित किया जाना चाहिए।

Daniel Harnack, Julie Pivin-Bachler, Nicolás Navarro-Guerrero2026-04-29
💻 computer science

Continual Domain Randomization

यह शोध पत्र कॉन्टिनुअल डोमेन रैंडमाइजेशन (CDR) का प्रस्ताव करता है, जो एक नवीन दृष्टिकोण है जो डोमेन रैंडमाइजेशन को कॉन्टिनुअल लर्निंग के साथ जोड़ता है ताकि सिमुलेशन मापदंडों के उपसमुच्चयों पर सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) नीतियों को क्रमिक रूप से प्रशिक्षित किया जा सके, जिससे एक साथ किए जाने वाले रैंडमाइजेशन की उप-इष्टतमता (सब-ऑप्टिमैलिटी) को दूर किया जा सके और रोबोटिक कार्यों में सुदृढ़ सिम-टू-रियल ट्रांसफर प्राप्त किया जा सके।

Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero2026-04-29
🤖 machine learning

Reinforcement Learning for Testing Interdependent Requirements in Autonomous Vehicles: An Empirical Study

यह अनुभवजन्य अध्ययन स्वायत्त वाहनों में परस्पर निर्भर आवश्यकताओं के परीक्षण के लिए सिंगल-ऑब्जेक्टिव और मल्टी-ऑब्जेक्टिव सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) की तुलना करता है, जिसमें यह पाया गया है कि जबकि दोनों दृष्टिकोण तुलनीय प्रभावशीलता प्रदर्शित करते हैं, मल्टी-ऑब्जेक्टिव आरएल (RL) बेहतर परिदृश्य विविधता और कवरेज प्रदान करता है जबकि सिंगल-ऑब्जेक्टिव आरएल (RL) उच्च-गंभीरता वाले उल्लंघन उत्पन्न करने की ओर प्रवृत्त होता है।

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali2026-04-29
💬 NLP

MiMo-Embodied: X-Embodied Foundation Model Technical Report

यह शोधपत्र MiMo-Embodied को प्रस्तुत करता है, जो पहला ओपन-सोर्स क्रॉस-एम्बोडेड फाउंडेशन मॉडल है जो मल्टी-स्टेज लर्निंग, क्यूरेटेड डेटा और CoT/RL फाइन-ट्यूनिंग का लाभ उठाकर स्वायत्त ड्राइविंग (autonomous driving) और एम्बोडेड एआई (embodied AI) दोनों में अत्याधुनिक प्रदर्शन प्राप्त करता है ताकि इन दोनों डोमेन के बीच मजबूत सकारात्मक स्थानांतरण (positive transfer) को प्रदर्शित किया जा सके।

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhu (…)2026-04-29
💬 NLP

Limited Linguistic Diversity in Embodied AI Datasets

यह शोध पत्र व्यापक रूप से उपयोग किए जाने वाले विजन-लैंग्वेज-एक्शन (VLA) डेटासेट्स का एक व्यवस्थित ऑडिट प्रस्तुत करता है, जो यह प्रकट करता है कि वे मुख्य रूप से सीमित भाषाई विविधता वाले दोहरावपूर्ण, टेम्पलेट जैसे निर्देशों पर निर्भर हैं, जिससे भाषा के कवरेज को व्यापक बनाने के लिए अधिक सिद्धांतवादी डेटासेट क्यूरेशन और रिपोर्टिंग की आवश्यकता पर बल मिलता है।

Selma Wanna, Agnes Luhtaru, Jonathan Salfity, Ryan Barron, Juston Moore, Cynthia Matuszek, Mitch Pryor2026-04-29