💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

यह शोध पत्र **In-Context VLA** प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो मुक्त-रूप (free-form) चेन-ऑफ-थॉट जनरेशन को संरचित संवेदी साक्ष्य (structured perceptual evidence) और एजेंटिक टूल उपयोग पर इन-कॉन्टेक्स्ट पोस्ट-ट्रेनिंग से बदलकर विजन-लैंग्वेज-एक्शन मॉडल्स को उन्नत करता है, जिससे सिमुलेशन और वास्तविक दुनिया के हेरफेर कार्यों में बेहतर निम्न-स्तरीय नियंत्रण और अत्याधुनिक प्रदर्शन के लिए ग्राउंडेड लैंग्वेज कंजम्प्शन सक्षम होता है।

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo2026-08-07
🤖 AI

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

SkillMemo एक विशेषज्ञ-निर्देशित ढांचा है जो एक Mixture-of-Experts आर्किटेक्चर के माध्यम से लंबी अवधि की प्रक्षेप पथों (trajectories) को अंतर्निहित परमाणु कौशलों (latent atomic skills) में स्पष्ट रूप से विभाजित करके और उन्हें क्रिया भविष्यवाणी के लिए मजबूत प्रासंगिक पूर्ववृत्त (contextual priors) प्रदान करने हेतु एक गतिशील एपिसोडिक मेमोरी बैंक में एकीकृत करके, एम्बोडीड विज़ुओमोटर मॉडल्स में कंपोजिशनल जनरलाइजेशन को बढ़ाता है।

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tan (…)2026-08-07
🤖 AI

TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions

यह शोध पत्र TRACE प्रस्तुत करता है, जो लेग्ड रोबोट्स के लिए एक एंड-टू-एंड लर्नड प्रोप्रियोसेप्टिव ओडोमेट्री एस्टिमेटर है, जो अविश्वसनीय संपर्क स्थितियों और विविध भू-भागों के तहत सुदृढ़ स्थिति और वेग अनुमान प्राप्त करने के लिए एक फुट-अवेयर क्रॉस-अटेंशन मॉड्यूल और भौतिकी-प्रेरित प्रशिक्षण उद्देश्यों का उपयोग करता है।

Taehyeon Kong, Woojin Kim, Jemin Hwangbo2026-08-07
💻 computer science

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

यह शोध पत्र HiRoC का प्रस्ताव करता है, जो एक पदानुक्रमित पोस्ट-ट्रेनिंग फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन मॉडल्स में फ्लैट पॉलिसियों की सीमाओं को दूर करने के लिए उच्च-स्तरीय कार्य नियोजन (high-level task planning) को निम्न-स्तरीय क्रिया निष्पादन (low-level action execution) से अलग करता है, जिससे स्पष्ट सिमेंटिक मार्गदर्शन और सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से सुदृढ़ लॉन्ग-होरिज़न रोबोटिक मैनिपुलेशन सक्षम होता है।

He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang2026-08-07
💻 computer science

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM एक गुणवत्ता-निर्देशित अर्ली-एग्जिट प्लानिंग फ्रेमवर्क है जो वीडियो डिफ्यूजन मॉडल्स से इंटरमीडिएट फीचर्स का लाभ उठाकर कंप्यूटेशनल डेप्थ को गतिशील रूप से आवंटित करता है, जिससे पुनरावृत्त वीडियो जनरेशन को दरकिनार करके काफी कम लेटेंसी के साथ अत्याधुनिक स्वायत्त ड्राइविंग प्रदर्शन प्राप्त होता है।

Sining Ang, Yuguang Yang, Yan Wang2026-08-07
🤖 AI

Visual Grounding in Zero-Shot Vision-Language Control

यह शोध पत्र यह प्रदर्शित करता है कि यद्यपि वर्तमान विज़न-लैंग्वेज मॉडल वास्तविक विज़ुअल ग्राउंडिंग के अभाव के कारण एक मोनोलिथिक ज़ीरो-शॉट कंट्रोलर के रूप में अक्सर विफल होते हैं, वे दृश्य साक्ष्यों को सत्यापित करने और इक्विवैरिएंस (समरूपता) को लागू करने वाले मॉड्यूलर, सिमेट्री-कंसेंसस गार्डियंस के साथ संवर्धित होने पर प्रभावी रूप से बाउंडेड, सिलेक्टिव हेज़र्ड असिस्टेंट के रूप में कार्य कर सकते हैं।

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà2026-08-07
💻 computer science

Design and Evaluation of a Touchscreen-Based Teleoperation Interface for Robotic Manipulators

यह अध्ययन रोबोटिक मैनिपुलेटर्स के लिए एक नवीन टचस्क्रीन-आधारित टेलीऑपरेशन इंटरफेस प्रस्तुत और मूल्यांकित करता है जो, एक तुलनात्मक उपयोगकर्ता अध्ययन के माध्यम से, सिम्युलेटेड परमाणु सतह संपर्क कार्यों में पारंपरिक जॉयस्टिक नियंत्रणों की तुलना में काफी बेहतर कार्य दक्षता, सटीकता और कम संज्ञानात्मक भार प्रदर्शित करता है।

Juan José García Cárdenas, Alperen Kenan, Hamidreza Raei, Paul Bremner, Manuel Giuliani, Arash Ajoudani, Adriana Tapus2026-08-07
🤖 machine learning

Robot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation

यह शोध पत्र हस्तलिखित वर्णमाला के एक बड़े डेटासेट से मानव-समान रोबोटिक गति सीखने के लिए एक ओपन-सोर्स फ्रेमवर्क प्रस्तुत करता है, जो बल और समय आयामों को शामिल करने के लिए गॉसियन मिक्स्चर मॉडल्स का विस्तार करता है, जिसे एक उपयोगकर्ता अध्ययन के माध्यम से मान्य किया गया है जो दर्शाता है कि उत्पन्न प्रक्षेपवक्र (ट्रैजेक्टरीज) काफी हद तक मानव-समान समझे जाते हैं।

Alperen Kenan, Paul Bremner, Manuel Giuliani2026-08-07
💻 computer science

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

GeniWorld रोबोटिक मैनिपुलेशन के लिए एक सामान्यीकरण योग्य इंटरैक्टिव वर्ल्ड मॉडल है जो अनदेखे वातावरणों में मजबूत ज़ीरो-शॉट सामान्यीकरण प्राप्त करने के लिए URDF-आधारित विज़ुअल एक्शन रिप्रजेंटेशन और डिकपल्ड किनेमैटिक्स का लाभ उठाता है, जो डाउनस्ट्रीम रोबोट प्रदर्शन को बेहतर बनाने के लिए एक स्केलेबल पॉलिसी इवैल्यूएटर और डेटा जनरेटर के रूप में कार्य करता है।

Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Z (…)2026-08-07
🤖 AI

Curiosity-Diffuser: Curiosity Guide Diffusion Models for Reliability

यह शोधपत्र Curiosity-Diffuser प्रस्तुत करता है, जो एक रैंडम नेटवर्क डिस्टिलेशन (RND) मॉड्यूल का उपयोग करके रोबोटिक इमिटेशन पॉलिसियों की विश्वसनीयता को बढ़ाता है ताकि कंडीशनल डिफ्यूजन मॉडल्स को कम जिज्ञासा (curiosity) वाले प्रक्षेप पथ (trajectories) उत्पन्न करने की ओर निर्देशित किया जा सके, जिससे मतिभ्रम (hallucinations) और ओवरजनरलाइजेशन को कम करते हुए व्यवहारों को प्रशिक्षण डेटा के साथ अधिक निकटता से संरेखित किया जा सके।

Zihao Liu, Xing Liu, Yuhang Dong, Haitao Chang, Zhengxiong Liu, Panfeng Huang2026-08-06