💻 computer science

Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

Zeva एक नवीन ढांचा (framework) है जो रोबोट के भौतिक अनुभवों से कारण संबंधी अंतःक्रियाओं (causal interactions) को एक द्वि-समय-पैमाने वाली स्मृति (dual-timescale memory) में निकालकर सामान्यीकृत एम्बोडीड मैनिपुलेशन (generalizable embodied manipulation) को सक्षम बनाता है, जिससे एक फ्रोजन पॉलिसी मॉडल बिना ग्रेडिएंट अपडेट की आवश्यकता के, इन-कॉन्टेक्स्ट लर्निंग के माध्यम से विभिन्न कार्यों में अपने प्रदर्शन को विकसित और बेहतर बनाने में सक्षम होता है।

Fu Chen, Xin Ding, Bingjia Huang, Xiangyu Li, Mingju Wang, Jiawei He, Kun Li, Wei Sun, Yunxin Liu, Hao Wu, Ting Cao2026-09-01
🔬 physics

The Structure of Merging Turbulent Jets Beneath a Small Quadrotor

यह अध्ययन एक होवरिंग क्रेजीफ्लाई 2.1 क्वाड्रोटर के विलय होते डाउनवॉश वेक (downwash wake) को चित्रित करने के लिए पार्टिकल इमेज वेलोसिटीमेट्री का उपयोग करता है, जिससे यह प्रकट होता है कि जबकि औसत वेग प्रोफाइल पांच रोटर आर्म लंबाई के परे कैनोनिकल राउंड-जेट आत्म-समानता (canonical round-jet self-similarity) में परिवर्तित हो जाते हैं, टर्बुलेंट नॉर्मल स्ट्रेस पूरे मापन डोमेन में चार-रोटर स्रोत के विशिष्ट द्वि-मोडल सिग्नेचर (bimodal signature) को बनाए रखते हैं।

Anoop Kiran, Nora Ayanian, Kenneth Breuer2026-09-01
💻 computer science

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

LightNav-0 एक कॉम्पैक्ट, जनरलइस्ट एम्बोडीड नेविगेशन मॉडल है जो प्रीट्रेन्ड विजन-लैंग्वेज मॉडल्स की स्थानिक बुद्धिमत्ता को रोबोट कंट्रोल के साथ उभारने और संरेखित करने के लिए एक यूनिफाइड टोकन इंटरफेस का लाभ उठाता है, जिससे बिना किसी टास्क-विशिष्ट प्रेडिक्शन हेड के विविध कार्यों, वातावरणों और एम्बॉडिमेंट्स में अत्याधुनिक प्रदर्शन और ज़ीरो-शॉट जनरलाइजेशन प्राप्त होता है।

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangp (…)2026-09-01
💻 computer science

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

यह शोध पत्र SUN (सेमेंटिकली यूनिफाइड) प्रोग्राम्स और कुआफू (Kuafu) सिस्टम का परिचय देता है, जो टाइप किए गए, भाषा-आधारित निष्पादन योग्य (executables) प्रोग्राम्स को स्वचालित रूप से संश्लेषित करके मॉडल-आधारित नियंत्रण और सीखे गए नीतियों के बीच के अंतर को पाटते हैं, जो MPC सत्यापन और RL प्रशिक्षण को एकीकृत करते हैं, जिससे बिना किसी मैनुअल डेंस रिवार्ड्स या मानव प्रदर्शनों के सुदृढ़ लॉन्ग-होरिज़न मैनिपुलेशन सक्षम होता है।

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopo (…)2026-09-01
🤖 AI

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

यह शोध पत्र SCALE का प्रस्ताव करता है, जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक ट्रेनिंग-फ्री, सिंगल-पास इन्फरेंस रणनीति है जो स्व-अनिश्चितता (self-uncertainty) का लाभ उठाकर विजुअल परसेप्शन और एक्शन निष्पादन दोनों को अनुकूल रूप से नियंत्रित करती है, जिससे बिना किसी अतिरिक्त प्रशिक्षण या सत्यापनकर्ता (verifier) की आवश्यकता के मजबूती में सुधार होता है और मौजूदा टेस्ट-टाइम स्केलिंग विधियों से बेहतर प्रदर्शन होता है।

Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi2026-08-31
💻 computer science

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA एक कमजोर रूप से पर्यवेक्षित (weakly supervised) फ्रेमवर्क है जो विविध डेटासेट्स में ज्यामिति-आधारित (geometry-grounded) फीचर लर्निंग को स्केल करके और एक ज्यामितीय रूप से सुसंगत मिलान एल्गोरिदम का उपयोग करके, स्टेट-ऑफ-द-आर्ट, ज़ीरो-शॉट CAD-टू-इमेज अलाइनमेंट प्राप्त करता है, जो पुनरावृत्त परिशोधन (iterative refinement) के बिना सटीक 9D पोज़ अनुमान सक्षम बनाता है।

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez2026-08-31
💻 computer science

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA एक निर्देश-जागरूक स्थानिक प्रतिनिधित्व संरेखण विधि है जो विजन-लैंग्वेज-एक्शन मॉडलों को विशेष रूप से भाषा निर्देशों द्वारा पहचाने गए लक्षित वस्तुओं की 3D ज्यामिति के साथ लेटेंट रिप्रजेंटेशन को संरेखित करके उन्नत करती है, जिससे सूक्ष्म हेरफेर और बाधित लक्ष्य कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng2026-08-31
💻 computer science

Beyond Relative Geometry: Metric-Aware Geometry Perception for Robotics

यह शोध पत्र मेट्रिक-अवेयर ज्योमेट्री परसेप्शन (MAGP) को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले फ्रेमवर्क है जो कैमरा मापदंडों और डेप्थ ऑब्जर्वेशन का लाभ उठाकर मौजूदा रिलेटिव ज्योमेट्री रिकंस्ट्रक्शन विधियों की स्केल इनकंसिस्टेंसी को हल करता है ताकि मेट्रिक-एक्यूरेट 3D रिप्रजेंटेशन उत्पन्न किया जा सके, जिससे विविध सेंसिंग कॉन्फ़िगरेशन में रोबोटिक मैनिपुलेशन पॉलिसीज़ के प्रदर्शन और मजबूती में महत्वपूर्ण सुधार होता है।

Fengjun Zhong, Congjia Chen, Zhaoxu Liu, Jinyang Du, Yuchen Gong, Enqi Mao, Ruihao Gong, ShuJie Wang, Xianglong Liu, Zho (…)2026-08-31
⚡ electrical engineering

Remote Human and Robot Interaction for Greenhouse Gardening Using Virtual Reality

यह अध्ययन ग्रीनहाउस बागवानी के लिए एक वीआर-आधारित रिमोट मानव-रोबोट प्रणाली का मूल्यांकन करता है, जिसमें यह पाया गया कि जहाँ पत्तों के निरीक्षण से रोग पहचान की सटीकता 88% तक प्राप्त होती है, वहीं मिट्टी की नमी का आकलन ऑपरेटर के कौशल के बजाय घने पौधों के वितान (कैनोपी) से कैमरे के अवरुद्ध होने के कारण महत्वपूर्ण रूप से बाधित होता है, जो अनुकूलन योग्य संवेदन रणनीतियों की आवश्यकता को रेखांकित करता है।

Daniel Udekwe, Hasan Seyyedhasani2026-08-31
💻 computer science

Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models

यह शोध पत्र VLAct को पेश करता है, जो विजन-लैंग्वेज-एक्शन मॉडल्स के लिए एक रिप्रेजेंटेशन-केंद्रित निरंतर प्री-ट्रेनिंग दृष्टिकोण है, जो विविध कार्यों और अनदेखे रोबोट्स में बेहतर हस्तांतरणीयता और प्रदर्शन प्राप्त करने के लिए हेट्रोजेनियस मल्टी-एम्बॉडिमेंट डेटा का लाभ उठाता है, यहाँ तक कि मामूली कंप्यूट बजट और सीमित डाउनस्ट्रीम डेटा के तहत भी।

Senqiao Yang, Chengyao Wang, Yuxin Chen, Zixuan Wang, Longxiang Tang, Haokun Gui, Jinhui Ye, Changsheng Lu, Xiaoyang Wu (…)2026-08-31