💻 computer science

X-ACTA: eXtended Analytic Center Tension distribution Algorithm for fixed and mobile cable-driven-parallel-robot

यह शोधपत्र X-ACTA को प्रस्तुत करता है, जो एक विस्तारित एनालिटिक सेंटर एल्गोरिदम है जो फिक्स्ड और मोबाइल केबल-ड्रिवन पैरेलल रोबॉट्स को अपने रेंच-फिजिबल वर्कस्पेस (Wrench-Feasible Workspace) के बाहर संचालित होने पर भी सुचारू, अवकलनीय (differentiable) और अद्वितीय केबल टेंशन समाधान बनाए रखने में सक्षम बनाता है, जिससे यह आक्रामक युद्धाभ्यास और केबल विफलताओं को संभालने में अत्याधुनिक तरीकों से बेहतर प्रदर्शन करता है।

Domenico Dona', Vincenzo Di Paola, Alberto Trevisani, Matteo Zoppi2026-07-10
💻 computer science

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

यह शोध पत्र FSD-VLN का प्रस्ताव करता है, जो एक फास्ट-स्लो ड्यूल-सिस्टम आर्किटेक्चर है जो स्थिर प्रायर्स (priors) के लिए एक स्लो स्ट्रीम और सुसंगत एक्शन जनरेशन के लिए एक डिफ्यूजन ट्रांसफॉर्मर फास्ट स्ट्रीम का उपयोग करके उच्च-स्तरीय सिमेंटिक रीजनिंग को लो-लेटेंसी फ्लाइट कंट्रोल से अलग करता है, जिससे लॉन्ग-होरिजन एरियल विजन-लैंग्वेज नेविगेशन के लिए नेविगेशन सफलता दर में उल्लेखनीय सुधार होता है और इन्फरेंस लेटेंसी कम होती है।

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian2026-07-10
💻 computer science

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM यह प्रदर्शित करता है कि इन-द-वाइल्ड (in-the-wild) एगोसेंट्रिक मानव डेटा का उपयोग करके वर्ल्ड एक्शन मॉडल्स (World Action Models) के साथ रोबोट नीतियों को प्रशिक्षित करना पारंपरिक बिहेवियर क्लोनिंग (behavior cloning) की तुलना में काफी बेहतर प्रदर्शन करता है, क्योंकि यह हस्तांतरणीय भौतिक प्रभावों को गैर-हस्तांतरणीय मानव-विशिष्ट कारकों से बेहतर तरीके से अलग करने के लिए DINO फीचर्स और 3D मोशन फ्लो जैसे अमूर्त विश्व निरूपणों (abstract world representations) का लाभ उठाता है।

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu2026-07-10
💻 computer science

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

Harness VLA एक मेमोरी-ऑगमेंटेड एजेंटिक फ्रेमवर्क है जो फ्रोजन विजन-लैंग्वेज-एक्शन मॉडल्स को रिट्रिएबल कॉन्टैक्ट-रिच प्रिमिटिव्स के रूप में मानकर और उन्हें एनालिटिक प्रिमिटिव्स की एक निश्चित लाइब्रेरी के साथ कंपोज करके जटिल मैनिपुलेशन कार्यों में उनकी विश्वसनीयता को बढ़ाता है, जिससे बिना किसी मॉडल फाइनट्यूनिंग के LIBERO-Pro और RoboCasa365 जैसे बेंचमार्क पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao T (…)2026-07-10
💻 computer science

Native Video-Action Pretraining for Generalizable Robot Control

LingBot-VA 2.0 एक वीडियो-एक्शन फाउंडेशन मॉडल है जिसे विशेष रूप से रोबोटिक एम्बॉडमेंटमेंट के लिए बनाया गया है, जिसमें एक सिमेंटिक विजुअल-एक्शन टोकेनाइज़र, कॉज़ल प्रीट्रेनिंग, एक स्पार्स MoE बैकबोन और एक एसिंक्रोनस इन्फरेंस स्कीम शामिल है ताकि वास्तविक दुनिया के वातावरण में मजबूत, फ्यू-शॉट जनरलाइज़ेबल कंट्रोल प्राप्त किया जा सके।

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei X (…)2026-07-10
🤖 machine learning

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

यह शोध पत्र लेटेंट मेमोरी पैलेस (LMP) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो नियंत्रण तर्क (control reasoning) को एक लेटेंट स्पेस के भीतर ऑटोरेग्रेसिव वेरिएशनल इन्फरेंस के रूप में मॉडल करता है, जिससे पुनरावृत्ति पुनर्प्राप्ति (iterative retrieval) और एक नवीन परिवर्तनीय-लंबाई वाले एक्शन टोकेनाइज़र के माध्यम से अनुकूलित टेस्ट-टाइम कंप्यूट आवंटन और बेहतर नीति प्रदर्शन सक्षम होता है।

Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta2026-07-10
🤖 machine learning

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

यह शोध पत्र ARDY को प्रस्तुत करता है, जो एक स्ट्रीमिंग जनरेशन फ्रेमवर्क है जो ऑनलाइन टेक्स्ट प्रॉम्प्ट्स पर सटीक नियंत्रण और लचीले लॉन्ग-होरिज़न काइनेमैटिक कंस्ट्रेंट्स के साथ रियल-टाइम, हाई-फिडेलिटी 3D ह्यूमन मोशन जनरेशन प्राप्त करने के लिए एक हाइब्रिड रिप्रेजेंटेशन और टू-स्टेज ऑटोरेग्रेसिव ट्रांसफॉर्मर डिनोइज़र का उपयोग करता है।

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe2026-07-10
💻 computer science

ContactMimic: Humanoid Object Interaction via Contact Control

कॉन्टैक्टमिमिक (ContactMimic) एक लर्निंग फ्रेमवर्क है जो कीपॉइंट ट्रैजेक्टरीज के साथ बाइनरी कॉन्टैक्ट कमांड्स को स्पष्ट रूप से ट्रैक करके ह्यूमनॉइड ऑब्जेक्ट इंटरेक्शन को बढ़ाता है, जिससे विविध मैनिपुलेशन कार्यों में सटीक भौतिक संपर्क और ऑन-डिमांड कॉन्टैक्ट कंट्रोलेबिलिटी सक्षम होती है।

Xinyao Li, Xialin He, Runpei Dong, Saurabh Gupta2026-07-10
💻 computer science

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

यह शोधपत्र DexVerse को प्रस्तुत करता है, जो एक बड़े पैमाने का, मॉड्यूलर बेंचमार्क है जिसमें 100 विविध कार्य, कई रोबोटिक स्वरूप (embodiments) और विन्यास योग्य (configurable) दृश्य विविधताएं शामिल हैं, ताकि सामान्य-उद्देश्य वाले दक्ष हेरफेर (dexterous manipulation) नीतियों का व्यवस्थित रूप से मूल्यांकन और विकास किया जा सके।

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang M (…)2026-07-10
🤖 AI

A Digital Twin Framework for Metamorphic Testing of Autonomous Driving Systems Using Generative Model

यह शोध पत्र एक डिजिटल ट्विन-संचालित मेटामॉर्फिक टेस्टिंग फ्रेमवर्क का प्रस्ताव करता है जो यथार्थवादी, विविध ड्राइविंग परिदृश्य बनाने और स्वायत्त वाहन सुरक्षा को मान्य करने के लिए स्टेबल डिफ्यूजन जैसे जेनरेटिव एआई मॉडल का लाभ उठाता है, जो पारंपरिक बेसलाइन दृष्टिकोणों की तुलना में बेहतर टेस्ट कवरेज और प्रदर्शन मेट्रिक्स प्रदर्शित करता है।

Tony Zhang, Burak Kantarci, Umair Siddique2026-07-09