💻 computer science

LightTact: A Visual-Tactile Fingertip Sensor for Deformation-Independent Contact Sensing

यह शोधपत्र LightTact को प्रस्तुत करता है, जो एक विजुअल-टैक्टाइल फिंगरटिप सेंसर है जो संपर्क बिंदुओं पर बिखरे हुए प्रकाश को अलग करके मजबूत, विरूपण-स्वतंत्र (deformation-independent) संपर्क पहचान को सक्षम बनाता है, जिससे तरल पदार्थों और अत्यंत कोमल सामग्रियों के साथ उच्च-परिशुद्धता अंतःक्रिया सुलभ होती है और साथ ही विजन-लैंग्वेज मॉडल्स द्वारा सीधे व्याख्या योग्य डेटा प्रदान करता है।

Changyi Lin, Boda Huo, Mingyang Yu, Emily Ruppel, Bingqing Chen, Jonathan Francis, Ding Zhao2026-06-09
🤖 AI

Transforming Police-Car Swerving for Mitigating Isolated Stop-and-Go Traffic Waves: A Practice-Oriented Jam-Absorption Driving Strategy

पुलिस कार के अचानक मुड़ने (swerving) से प्रेरित होकर, यह शोध पत्र एक व्यावहारिक सिंगल-व्हीकल डबल-डिटेक्टर जैम-एब्जॉर्प्शन ड्राइविंग (SD-JAD) रणनीति प्रस्तावित करता है जो केवल दो रोडसाइड डिटेक्टरों का उपयोग करके एक परिभाषित JAD त्रिकोण का लाभ उठाकर अलग-थलग स्टॉप-एंड-गो ट्रैफिक तरंगों को प्रभावी ढंग से दबाता है, जिससे इस अवधारणा को सिद्धांत से एक व्यवहार्य यातायात प्रबंधन समाधान की ओर आगे बढ़ाया जा सके।

Zhengbing He2026-06-09
💻 computer science

VoLo: A Physical Orchestrator for Open-Vocabulary Long-Horizon Manipulation

यह शोध पत्र VoLo को प्रस्तुत करता है, जो एक भौतिक ऑर्केस्ट्रेशन फ्रेमवर्क है जिसमें एक VLM-आधारित एजेंट है जो रोबस्ट ओपन-वोकैबुलरी लॉन्ग-होरिज़न मैनिपुलेशन प्राप्त करने के लिए इंटरप्टिबल रोबोट टूल्स को गतिशील रूप से निर्देशित करता है, जिसे नए RoboVoLo बेंचमार्क और वास्तविक दुनिया के प्रयोगों द्वारा मान्य किया गया है।

Siyi Chen, Hugo Hadfield, Alex Zook, Mikaela Angelina Uy, Chan Hee Song, Erwin Coumans, Xuning Yang, Faisal Ladhak, Qing (…)2026-06-09
💻 computer science

DroneDAR: Long-Range Drone Distance Estimation Using Monocular Vision and Bounding-Box Features

यह शोध पत्र DroneDAR प्रस्तुत करता है, जो एक मोनोक्यूलर विजन मॉडल है जो एक हल्के गेटिंग मैकेनिज्म के माध्यम से अपीयरेंस फीचर्स को स्पष्ट बाउंडिंग-बॉक्स ज्योमेट्री के साथ एकीकृत करके लंबी दूरी के ड्रोन दूरी अनुमान को बढ़ाता है, जो वास्तविक दुनिया के ट्रैकिंग परिदृश्यों में मजबूती में सुधार करने के लिए स्केल वेरिएशन और नॉइजी क्यूज़ जैसी चुनौतियों का समाधान करता है।

Knut Peterson, Zaid Mayers, David Han2026-06-09
💻 computer science

MinNav: Minimalist Navigation Using Optical Flow For Active Tiny Aerial Robots

यह शोधपत्र MinNav को प्रस्तुत करता है, जो छोटे हवाई रोबोटों के लिए एक न्यूनतम नेविगेशन स्टैक है जो बिना किसी पूर्व दृश्य ज्ञान के स्थिर और गतिशील बाधाओं तथा अज्ञात अंतराल वाले वातावरणों के माध्यम से स्वायत्त रूप से नेविगेट करने के लिए मोनोक्यूलर ऑप्टिकल फ्लो और सक्रिय अन्वेषण का लाभ उठाता है, जिससे गहराई-आधारित विधियों की तुलना में काफी कम कम्प्यूटेशनल आवश्यकताओं के साथ 70% सफलता दर प्राप्त होती है।

Aniket Patil, Mandeep Singh, Uday Girish Maradana, Nitin J. Sanket2026-06-09
💻 computer science

Path Planning Using Deep Deterministic Policy Gradient: A Reinforcement Learning Approach

यह शोध पत्र खतरे से भरे वातावरण में वास्तविक समय में स्वायत्त वाहन पथ नियोजन के लिए एक डीप डिटरमिनिस्टिक पॉलिसी ग्रेडिएंट (DDPG) सुदृढीकरण शिक्षण दृष्टिकोण प्रस्तावित करता है, जो सिमुलेशन के माध्यम से यह प्रदर्शित करता है कि यह पारंपरिक इष्टतम नियंत्रण विधियों की तुलना में काफी तेजी से प्रभावी और सुरक्षित प्रक्षेपवक्र उत्पन्न करता है और साथ ही मिशन की सफलता के लिए व्यवहार्य शुरुआती बिंदुओं के सेट की पहचान भी करता है।

Qiang Le, Yaguang Yang, Isaac E. Weintraub2026-06-09
💻 computer science

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA एक नवीन डिस्क्रीट विज़न-लैंग्वेज-एक्शन फ्रेमवर्क है जो रोबोटिक मैनिपुलेशन कार्यों में उच्च इन्फरेंस गति और मजबूत टेम्पोरल कोहेरेंस दोनों प्राप्त करने के लिए ऑटोरेग्रेसिव ब्लॉक जनरेशन को मास्क डिस्क्रीट डिफ्यूजन के साथ जोड़ता है।

Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo2026-06-09
💻 computer science

PRISM: PRior-guided Imagination Sampling in world Models

PRISM एक हल्का, कार्य-अज्ञेय (task-agnostic) ढांचा है जो एक फ्रोजन JEPA-शैली के वर्ल्ड मॉडल से सीधे स्टेट-कंडीशन्ड एक्शन प्रायर्स (state-conditioned action priors) निकालकर और उन्हें पैरामीटर-मुक्त प्रोडक्ट-ऑफ-गॉसियन्स अपडेट के माध्यम से सैंपलिंग प्रक्रिया में एकीकृत करके निरंतर नियंत्रण नियोजन (continuous control planning) को बढ़ाता है, जो बिना किसी आर्किटेक्चरल ब्लोट या इन्फरेंस ओवरहेड के सफलता दर में महत्वपूर्ण सुधार करता है।

Yuhai Wang, Jiawei Xia, Rongxuan Zhou, Xiao Hu, Yongliang Shi, Jing Du, Yang Ye2026-06-09
💻 computer science

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

IntentNav एक स्थानिक-दृश्य अनुकरण ढांचा (spatial-visual imitation framework) है जो फ्रंटियर-आधारित लेबलिंग के माध्यम से प्रदर्शनों (demonstrations) से उच्च-स्तरीय खोज इरादे का अनुमान लगाकर मानव-समान वस्तु नेविगेशन नीतियों को सीखता है और ग्राउंडेड उम्मीदवारों का चयन करने के लिए एक VLM को प्रशिक्षित करता है, जिससे विविध रोबोट प्लेटफार्मों में अत्याधुनिक प्रदर्शन और ज़ीरो-शॉट ट्रांसफर प्राप्त होता है।

Yuxin Cai, Zongtai Li, Maonan Wang, Muyi Bao, Haokun Zhu, Ruofei Bai, Ding Zhao, Zirui Li, Wenshan Wang, Wei-Yun Yau, Ji (…)2026-06-09
💻 computer science

EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets

EgoAERO एक नवीन फ्रेमवर्क है जो रोबोट्स को बिना किसी प्री-स्कैन किए गए ऑब्जेक्ट एसेट्स की आवश्यकता के, एक एकल एर्गोसेंट्रिक (egocentric) RGB-D वीडियो से दक्ष हेरफेर (dexterous manipulation) सीखने में सक्षम बनाता है, जो संपर्क-संगत प्रक्षेप पथों (contact-consistent trajectories) का पुनर्निर्माण करता है और बड़े पैमाने पर EgoDex-R डेटासेट को प्रस्तुत करता है।

Yichen Niu, Haoran Lv, Xinrui Zhang, Xueyao Wan, Shiyu Gao, Ying Ai, Hui Xu, Yongqi Hu, Hengyi Zhang, Yang Xie, Zhaxizh (…)2026-06-09