⚡ electrical engineering

Mind the Privileged-to-Camera Gap: Actor-Centric Sidecar Supervision for Camera-First Open-Loop Waypoint Prediction

यह शोध पत्र एक एक्टर-केंद्रित साइडकार सुपरविजन पद्धति प्रस्तावित करता है जो एक्टर रिप्रेजेंटेशन को स्पष्ट रूप से ग्राउंड करने के लिए प्रशिक्षण के दौरान विशेषाधिकार प्राप्त सिम्युलेटर-व्युत्पन्न लेबल का लाभ उठाता है, जिससे कैमरा-प्रथम ओपन-लूप वेपॉइंट प्रेडिक्शन सटीकता में महत्वपूर्ण सुधार होता है और बेसलाइन मॉडलों की तुलना में अंतिम विस्थापन त्रुटि (डिस्प्लेसमेंट एरर) में 32.6% की कमी आती है।

Feeza Khan Khanzada, Jaerock Kwon2026-06-23
🤖 AI

TriMotion: Modality-Agnostic Camera Control for Video Generation

ट्रिमोटion (TriMotion) एक मोडैलिटी-अज्ञेय (modality-agnostic) फ्रेमवर्क है जो एक नए डेटासेट और लेटेंट कंसिस्टेंसी ऑब्जेक्टिव के माध्यम से वीडियो, पोज़ और टेक्स्ट इनपुट्स को एक साझा मोशन एम्बेडिंग स्पेस में एकीकृत करता है, जिससे विषम उपयोगकर्ता इनपुट्स के माध्यम से उच्च-गुणवत्ता वाले, लचीले कैमरा-नियंत्रित वीडियो जनरेशन को सक्षम बनाया जा सके।

Seunghyun Shin, Jifei Song, Wooseok Jeon, Hae-Gon Jeon, Jiankang Deng2026-06-23
🤖 AI

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA एक वास्तविक समय का ढांचा है जो एक अटेंशन-एनहैंस्ड LSTM और टेम्पोरल स्टेबिलाइज़ेशन मॉड्यूल के माध्यम से सांकेतिक भाषा के इशारों को अर्थपूर्ण निर्देशों में परिवर्तित करके मानव-रोबोट संपर्क में सुलभता को बढ़ाता है, जिससे विजन-लैंग्वेज-एक्शन मॉडल को बधिर और वाक-विकलांग उपयोगकर्ताओं के लिए रोबोटिक मैनिपुलेशन कार्यों को निष्पादित करने में सक्षम बनाया जा सके।

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe (…)2026-06-23
🤖 AI

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

यह शोध पत्र लिमा और न्यूयॉर्क शहर के मानव चालकों के प्रदर्शन की तुलना इन दो चुनौतीपूर्ण भौगोलिक क्षेत्रों के विविध ड्राइविंग परिदृश्यों में विजन-लैंग्वेज मॉडल्स (VLMs) के विरुद्ध करने के लिए रोबस्टो-2 (Robusto-2) बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि प्रश्न के प्रकार के आधार पर मानव और VLM की प्रतिक्रियाएं भिन्न होती हैं, लेकिन परिदृश्यों की उच्च आउट-ऑफ-डिस्ट्रीब्यूशन प्रकृति के कारण दोनों समूहों में विशिष्ट शहर के कारण प्रदर्शन में कोई महत्वपूर्ण भिन्नता नहीं दिखाई देती है।

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza2026-06-23
💻 computer science

BayesFP: Posterior Estimation for Flow-Based Policies via Feynman-Kac Sampling

BayesFP एक एकीकृत, रिट्रेनिंग-मुक्त इन्फरेंस-टाइम फ्रेमवर्क प्रस्तुत करता है जो डिफ्यूजन और फ्लो-मैचिंग पॉलिसियों दोनों के लिए पोस्टीरियर सैंपलिंग को सक्षम करने हेतु फेनमैन-काक सुधारक (Feynman-Kac corrector) का लाभ उठाता है, जिससे रोबोट्स को सीखे गए विशेषज्ञ व्यवहार के प्रति वफादार रहते हुए सुरक्षा बाधाओं और कार्य उद्देश्यों को पूरा करने वाले प्रक्षेप पथ (trajectories) उत्पन्न करने की अनुमति मिलती है।

Sreevardhan Sirigiri, Weiming Zhi, Fabio Ramos2026-06-23
💻 computer science

ReFPO: Reflow Regularization for Flow Matching Policy Gradients

ReFPO एक सरल, कुशल ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक स्पष्ट रिफ्लो (Reflow) नियमितीकरण पद को पेश करके फ्लो मैचिंग पॉलिसी ग्रेडिएंट्स को बेहतर बनाता है, जो प्रशिक्षण को स्थिर करता है, प्रॉक्सी-अनुपात स्पाइक्स को कम करता है, और बिना किसी अतिरिक्त कम्प्यूटेशनल ओवरहेड के उच्च-सटीकता वाले एक-चरण अनुमान (one-step inference) को सक्षम बनाता है।

Ge Wang, Yibo Peng, Fan Feng, Shenhao Yan, Chengsi Yao, Jiahao Yang, Honghao Cai, Yiming Zhao, Xi Li, Jinke Ren, Shuguan (…)2026-06-23
💻 computer science

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

यह शोध पत्र MV-WAM का परिचय देता है, जो एक अभिनव एंड-टू-एंड फ्रेमवर्क है जो मैनिफोल्ड-अवेयर ऑप्टिमाइज़ेशन और वैल्यू ऑग्मेंटेशन का उपयोग करके सिमुलेटेड और वास्तविक दुनिया के मैनिपुलेशन कार्यों में महत्वपूर्ण रूप से बेहतर सामान्यीकरण और मजबूती प्राप्त करने के लिए एम्बॉडीड रोबोटिक्स में विजुअल और एक्शन मोडैलिटीज के बीच संरचनात्मक बेमेल को संबोधित करता है।

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhon (…)2026-06-23
💻 computer science

Pose-Agnostic Robotic Functional Grasping via Observation-Action Canonicalization

यह शोध पत्र AnyMug प्रस्तुत करता है, जो एक सिमुलेशन-प्रशिक्षित विज़ुओमोटर सुदृढीकरण लर्निंग (visuomotor reinforcement learning) ढांचा है, जो विविध मुद्राओं में मग की ज़ीरो-शॉट वास्तविक दुनिया की कार्यात्मक पकड़ (zero-shot real-world functional grasping) प्राप्त करने के लिए प्रेक्षणों (observations) और क्रियाओं (actions) दोनों को एक साझा ऑब्जेक्ट-सेंट्रिक फ्रेम में कैनोनिकल (canonicalize) करता है ताकि विभिन्न विन्यासों में सुसंगत नीति व्यवहार सुनिश्चित किया जा सके।

Le Qiu, Cole Harrison, Jiankai Sun, Yao Liu, Suning Huang, Qianzhong Chen, Yang You, Marco Pavone2026-06-23
🤖 AI

OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving

OmniV2X एक व्हीकल-टू-एवरीथिंग (V2X) कोऑपरेटिव ड्राइविंग के लिए एक जनरेटिव फाउंडेशन मॉडल है जो क्रॉस-अटेंशन इंजेक्शन और बड़े पैमाने के सिंगल-एजेंट डेटा पर प्री-ट्रेनिंग का लाभ उठाता है ताकि मौजूदा विधियों की तुलना में काफी कम कम्प्यूटेशनल लागत, डेटा आवश्यकताओं और संचार बैंडविड्थ के साथ अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

Juntong Peng, Juanwu Lu, Yupeng Zhou, Can Cui, Yaobin Chen, Ziran Wang2026-06-23
💻 computer science

Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation

यह शोध पत्र कंप्रेस्ड एक्शन मेमोरी पॉलिसी (CAMP) को प्रस्तुत करता है, जो एक नवीन दृष्टिकोण है जो रोबोटों को आंशिक दृश्यता (partial observability) के तहत अपने स्वयं के एक्शन इतिहास के स्व-पर्यवेक्षित, संकुचित प्रतिनिधित्व (compressed representation) को सीखकर प्रगति को स्पष्ट रूप से ट्रैक करने और बाहरी पर्यवेक्षण के बिना विफलताओं से उबरने में सक्षम बनाता है, जिससे वे लंबी अवधि के, संपर्क-समृद्ध हेरफेर कार्यों में महारत हासिल कर सकते हैं।

Kuancheng Wang, Seungho Yeom, Jinglin Cao, Yuheng Zhi, Nikhil Shinde, Michael Yip2026-06-23