⚡ electrical engineering

Neural 3D Object Reconstruction with Small-Scale Unmanned Aerial Vehicles

यह शोध पत्र 100 ग्राम से कम वजन वाले यूएवी (UAV) के लिए एक नवीन स्वायत्त प्रणाली प्रस्तुत करता है जो वास्तविक समय में प्रक्षेपवक्र अनुकूलन के लिए एक क्लोज्ड-लूप सक्रिय व्यूपॉइंट चयन ढांचे और सटीक अंतिम रेंडरिंग के लिए न्यूरल रेडिएंस फील्ड्स-आधारित पाइपलाइन का उपयोग करके उच्च-सटीकता वाला 3D ऑब्जेक्ट पुनर्निर्माण प्राप्त करता है।

Àlmos Veres-Vitàlyos, Filip Lemic, Daniel Johannes Bugelnig, Joan Bernaus Casadesús, Genis Castillo Gomez-Raya, Sergi Ab (…)2026-09-01
💻 computer science

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

यह शोध पत्र ड्रिफ्ट-बेस्ड पॉलिसी ऑप्टिमाइज़ेशन (DBPO) को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो पुनरावृत्ति परिशोधन (iterative refinement) को प्रशिक्षण में आंतरिक रूप से समाहित करके और ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) का समर्थन करके रोबोटिक नियंत्रण के लिए नेटिव वन-स्टेप जनरेटिव पॉलिसियों को सक्षम बनाता है, जिससे उच्च-आवृत्ति, कम-विलंबता प्रदर्शन प्राप्त होता है जो मौजूदा मल्टी-स्टेप डिफ्यूजन और सिंगल-स्टेप बेसलाइन्स से बेहतर है।

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang2026-09-01
💻 computer science

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

यह शोध पत्र AutoSERL को प्रस्तुत करता है, जो स्लाइडिंग विंडो मार्गदर्शन, सुरक्षा रिकवरी और स्वचालित समाप्ति तंत्र को एकीकृत करके एक एकल प्रदर्शन (demonstration) का उपयोग करके वास्तविक दुनिया के रोबोटिक सुदृढीकरण शिक्षण (reinforcement learning) को स्वचालित करता है, जिससे मौजूदा बेसलाइन की तुलना में विविध संपर्क-गहन कार्यों में बेहतर प्रदर्शन और मजबूती प्राप्त होती है।

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang2026-09-01
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

यह शोधपत्र FetchMan को पेश करता है, जो एक एंड-टू-एंड सिम-टू-रियल पाइपलाइन है जो सिंथेटिक बिहेवियर क्लोनिंग की प्रदर्शन सीमाओं को Flow-GRPO सुदृढीकरण शिक्षण (reinforcement learning) के साथ नीतियों को परिष्कृत करके दूर करती है, जिससे एक Unitree G1 ह्यूमनॉइड अनदेखे दृश्यों में लोको-मैनिप्यूलेशन कार्यों में 73.3% ज़ीरो-शॉट सफलता प्राप्त करने में सक्षम होता है।

Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui2026-09-01
💻 computer science

RedLight-VLA: Models for traffic-rule grounding and behavioral emphasis in driving policies

RedLight-VLA एक नवीन प्रशिक्षण उद्देश्य (training objective) है जो विजन-लैंग्वेज-एक्शन ड्राइविंग नीतियों के लिए ट्रैजेक्टरी-व्युत्पन्न व्यवहार संबंधी पुनर्रचना (behavioral reweighting) और समानांतर सहायक शीर्षों (parallel auxiliary heads) को जोड़ता है ताकि सिग्नल वाले चौराहों पर नियम-आधारित ग्राउंडिंग और व्यवहारिक महत्व में सुधार किया जा सके, जिससे बिना किसी अतिरिक्त मैनुअल नियम एनोटेशन के रेड-लाइट ओवरशूट और ट्रैजेक्टरी त्रुटियों को काफी कम किया जा सके।

Bala Murali Manoghar Sai Sudhakar, Sourab Bapu Sridhar, Sandipan Das, Rahul Ahuja, Meda Lazar, Ashish Garg, Pratik Likha (…)2026-09-01
💻 computer science

Cognitively-Grounded On-Device Runtime Learning for Ground Robots in Unknown Physical Environments

यह शोध पत्र CogRun को प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त ऑन-डिवाइस फ्रेमवर्क है जो एक नवीन लर्निंग एजेंट को एक समर्पित सुरक्षा-केंद्रित तर्कसंगत एजेंट के साथ एकीकृत करके, सुरक्षा-महत्वपूर्ण ग्राउंड रोबोट्स को बिना किसी पूर्व मानचित्र या कनेक्टिविटी के अज्ञात वातावरण में संज्ञानात्मक रूप से आधारित रनटाइम लर्निंग करने में सक्षम बनाता है।

Yihao Cai, Yanbing Mao, Christian Lebiere2026-09-01
💻 computer science

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

RoboGesture एक व्यापक ढांचा है जो एक नवीन डेटासेट, पदानुक्रमित ऑडियो-मोशन संरेखण (hierarchical audio-motion alignment), और मॉडल प्रेडिक्टिव कंट्रोल सेफ्टी फ़िल्टरिंग के माध्यम से ह्यूमनाइड रोबोटों को वास्तविक समय में, अर्थपूर्ण रूप से संरेखित और टकराव-मुक्त सह-भाषण जेस्चर (co-speech gestures) उत्पन्न करने में सक्षम बनाने के लिए डेटा की कमी, ऑडियो उपेक्षा और सुरक्षा संबंधी चिंताओं को संबोधित करता है।

Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi2026-09-01
🤖 machine learning

Generation of High-Level Concepts in 3D Scene Graphs via Autoregressive Diffusion

यह शोध पत्र एक एकीकृत ऑटोरेग्रेसिव डिफ्यूजन-आधारित मॉडल प्रस्तावित करता है जो प्रेक्षित ज्यामितीय प्रिमिटिव्स (geometric primitives) से पूर्ण, पदानुक्रमित इनडोर 3D सीन ग्राफ उत्पन्न करने के लिए ग्राफ संरचना और स्थानिक विशेषताओं को संयुक्त रूप से सीखता है, जो विविध डेटासेट पर मौजूदा बेसलाइन से बेहतर प्रदर्शन करता है और सिद्धांतपूर्ण मूल्यांकन के लिए एक नवीन फ्यूज्ड ग्रोमोव-वासरस्टीन (Fused Gromov-Wasserstein) मीट्रिक प्रस्तुत करता है।

Jose Andres Millan-Romera, Samuel Cognolato, Holger Voos, Jose Luis Sanchez-Lopez, Luciano Serafini2026-09-01
💻 computer science

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

हाइड्रा एक नवीन रोबोटिक कंट्रोल फ्रेमवर्क है जो कुशल नियोजन (प्लानिंग) के लिए विजुअल स्टेट्स और एक्शन्स को एक डिस्क्रीट लेटेंट स्पेस में एकीकृत करके वर्ल्ड मॉडल्स और रियल-टाइम निष्पादन के बीच के अंतर को पाटता है, जबकि निरंतर फ्लो-मैचिंग का उपयोग करके इन डिस्क्रीट प्लान्स को सुचारू भौतिक कमांड्स में अनुवादित करता है।

Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xi (…)2026-09-01
💻 computer science

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM एक ऐसा फ्रेमवर्क है जो रियल-टू-सिम पुनर्निर्माण (real-to-sim reconstruction), LLM-संचालित कार्य नियोजन (LLM-driven task planning) और प्रक्षेपवक्र रेंडरिंग (trajectory rendering) के माध्यम से स्वचालित रूप से फाइन-ट्यूनिंग डेटा उत्पन्न करके, दृष्टि-भाषा-क्रिया मॉडलों (vision-language-action models) को नए वर्कस्पेस में स्केलेबल अनुकूलन सक्षम बनाता है, जिससे महंगी मानव टेलीऑपरेशन प्रदर्शनों की आवश्यकता समाप्त हो जाती है।

Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa2026-09-01