💻 computer science

CST-WM: A Causally Structured World Model for Embodied Visual Tracking

यह शोध पत्र CST-WM प्रस्तुत करता है, जो एक कारण-संरचित विश्व मॉडल (causally structured world model) है जो अपने लेटेंट स्टेट (latent state) में रोबोट की गति को लक्ष्य के साक्ष्य से स्पष्ट रूप से अलग करके एक्शन-प्रेरित मतिभ्रम (action-induced hallucinations) को रोकता है, जिससे रोबोट को अवरोध (occlusion) और स्व-गति (ego-motion) जैसी चुनौतीपूर्ण स्थितियों में स्थिर विजुअल ट्रैकिंग और लक्ष्य पुन: प्राप्ति (target re-acquisition) दोनों के लिए प्रभावी ढंग से योजना बनाने में सक्षम बनाता है।

Junyi Hu, Shuaihang Yuan, Yi Fang2026-09-09
⚡ electrical engineering

Rethinking Safety for Generalist Robots

यह शोध पत्र तर्क देता है कि सामान्यज्ञ रोबोटों (generalist robots) की बहुमुखी प्रतिभा पारंपरिक भौतिक सुरक्षा उपायों से एक व्यापक "एम्बोडीड एआई सुरक्षा" (embodied AI safety) ढांचे की ओर एक प्रतिमान परिवर्तन (paradigm shift) को आवश्यक बनाती है, जो रोबोट के संपूर्ण जीवनचक्र में संदर्भ-निर्भर, इरादा-आधारित और मॉडल करने में कठिन जोखिमों को संबोधित करता है।

Rohan Sinha, Anushri Dixit, Ran Tian, Anirudha Majumdar, Andrea Bajcsy2026-09-09
⚡ electrical engineering

OcclusionCBF: Backup Control Barrier Functions for Safe Navigation Among Hidden Dynamic Obstacles

OcclusionCBF एक सुरक्षा फ़िल्टर है जो बैकअप कंट्रोल बैरियर फंक्शन्स का विस्तार करता है ताकि छिपे हुए गतिशील बाधाओं के बीच नेविगेट करने वाले रोबोटों के लिए टक्कर बचाव की गारंटी दी जा सके, जो कि रीयल-टाइम-रीचेबल-ऑक्यूपेंसी भविष्यवाणियों के विरुद्ध एक बैकअप रोलआउट को प्रमाणित करके किया जाता है, जिससे न्यूनतम कम्प्यूटेशनल ओवरहेड के साथ रिकर्सिव फिजिबिलिटी और बेहतर कार्य सफलता सुनिश्चित होती है।

Taekyung Kim, Hun Kuk Park, Renya Wada, Nikolay Atanasov, Shumon Koga, Dimitra Panagou2026-09-09
💻 computer science

Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception

यह प्रारंभिक अध्ययन "घोस्ट-इन-द-लूप" (Ghost-in-the-Loop) ढांचे को प्रस्तुत करता है यह प्रदर्शित करने के लिए कि प्रतिभागी अक्सर ह्यूमनॉइड टेलीऑपरेशन में मानव और एआई एजेंसी के बीच अंतर करने में संघर्ष करते हैं, और उनके निर्णय मुख्य रूप से नियंत्रण के वास्तविक स्रोत के बजाय कथित स्वाभाविकता और मल्टीमॉडल निरंतरता द्वारा संचालित होते हैं।

Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto2026-09-09
⚡ electrical engineering

Dynamic System Emulation: Fixed Wing Dynamics on a Multicopter

यह शोध पत्र एक डायनेमिक फीडबैक लीनियराइजेशन का उपयोग करने वाले नियंत्रण ढांचे को प्रस्तुत करता है ताकि दो-अक्षीय जिम्बल वाले मल्टीकॉप्टर को निश्चित पंख (फिक्स्ड-विंग) उड़ान गतिकी का सटीक अनुकरण करने में सक्षम बनाया जा सके, जो पारंपरिक फिक्स्ड-विंग विमानों की वायुगतिकीय सीमाओं को दूर करते हुए पायलट प्रशिक्षण और स्वायत्तता अनुसंधान के लिए एक बहुमुखी मंच प्रदान करता है।

Abdelhakim Amer, Andriy Sarabakha2026-09-09
🤖 AI

MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference

MemCorr-DP एक डिफ्यूजन पॉलिसी है जो 2D फीचर मैचेस को एक रेफरेंस ट्रजेक्टरी के साथ स्पष्ट 3D संबंधों में ऊपर उठाकर और वर्तमान दृश्य के साथ ज्यामिति (जियोमेट्री) को संरेखित करने के लिए काउंटरफैक्चुअल कंडीशनिंग का उपयोग करके, संचयी स्थानिक और दृश्य दृष्टिकोण परिवर्तनों (स्पेशियल और व्यूपॉइंट शिफ्ट्स) के तहत विसुओमोटर मजबूती को बढ़ाती है।

Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie2026-09-09
⚡ electrical engineering

RoboSense: Leveraging Robotaxi Fleets as Drive-by Sensors for Urban Traffic Monitoring

यह शोध पत्र एक नवीन गतिशील रोबोटैक्सी रूटिंग फ्रेमवर्क प्रस्तावित करता है जो यातायात निगरानी कवरेज और यात्रा दक्षता को एक साथ अनुकूलित करने के लिए बेड़े के वाहनों को सहयोगात्मक ड्राइव-बाय सेंसर के रूप में उपयोग करता है, यह प्रदर्शित करते हुए कि स्थानिक-कालिक कवरेज उद्देश्यों को एकीकृत करने से शहरी यातायात प्रबंधन और रोबोटैक्सी गतिशीलता दोनों के लिए एक 'विन-विन' परिदृश्य बनाया जा सकता है।

Yilin Wang, Yiheng Feng2026-09-09
💬 NLP

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

यह शोध पत्र विज़न-लैंग्वेज मॉडल्स की "कॉन्टेक्स्टुअल ऑब्ज़र्वर ग्राउंडिंग" (संदर्भगत प्रेक्षक स्थानीकरण)—अर्थात संदर्भ संकेतों से वक्ता के स्थित दृष्टिकोण का अनुमान लगाने की क्षमता—का मूल्यांकन करने के लिए पॉइंट-ऑफ-व्यू बेंचमार्क (POVBench) प्रस्तुत करता है और यह प्रदर्शित करता है कि जबकि वर्तमान मॉडल इस कार्य में संघर्ष करते हैं, प्रेक्षक-सापेक्ष स्थानिक तर्क का स्पष्ट विवरण लक्ष्य स्थानीयकरण में महत्वपूर्ण सुधार कर सकता है।

Mimo Shirasaka, Haochen Zhang, Yonatan Bisk2026-09-09
🤖 machine learning

Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning

यह शोध पत्र नोइज़ी-स्पेस पॉलिसी ग्रेडिएंट (NSPG) प्रस्तुत करता है, जो एक नवीन ढांचा है जो डिफ्यूजन लैटेंट्स (diffusion latents) पर एक KL-रेगुलराइज्ड ऑब्जेक्टिव को व्युत्पन्न करके डिफ्यूजन पॉलिसियों के साथ प्रभावी ऑफलाइन सुदृढीकरण शिक्षण (offline reinforcement learning) को सक्षम बनाता है, जो बिना डिनोइजिंग प्रक्रिया (denoising process) के माध्यम से बैकप्रोपैगेशन की आवश्यकता के, क्लीन एक्शन-स्पेस वैल्यू अनुमानों का उपयोग करके अनुकूलित करता है।

Mahmoud Selim, Cristina Cipriani, Karl H. Johansson2026-09-09
🤖 machine learning

Distributed Dexterous Manipulation with Spatially Conditioned Multi-Agent Transformers

यह शोध पत्र एक स्थानिक रूप से अनुकूलित (spatially conditioned) मल्टी-एजेंट ट्रांसफॉर्मर फ्रेमवर्क पेश करता है जो 64 सॉफ्ट रोबोटों के एक सरणी का उपयोग करके कुशल, सुदृढ़ वितरित दक्ष हेरफेर (distributed dexterous manipulation) को सक्षम बनाता है, जो सिम्युलेशन और वास्तविक दुनिया की सेटिंग्स में उच्च-परिशुद्धता वाले दीर्घ-क्षितिज कार्यों (long-horizon tasks) को प्राप्त करता है और अनुकूलित रोबोट चयन के माध्यम से हार्डवेयर के घिसाव को महत्वपूर्ण रूप से कम करता है।

Sarvesh Patil2026-09-09