💻 computer science

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

यह शोध पत्र एक नवीन हाइब्रिड डेटासेट का उपयोग करके गैर-मानव सदृश (non-humanoid) रोबोटों के लिए सिमेंटिक अफोर्डेंस (semantic affordances) का अनुमान लगाने की विजन-लैंग्वेज मॉडल्स (VLMs) की क्षमता की जांच करता है, जो यह प्रकट करता है कि जबकि VLMs विभिन्न रूपात्मकताओं (morphologies) में अच्छी तरह से सामान्यीकरण करते हैं, वे नवीन टूल-उपयोग परिदृश्यों में विशेष रूप से कम फाल्स पॉजिटिव दरों लेकिन उच्च फाल्स नेगेटिव दरों द्वारा लक्षित रूढ़िवादी भविष्यवाणियों की ओर एक सुसंगत प्रवृत्ति प्रदर्शित करते हैं।

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert2026-04-22
💻 computer science

LiveVLN: Breaking the Stop-and-Go Loop in Vision-Language Navigation

LiveVLN एक प्रशिक्षण-मुक्त फ्रेमवर्क है जो विजन-लैंग्वेज नेविगेशन में 'स्टॉप-एंड-गो' बाधा को समाप्त करने के लिए निष्पादन (execution) को अवलोकन प्रसंस्करण (observation processing) के साथ ओवरलैप करता है ताकि बेंचमार्क प्रदर्शन को बनाए रखते हुए निरंतर, सुचारू वास्तविक दुनिया की तैनाती को सक्षम बनाया जा सके।

Xiangchen Wang, Weiye Zhu, Teng Wang, TianTian Geng, Zekai Zhang, Zhiyuan Qi, Jinyu Yang, Feng Zheng2026-04-22
🤖 AI

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

यह शोध पत्र SafetyALFRED को प्रस्तुत करता है, जो मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए वास्तविक दुनिया के किचन खतरों के साथ ALFRED वातावरण का विस्तार करने वाला एक नया बेंचमार्क है, जो स्थिर प्रश्न-उत्तर सेटिंग्स में सुरक्षा जोखिमों को पहचानने की उनकी क्षमता और एम्बॉडीड प्लानिंग (embodied planning) के माध्यम से उन जोखिमों को सक्रिय रूप से कम करने की उनकी क्षमता के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai2026-04-22
🤖 AI

Multi-Cycle Spatio-Temporal Adaptation in Human-Robot Teaming

यह शोध पत्र RAPIDDS प्रस्तुत करता है, जो कई चक्रों में व्यक्तिगत मानव स्थानिक और लौकिक व्यवहारों को मॉडल करके कार्य-स्तर के शेड्यूलिंग और गति-स्तर के अनुकूलन को एकीकृत करने वाला एक ढांचा है, जिससे गैर-अनुकूली प्रणालियों की तुलना में मानव-रोबोट टीमिंग दक्षता, सुरक्षा और उपयोगकर्ता वरीयता में महत्वपूर्ण सुधार होता है।

Alex Cuellar, Michael Hagenow, Julie Shah2026-04-22
🤖 machine learning

R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation

यह शोध पत्र R3D2 को प्रस्तुत करता है, जो एक हल्का वन-स्टेप डिफ्यूजन मॉडल है जो यथार्थवादी छाया और प्रकाश उत्पन्न करके न्यूरल रेंडरिंग-आधारित ड्राइविंग दृश्यों में पूर्ण 3D एसेट्स के वास्तविक, वास्तविक समय के समावेश को सक्षम बनाता है, जिससे स्केलेबल ऑटोनॉमस ड्राइविंग सिमुलेशन के लिए पारंपरिक 3D गॉसियन स्प्लेटिंग विधियों की सीमाओं को दूर किया जा सके।

William Ljungbergh, Bernardo Taveira, Wenzhao Zheng, Adam Tonderski, Chensheng Peng, Fredrik Kahl, Christoffer Petersson (…)2026-04-21
💻 computer science

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

यह शोध पत्र BOP-ASK प्रस्तुत करता है, जो 1.5 लाख से अधिक छवियों और 6D ऑब्जेक्ट पोज़ (object poses) से व्युत्पन्न 33 मिलियन प्रश्न-उत्तर युग्मों वाला एक बड़े पैमाने का डेटासेट है, जिसे सटीक 3D स्थानीयकरण, भौतिक अनुकूलता और बहु-चरणीय स्थानिक नियोजन जैसे सूक्ष्म ऑब्जेक्ट-इंटरैक्शन रीजनिंग कार्यों पर विजन-लैंग्वेज मॉडल्स को प्रशिक्षित करने और बेंचमार्क करने के लिए डिज़ाइन किया गया है।

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Kh (…)2026-04-21
⚡ electrical engineering

eCP: Equivariant Conformal Prediction with pre-trained models

यह शोध पत्र eCP का प्रस्ताव करता है, जो प्री-ट्रेन्ड मॉडल्स के ग्रुप-एवरेजिंग के माध्यम से ज्यामितीय समरूपता (geometric symmetry) को एकीकृत करके लॉन्ग-होरिज़न अनसर्टेंटी क्वांटिफिकेशन के लिए कॉन्फॉर्मल प्रेडिक्शन को उन्नत करने की एक विधि है, जिससे गैर-अनुरूपता स्कोर (non-conformity scores) में प्रमाणिक रूप से कमी आती है और विशेष रूप से उच्च विश्वास स्तरों पर अधिक सटीक प्रेडिक्शन सेट्स प्राप्त होते हैं।

Nikolaos Bousias, Lars Lindemann, George Pappas2026-04-21
💻 computer science

Chasing Ghosts: A Simulation-to-Real Olfactory Navigation Stack with Optional Vision Augmentation

यह शोध पत्र स्वायत्त यूएवी (UAV) गंध स्रोत स्थानीयकरण के लिए एक पुनरुत्पादक, ओपन-सोर्स फ्रेमवर्क प्रस्तुत करता है जो बिना किसी स्पष्ट गैस मैपिंग या बाहरी बुनियादी ढांचे की आवश्यकता के, अशांत वातावरण में गंध स्रोतों को खोजने के लिए एक न्यूनतम सेंसर सूट और सिमुलेशन-टू-रियल लर्निंग-आधारित नेविगेशन पॉलिसी का उपयोग करता है, जबकि प्रदर्शन को बढ़ाने के लिए वैकल्पिक रूप से विजन (दृष्टि) को शामिल करता है।

Kordel K. France, Ovidiu Daescu, Latifur Khan, Rohith Peddi2026-04-21
💻 computer science

Visual-RRT: Finding Paths toward Visual-Goals via Differentiable Rendering

यह शोध पत्र विज़ुअल-आरआरटी (vRRT) का प्रस्ताव करता है, जो एक नवीन मोशन प्लानर है जो सैंपलिंग-आधारित अन्वेषण और ग्रेडिएंट-आधारित दोहन के बीच के अंतर को पाटता है ताकि रोबोट को स्पष्ट संख्यात्मक जॉइंट कॉन्फ़िगरेशन की आवश्यकता के बजाय छवियों या वीडियो द्वारा निर्दिष्ट विज़ुअल लक्ष्यों की ओर नेविगेशन सक्षम किया जा सके।

Sebin Lee, Jumin Lee, Taeyeon Kim, Younju Na, Woobin Im, Sung-Eui Yoon2026-04-21
🤖 machine learning

Heterogeneous Self-Play for Realistic Highway Traffic Simulation

यह शोध पत्र PHASE को प्रस्तुत करता है, जो एक संदर्भ-जागरूक (context-aware) सेल्फ-प्ले फ्रेमवर्क है जो विषम वाहन प्रकारों वाले यथार्थवादी, नियंत्रणीय और विविध हाईवे ट्रैफिक परिदृश्य उत्पन्न करता है, जो प्रत्यक्ष विशेषज्ञ अनुकरण (expert imitation) पर निर्भर रहे बिना वास्तविक डेटा में बेहतर ज़ीरो-शॉट ट्रांसफर और उन्नत व्यवहारिक यथार्थवाद प्राप्त करता है।

Jinkai Qiu, Alessandro Saviolo, Chaojie Wang, Mingke Wang, Xiaoyu Huang2026-04-21