💻 computer science

GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates

यह शोधपत्र GroundControl को प्रस्तुत करता है, जो एक प्रक्षेपवक्र-सुसंगत (trajectory-consistent) अनिश्चितता अनुमानक है जो लक्ष्य-निर्देशित दूरी गतिकी (goal-directed distance dynamics) से विचलन को मॉडल करके विजन-लैंग्वेज एजेंटों में नेविगेशन विफलताओं का पूर्वानुमान लगाता है, और एक नए सिलेक्टिव रिस्क-कवरेज नेविगेशन (SRCN) प्रोटोकॉल के माध्यम से विफलता या अक्षमता के आधार पर प्रकरणों (episodes) को रैंक करने में मौजूदा बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi2026-06-19
💻 computer science

Generating Robot Hands from Human Demonstrations

यह शोधपत्र एक डेटा-संचालित ढांचे को प्रस्तुत करता है जो मानव उंगलियों के छोर (फिंगरटिप) की गति के 40 लाख से अधिक फ्रेम और सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) का लाभ उठाकर 3D-प्रिंटेड रोबोटिक हाथों को स्वचालित रूप से अनुकूलित और निर्मित करता है, यह प्रदर्शित करते हुए कि बड़े पैमाने पर मानव प्रदर्शन नियंत्रण नीतियों के साथ-साथ रोबोटिक स्वरूपों के भौतिक डिजाइन को प्रभावी ढंग से निर्देशित कर सकते हैं।

Sha Yi, Nicklas Hansen, Xueqian Bai, Carmelo Sferrazza, Michael T. Tolley, Xiaolong Wang2026-06-19
💻 computer science

DexSynRefine: Synthesizing and Refining Human-Object Interaction Motion for Physically Feasible Dexterous Robot Actions

DexSynRefine एक युग्मित ढांचा (coupled framework) है जो मोशन प्रायर (motion priors) का उपयोग करके प्रक्षेपवक्र निर्माण (trajectory generation) और कॉन्टैक्ट-डायनामिक्स अनुकूलन के साथ टास्क-स्पेस सुदृढीकरण शिक्षण (task-space reinforcement learning) के माध्यम से विरल मानव-वस्तु अंतःक्रिया डेटा से भौतिक रूप से व्यवहार्य दक्ष रोबोटिक क्रियाओं को संश्लेषित करता है, जिससे कि यह किनेमैटिक रिटारगेटिंग की तुलना में वास्तविक दुनिया की सफलता दर में 50–70 प्रतिशत अंक सुधार करता है।

Hyesung Lee, Hyunwoo Jung, Si-Hwan Heo, Sungwook Yang2026-06-18
💻 computer science

WEAVER, Better, Faster, Longer: An Effective World Model for Robotic Manipulation

यह शोध पत्र WEAVER को प्रस्तुत करता है, जो एक मल्टी-व्यू वर्ल्ड मॉडल आर्किटेक्चर है जो फ्लो-मैचिंग के माध्यम से उच्च निष्ठा (high fidelity), दीर्घकालिक निरंतरता (long-horizon consistency) और दक्षता को एक साथ प्राप्त करता है, जो रोबोटिक हेरफेर (robotic manipulation) के लिए पॉलिसी मूल्यांकन, सुधार और टेस्ट-टाइम प्लानिंग में अत्याधुनिक प्रदर्शन प्रदर्शित करता है।

Arnav Kumar Jain, Yilin Wu, Jesse Farebrother, Gokul Swamy, Andrea Bajcsy2026-06-18
⚡ electrical engineering

Ontology Neural Network and ORTSF: A Framework for Topological Reasoning and Delay-Robust Control

यह शोधपत्र ऑन्टोलॉजी न्यूरल नेटवर्क (ONN) और ऑन्टोलॉजिकल रियल-टाइम सिमेंटिक फैब्रिक (ORTSF) को संयोजित करने वाले एक एकीकृत ढांचे का प्रस्ताव करता है ताकि टोपोलॉजिकल रिलेशनल इंटीग्रिटी को संरक्षित करते हुए और विलंब-रोधी (delay-robust), संज्ञानात्मक रूप से पारदर्शी निर्णय लेने को सुनिश्चित करते हुए स्वायत्त रोबोटिक्स में ज्यामितीय नियंत्रण और सिमेंटिक रीजनिंग के बीच के अंतर को पाटा जा सके।

Jaehong Oh2026-06-17
⚡ electrical engineering

OmniRetarget: Interaction-Preserving Data Generation for Humanoid Whole-Body Loco-Manipulation and Scene Interaction

OmniRetarget एक इंटरैक्शन-प्रिजर्विंग डेटा जनरेशन इंजन है जो एम्बॉडीमेंट गैप्स को दूर करने और महत्वपूर्ण मानव-वस्तु/पर्यावरण संबंधों को बनाए रखने के लिए एक इंटरैक्शन मेश का लाभ उठाता है, जिससे जटिल लर्निंग करिकुलम के बिना रोबस्ट, लॉन्ग-होराइजन ह्यूमनॉइड लोको-मैनिपुलेशन और पार्कोर स्किल्स के लिए उच्च गुणवत्ता वाले ट्रेनिंग डेटा का कुशल निर्माण संभव होता है।

Lujie Yang, Xiaoyu Huang, Zhen Wu, Angjoo Kanazawa, Pieter Abbeel, Carmelo Sferrazza, C. Karen Liu, Rocky Duan, Guanya S (…)2026-06-17
💻 computer science

Intermittent Strategic Cooperation of Two Selfish Agents on Graphs

यह शोध पत्र इंटरमिटेंट स्ट्रैटेजिक कोऑपरेशन-बेस्ड टू-एजेंट पाथ प्लानिंग (IC2PP) समस्या को प्रस्तुत करता है, जो इस स्ट्रैटेजिक ग्राफ गेम में प्योर नैश इक्विलिब्रिया की संरचना और अस्तित्व को स्पष्ट करता है तथा इक्विलिब्रिया को सूचीबद्ध करने और स्वार्थी एजेंटों के लिए समन्वय तंत्र का विश्लेषण करने हेतु पॉलिनॉमियल-टाइम एल्गोरिदम प्रदान करता है।

Itay Shedlezki, Noa Agmon2026-06-17
💻 computer science

VISTA: Scale-Aware Visual Navigation via Action History Conditioning

VISTA एक विज़न-आधारित नेविगेशन फाउंडेशन मॉडल है जो स्केलिंग कमजोरियों को दूर करने के लिए सामान्यीकृत एक्शन हिस्ट्री (normalized action histories) पर आधारित होकर और बेहतर ज्यामितीय समझ के लिए DINOv3 एनकोडर का लाभ उठाकर विविध, दृष्टिगत रूप से दोहराव वाले वातावरणों में ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) और सुरक्षा में सुधार करता है।

Maeva Guerrier, Koki Kobayashi, Simon Roy, Jana Pavlasek, Giovanni Beltrame2026-06-17
🤖 machine learning

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

यह शोध पत्र DriveJudge को प्रस्तुत करता है, जो एक नवीन स्वायत्त ड्राइविंग मूल्यांकन एजेंट है जो मानव-संरेखित बेंचमार्क कार्यों पर श्रेष्ठ, व्याख्यात्मक और संदर्भ-जागरूक प्रदर्शन प्राप्त करने के लिए विजन-लैंग्वेज मॉडल तर्क (Vision-Language Model reasoning) को भौतिक रूप से-आधारित नियम फलनों (physically-grounded rule functions) के साथ एकीकृत करता है।

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Al (…)2026-06-17
💻 computer science

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinity एक मॉड्यूलर, वेब-स्केल 4D डेटा इंजन है जो मनमाने इंटरनेट वीडियो को मेट्रिक हैंड-ऑब्जेक्ट इंटरेक्शन रिप्रजेंटेशन और निष्पादन योग्य रोबोट ट्रेजेक्टरीज में बदल देता है, जो विविध मोरफोलॉजी और व्यू पॉइंट्स में स्केलेबल, ह्यूमन-इन-द-लूप-फ्री रोबोट लर्निंग और रिटारगेटिंग को सक्षम बनाता है।

Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang2026-06-17