💻 computer science

SidewalkBench: Benchmarking Visual Navigation on Urban Sidewalks

यह शोध पत्र SidewalkBench प्रस्तुत करता है, जो NVIDIA Isaac Sim पर निर्मित एक GPU-त्वरित सिमुलेशन बेंचमार्क है जो जटिल शहरी फुटपाथ वातावरण में विजुअल नेविगेशन मॉडलों का मूल्यांकन करता है, यह प्रकट करते हुए कि पैदल यात्रियों के साथ अंतःक्रिया और लॉन्ग-होरिज़न मजबूती वर्तमान सीमाएँ हैं जबकि सिंथेटिक डेटा स्केलिंग को एक आशाजनक समाधान के रूप में रेखांकित करता है।

Zhizheng Liu, Honglin He, Vivek Alumootil, Akshat Pandya, Brad Squicciarini, Wayne Wu, Bolei Zhou2026-06-16
🤖 machine learning

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

यह शोध पत्र Hierarchical Advantage-Weighted Behavior Cloning (HABC) का प्रस्ताव करता है, जो एक ऐसी विधि है जो विरल एपिसोड परिणामों (sparse episode outcomes) को अवस्था-अनुकूली भारण (state-adaptive weighting) और हस्तक्षेप-जागरूक क्रेडिट असाइनमेंट (intervention-aware credit assignment) के साथ अलग-अलग व्यवहार्यता और दक्षता उद्देश्यों में विभाजित करके, ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) का उपयोग करते हुए पूर्व-प्रशिक्षित विजन-लैंग्वेज-एक्शन मॉडलों को फाइन-ट्यून करती है, जिससे सुपरवाइज्ड फाइन-ट्यूनिंग बेसलाइनों की तुलना में संपर्क-समृद्ध द्विपक्षीय कार्यों (contact-rich bimanual tasks) पर सफलता दर में महत्वपूर्ण सुधार होता है।

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li2026-06-16
🤖 machine learning

Geometric Action Model for Robot Policy Learning

यह शोध पत्र ज्योमेट्रिक एक्शन मॉडल (GAM) को प्रस्तुत करता है, जो एक भाषा-सशर्त हेरफेर नीति (language-conditioned manipulation policy) है जो एक पूर्व-प्रशिक्षित ज्योमेट्रिक फाउंडेशन मॉडल को एक कॉज़ल फ्यूचर प्रेडिक्टर (causal future predictor) को एकीकृत करने के लिए विभाजित करके उसे पुन: उपयोग करती है, जिससे समृद्ध ज्योमेट्रिक प्रायर्स (geometric priors) को संरक्षित करते हुए रोबोट नियंत्रण के लिए कुशल, सटीक और सुदृढ़ 3D तर्क को सक्षम बनाया जा सके।

Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungry (…)2026-06-16
💻 computer science

Human Universal Grasping

यह शोधपत्र HUG को प्रस्तुत करता है, जो 10 लाख फ्रेम के विशाल एगोसेंट्रिक मानव ग्रैस्पिंग डेटासेट पर प्रशिक्षित एक फ्लो-मैचिंग मॉडल है, जो किसी भी वस्तु के लिए एकल RGB-D इमेज से विविध, रिटारगेटेबल ग्रैस्प उत्पन्न करता है, और विभिन्न एम्बॉडिमेंट्स एवं वातावरणों में ज़ीरो-शॉट रोबोटिक ग्रैस्पिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Kevin Yuanbo Wu, Tianxing Zhou, Isaac Tu, Billy Yan, Irmak Guzey, David Fouhey, Dandan Shan, Lerrel Pinto2026-06-16
💻 computer science

T-Rex: Tactile-Reactive Dexterous Manipulation

यह शोध पत्र T-Rex को प्रस्तुत करता है, जो एक स्पर्श-प्रतिक्रियात्मक (tactile-reactive) हेरफेर ढांचा है जो एक नवीन 100-घंटे के स्पर्श-समृद्ध डेटासेट, एक टेम्पोरल टैक्टाइल VQ-VAE एनकोडर और एक वेरिएबल-रेट मिक्स्चर-ऑफ-ट्रांसफॉर्मर आर्किटेक्चर को जोड़ता है, जो नाजुक बल नियंत्रण और विरूपणीय वस्तु हेरफेर कार्यों में मौजूदा विजन-लैंग्वेज-एक्शन मॉडलों की तुलना में काफी बेहतर प्रदर्शन करता है।

Dantong Niu (Linxi), Zhuoyang Liu (Linxi), Zekai Wang (Linxi), Boning Shao (Linxi), Zhao-Heng Yin (Linxi), Anirudh Pai ( (…)2026-06-16
⚡ electrical engineering

ADAPT: An Autonomous Forklift for Construction Site Operation

यह शोध पत्र ADAPT प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त ऑफ-रोड फोर्कलिफ्ट है जो जटिल निर्माण वातावरण में नेविगेट करने के लिए पारंपरिक नियंत्रण विधियों के साथ AI-संचालित धारणा (परसेप्शन) को एकीकृत करता है, और व्यापक वास्तविक दुनिया के परीक्षणों के माध्यम से यह प्रदर्शित करता है कि यह विभिन्न मौसम स्थितियों में सामग्री हैंडलिंग में मानव-स्तर के करीब प्रदर्शन प्राप्त कर सकता है।

Johannes Huemer, Markus Murschitz, Matthias Schörghuber, Lukas Reisinger, Thomas Kadiofsky, Christoph Weidinger, Mario N (…)2026-06-15
💻 computer science

A Pragmatic VLA Foundation Model

यह शोध पत्र LingBot-VLA को प्रस्तुत करता है, जो कि 20,000 घंटों के वास्तविक दुनिया के ड्यूल-आर्म रोबोट डेटा पर प्रशिक्षित एक व्यावहारिक विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है, जो कई प्लेटफॉर्म्स पर बेहतर सामान्यीकरण (generalization) प्रदर्शित करता है और एक अत्यधिक कुशल प्रशिक्षण कोडबेस प्रदान करता है, जिसके सभी संसाधन रोबोट लर्निंग के क्षेत्र को आगे बढ़ाने के लिए जारी किए गए हैं।

Wei Wu, Fan Lu, Yunnan Wang, Shuai Yang, Shi Liu, Fangjing Wang, Qian Zhu, He Sun, Yong Wang, Shuailei Ma, Yiyu Ren, Kej (…)2026-06-15
🤖 AI

Unsupervised Learning of Efficient Exploration: Pre-training Adaptive Policies via Self-Imposed Goals

यह शोध पत्र ULEE को प्रस्तुत करता है, जो एक अनसुपरवाइज्ड मेटा-लर्निंग विधि है जो अन्वेषण (exploration) और अनुकूलन (adaptation) को अनुकूलित करने के लिए इन-कॉन्टेक्स्ट लर्निंग को एडवरसेरियल गोल जनरेशन के साथ जोड़ती है, जो मौजूदा प्री-ट्रेनिंग दृष्टिकोणों की तुलना में नवीन कार्यों पर ज़ीरो-शॉट और फ्यू-शॉट प्रदर्शन में महत्वपूर्ण सुधार करती है।

Octavio Pappalardo2026-06-15
💻 computer science

Improving Robotic Generalist Policies via Flow Reversal Steering

यह शोध पत्र फ्लो रिवर्सल स्टीयरिंग (FRS) प्रस्तुत करता है, जो एक ऐसी विधि है जो उप-इष्टतम (suboptimal) क्रियाओं को उलटकर उन लेटेंट नॉइज़ (latent noises) का अनुमान लगाने के माध्यम से फ्लो मैचिंग-आधारित रोबोटिक जनरलिस्ट पॉलिसियों को बेहतर बनाती है जो उच्च-गुणवत्ता वाले व्यवहारों से मेल खाते हैं, जिससे ज़ीरो-शॉट कंट्रोल में महत्वपूर्ण सुधार होता है, तीव्र व्यवहार क्लोनिंग सक्षम होती है, और जटिल हेरफेर कार्यों के लिए सुदृढीकरण शिक्षण (reinforcement learning) बूटस्ट्रैपिंग की सुविधा मिलती है।

Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine2026-06-15
💻 computer science

Occupancy-Grounded Room Segmentation for Hierarchical 3D Scene Graphs

यह शोध पत्र पदानुक्रमित (hierarchical) 3D सीन ग्राफों के निर्माण के लिए एक ऑक्यूपेंसी-ग्राउंडेड पाइपलाइन प्रस्तुत करता है जो स्पष्ट बहुभुज पदचिह्नों (polygonal footprints) वाले ट्रैक किए गए मुक्त-स्थान क्षेत्रों (free-space regions) के साथ रूम नोड्स को एंकर करता है, जो शुद्धता (precision) में समझौते के बावजूद Matterport3D दृश्यों पर स्टेट-ऑफ-द-आर्ट प्लेस-कनेक्टिविटी बेसलाइनों की तुलना में बेहतर रूम इंस्टेंस रिकवरी प्रदर्शित करता है।

Carlos Cueto Zumaya, Iacopo Catalano, Jorge Peña-Queralta, Wallace Moreira Bessa2026-06-15