💻 computer science

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

यह शोध पत्र एक हाइब्रिड जियो-लोकलाइजेशन फ्रेमवर्क प्रस्तावित करता है जो विजन-लैंग्वेज मॉडल्स का लाभ उठाकर भौगोलिक पूर्व-सूचनाएं (geographic priors) उत्पन्न करता है और रिट्रीवल-आधारित विजुअल प्लेस रिकग्निशन के लिए खोज स्थान को सीमित करता है, जिससे स्टैंडअलोन VLMs के मतिभ्रम (hallucination) के जोखिमों को कम करते हुए स्ट्रीट और सिटी स्तरों पर अत्याधुनिक सटीकता प्राप्त की जाती है।

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan2026-06-29
💻 computer science

AeroGrab: A Unified Framework for Aerial Grasping in Cluttered Environments

यह शोध पत्र AeroGrab प्रस्तुत करता है, जो एक एकीकृत एंड-टू-एंड फ्रेमवर्क है जो क्लटर्ड (भीड़भाड़ वाले) वातावरण में विश्वसनीय हवाई ग्रैस्पिंग (aerial grasping) को सक्षम करने के लिए भाषा-निर्देशित सक्रिय अन्वेषण, 6-DoF ग्रैस्प जनरेशन और टकराव-जागरूक व्यवहार्यता मूल्यांकन को एकीकृत करता है।

Shivansh Pratap Singh, Naveen Sudheer Nair, Samaksh Ujjawal, Sarthak Mishra, Soham Patil, Rishabh Dev Yadav, Spandan Roy2026-06-29
💻 computer science

DeformGen: Dynamics-Based Topology Augmentation for Deformable Manipulation Policy Learning

DeformGen एक डायनेमिक्स-आधारित ऑग्मेंटेशन फ्रेमवर्क है जो टोपोलॉजी-सुसंगत अवस्थाओं को उत्पन्न करने के लिए भौतिक सिमुलेशन और प्रक्षेपवक्रों (ट्रैजेक्टरीज) को स्थानांतरित करने के लिए विरूपण-क्षेत्र वार्पिंग (डेफॉर्मेशन-फील्ड वार्पिंग) का उपयोग करके डिफॉर्मेबल मैनिपुलेशन में मौजूदा विधियों की सीमाओं को दूर करता है, जिससे लागत प्रभावी, भौतिक रूप से प्रशंसनीय डेटा विस्तार के माध्यम से पॉलिसी लर्निंग को बढ़ाया जाता है।

Zili Lin, Wenyao Zhang, Yuyang Zhang, Zekun Qi, Junyan Lin, Hanxin Zhu, Jiaolong Yang, Zhibo Chen, Yao Mu, Xiaokang Yang (…)2026-06-29
💻 computer science

Spacecraft Fiducial Marker for Autonomous Rendezvous, Proximity Operations, and Docking

यह शोधपत्र AstraTag को प्रस्तुत करता है, जो एक नवीन फिडुशियल मार्कर है जिसमें एक पुनरावर्ती स्पिड्रोन पैटर्न और सुदृढ़ ज्यामितीय वार्पिंग क्षमताएं हैं जो स्वायत्त अंतरिक्ष यान रेंडेवू और डॉकिंग के लिए विश्वसनीय बहु-पैमाने वाले पता लगाने और पहचान करने में सक्षम बनाती हैं, विशेष रूप से घुमावदार सतहों पर मौजूदा मार्कर्स की तुलना में बेहतर प्रदर्शन करती है।

Ravi Kumar Thakur, Matouš Vrba, Martin Saska2026-06-29
🤖 AI

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

SceneBot एक एकीकृत मोशन-ट्रैकिंग फ्रेमवर्क है जो ह्युमनॉइड रोबोट्स को एक नवीन हिंडसाइट सीन रिकंस्ट्रक्शन दृष्टिकोण से प्राप्त संदर्भ गतियों और अनुमानित सीन-इंटरैक्शन ग्राफ्स पर एक एकल पॉलिसी को कंडिशन करके मुक्त-स्थान लोकोमोशन और जटिल संपर्क-समृद्ध कार्यों में निर्बाध रूप से सामान्यीकरण करने में सक्षम बनाता है।

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu2026-06-29
💻 computer science

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

यह शोध पत्र एक हल्का, मॉडल-अज्ञेय (model-agnostic) मॉड्यूल प्रस्तावित करता है जो एडेप्टिव लेयर नॉर्मलाइजेशन के माध्यम से विजन-लैंग्वेज-एक्शन मॉडल्स के एक्शन हेड में सीधे 3D पॉइंट-आधारित ग्राउंडिंग सिग्नल्स को इंजेक्ट करता है, जो बैकबोन या प्रीट्रेनिंग पाइपलाइन में बिना किसी बदलाव के स्थानिक और कार्य सामान्यीकरण (spatial and task generalization) को महत्वपूर्ण रूप से अनलॉक करता है।

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen2026-06-29
🤖 AI

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

यह शोध पत्र ड्रॉप-देन-रिकवरी (DTR) प्रोटोकॉल और गेटप्रोब (GateProbe) मीट्रिक को पेश करता है ताकि यह प्रदर्शित किया जा सके कि विजन-लैंग्वेज-एक्शन मॉडल्स के लैंग्वेज बैकबोन में महत्वपूर्ण आर्किटेक्चरल रेडंडेंसी (अनावश्यकता) होती है, जिसे रोबोटिक मैनिपुलेशन कार्यों पर प्रदर्शन से समझौता किए बिना काफी हद तक हटाया जा सकता है, जो यह सुझाव देता है कि वर्तमान बेंचमार्क गहरी भाषाई ग्राउंडिंग क्षमताओं का पूरी तरह से लाभ नहीं उठा पा रहे हैं।

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, G (…)2026-06-29
🤖 machine learning

RS-Diffuser: Risk-Sensitive Diffusion Planning with Distributional Value Guidance

यह शोध पत्र RS-Diffuser को प्रस्तुत करता है, जो एक जोखिम-संवेदनशील ऑफलाइन डिफ्यूजन प्लानिंग फ्रेमवर्क है जो डिस्ट्रीब्यूशनल वैल्यू क्रिटिक्स को टेल-अवेयर गाइडेंस के साथ एकीकृत करता है ताकि एक एकल मॉडल को लचीले ढंग से जोखिम-विमुख, तटस्थ, या जोखिम-खोजने वाले व्यवहार उत्पन्न करने में सक्षम बनाया जा सके, जबकि सुरक्षा-महत्वपूर्ण अनुप्रयोगों में मजबूती में सुधार और सुरक्षा उल्लंघनों को कम किया जा सके।

Shiqiang Gong2026-06-29
💻 computer science

PPO-EAL: Exact Augmented Lagrangian Proximal Policy Optimization for Safe Robotic Control

यह शोध पत्र PPO-EAL को प्रस्तुत करता है, जो एक नवीन सुरक्षित सुदृढीकरण शिक्षण (सेफ रीइन्फोर्समेंट लर्निंग) ढांचा है जो सैद्धांतिक रूप से पुष्ट, सटीक बाधा संतुष्टि और विविध रोबोटिक बेंचमार्क एवं ज़ीरो-शॉट सिम-टू-रियल परिनियोजन में उत्कृष्ट प्रदर्शन प्राप्त करने के लिए प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन में सटीक ऑगमेंटेड लैग्रेंजियन अनुकूलन को एकीकृत करता है।

Jiatao Ding, Songqun Gao, Andrea Del Prete, Matteo Saveriano2026-06-29
💻 computer science

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

यह शोध पत्र "LocalNav" प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो अत्याधुनिक विजन लैंग्वेज मॉडल्स से जटिल स्थानिक-सिमेंटिक तर्क (spatial-semantic reasoning) को एक हल्के 4B-पैरामीटर वाले मॉडल में संकुचित (distill) करता है और इसे E-RLVR एवं क्वांटाइजेशन के साथ अनुकूलित करता है, जिससे क्लाउड निष्पादन पर निर्भर रहे बिना संसाधन-सीमित एज डिवाइसेस पर उच्च-प्रदर्शन, कम-विलंबता वाला ऑब्जेक्ट गोल नेविगेशन सक्षम होता है।

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno2026-06-29