💻 computer science

SCOPE: Scale-Consistent One-Pass Estimation of 3D Geometry

SCOPE एक नवीन वन-पास विधि है जो विस्तृत मोनोक्यूलर वीडियो अनुक्रमों से 3D ज्यामिति का अनुमान लगाने के लिए व्यूपॉइंट-इनवेरिएंट अलाइनमेंट, अपीयरेंस-इनवेरिएंट लर्निंग और फ्रीक्वेंसी-मॉड्यूलेटेड पोजिशनिंग पेश करती है, ताकि अत्याधुनिक दृष्टिकोणों की तुलना में ज्यामितीय सटीकता और टेम्पोरल कंसिस्टेंसी में महत्वपूर्ण सुधार प्राप्त किया जा सके।

Zheng Zhang, Lihe Yang, Tianyu Yang, Chaohui Yu, Yixing Lao, Xiaoyang Guo, Biao Gong, Fan Wang, Hengshuang Zhao2026-06-23
💻 computer science

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

यह शोधपत्र WildBox को प्रस्तुत करता है, जो ड्रोन वीडियो से मोनोकुलर 3D वन्यजीव पहचान (wildlife detection) के लिए एक बड़े पैमाने का डेटासेट और बेंचमार्क है, जो यह प्रकट करता है कि हालांकि ओपन-वोकैबुलरी 2D फाउंडेशन मॉडल अच्छा प्रदर्शन करते हैं, ज़ीरो-शॉट 3D डिटेक्शन गहराई अनुमान (depth estimation) की चुनौतियों के कारण विफल हो जाता है जिसे फाइन-ट्यूनिंग और एक कोर्स-टू-फाइन (coarse-to-fine) करिकुलम लर्निंग रणनीति के माध्यम से काफी हद तक कम किया जा सकता है।

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, De (…)2026-06-23
🤖 machine learning

VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models

यह शोध पत्र VLA-FAIL को प्रस्तुत करता है, जो एक हल्का और व्यापक रूप से लागू होने योग्य ढांचा है जो बिना विफलता डेटा या गणनात्मक रूप से महंगे सैंपलिंग के, फाइन-ट्यून्ड विजन-लैंग्वेज-एक्शन मॉडल्स में कार्य विफलताओं का पता लगाने के लिए लास्ट-लेयर महालनोबिस दूरी और एक्शन चंक निरंतरता को जोड़ता है।

Florian Seligmann, Emiliyan Gospodinov, Enes Ulas Dincer, Gerhard Neumann2026-06-23
💻 computer science

Robot Self-Improvement via Human-Video Dynamics Models

यह शोध पत्र डायनेमिक्स-गाइडेड एक्शन करेक्शन (DGAC) को प्रस्तुत करता है, जो मानव-वीडियो प्रायर्स (human-video priors) का लाभ उठाने वाला एक प्रशिक्षण-मुक्त तरीका है ताकि एम्बॉडीमेंट-अज्ञेय (embodiment-agnostic) मॉडल सीखे जा सकें, जिससे रोबोटों को विफलताओं को स्वायत्त रूप से सुधारने और विभिन्न एम्बॉडीमेंट्स में उनकी हेरफेर सफलता दरों को महत्वपूर्ण रूप से बेहतर बनाने में सक्षम बनाया जा सके।

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger2026-06-23
⚡ electrical engineering

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models

यह शोध पत्र प्रदर्शित करता है कि व्यू-कंडीशन्ड (view-conditioned) 2D डिफ्यूजन मॉडल सिंथेटिक एक्स-रे चित्र उत्पन्न कर सकते हैं जो एनाटॉमिकल लैंडमार्क डिटेक्शन मॉडल्स को प्रशिक्षित करने में सक्षम हैं और वास्तविक इंटरवेंशनल एक्स-रे डेटा के लिए सामान्यीकरण (generalize) करने में वास्तविक छवियों पर प्रशिक्षित मॉडल्स के समान प्रदर्शन प्रदान करते हैं, जो डेटा-सीमित मैकेनिस्टिक सिमुलेशन विधियों के एक आशाजनक विकल्प के रूप में प्रस्तुत होता है।

Sampath Rapuri, Jeremy Ko, Benjamin D. Killeen, Russell H. Taylor, Mathias Unberath2026-06-23
💻 computer science

Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Exploring Query-Based Segmentation and Increased Spatial Context for Outdoor Scene Understanding

यह तकनीकी रिपोर्ट ICRA 2026 GOOSE 2D फाइन-ग्रेन्ड सेमेंटिक सेगमेंटेशन चैलेंज के लिए एक सबमिशन का विवरण देती है जो बड़े ट्रेनिंग क्रॉप्स, क्वेरी-आधारित Mask2Former आर्किटेक्चर में संक्रमण और आउटडोर सीन अंडरस्टैंडिंग को बेहतर बनाने के लिए टेस्ट-टाइम ऑगमेंटेशन के साथ एक SegFormer बेसलाइन को उन्नत करके 69.6% mIoU प्राप्त करता है।

David Pascual-Hernández, Roberto Calvo-Palomino, Inmaculada Mora-Jiménez, Jose María Cañas-Plaza2026-06-23
🤖 machine learning

Native space based pipelines outperform template space based pipeline in subcortical segmentation

यह अध्ययन प्रदर्शित करता है कि पार्किंसंस रोग के सर्जिकल नियोजन के लिए सबथैलेमिक न्यूक्लियस जैसे सबकोर्टिकल संरचनाओं को सेगमेंट करने में नेटिव-स्पेस UNet-आधारित पाइपलाइन, टेम्पलेट-स्पेस दृष्टिकोणों से बेहतर प्रदर्शन करती हैं, हालांकि 7T और 3T MRI डोमेन के बीच प्रदर्शन के अंतर को पाटना एक महत्वपूर्ण चुनौती बना हुआ है।

Tomás Lima, Daniel Novák, Eduard Bakštein2026-06-23
🤖 machine learning

ASCII Art Turns LLMs into VLA Controllers

यह शोध पत्र यह प्रदर्शित करता है कि विज़ुअल ऑब्जर्वेशन को ASCII टेक्स्ट में बदलकर, टेक्स्ट-ओनली लार्ज लैंग्वेज मॉडल्स को भारी मल्टीमॉडल बैकबोन की आवश्यकता के बिना सिमुलेशन और वास्तविक दुनिया के रोबोटिक मैनिपुलेशन में कुशल कार्य नियोजन और निष्पादन हेतु विज़न-लैंग्वेज-एक्शन कंट्रोलर्स में प्रभावी ढंग से अनुकूलित किया जा सकता है।

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom2026-06-23
💻 computer science

Semi-Supervised Vision-Language-Action Model

यह शोध पत्र SemiVLA का प्रस्ताव करता है, जो एक सेल्फ-डिस्टिल्ड टीचर-स्टूडेंट फ्रेमवर्क है जो एक रिलायबिलिटी कंट्रोलर और बॉटलनेक-प्रोजेक्टेड अपडेट्स का लाभ उठाकर अनलेबल ट्रेजेक्टरीज से उच्च गुणवत्ता वाले सूडो-एक्शन्स (pseudo-actions) उत्पन्न करता है, जिससे LIBERO और CALVIN जैसे बेंचमार्क पर न्यूनतम लेबल डेटा के साथ विजन-लैंग्वेज-एक्शन मॉडल्स के सेमी-सुपरवाइज्ड अडैप्टेशन को बढ़ाता है और रोबोट के प्रदर्शन में महत्वपूर्ण सुधार करता है।

Hongyang He, Jiuming Liu, Victor Sanchez2026-06-23
🤖 machine learning

Radial Basis Function Networks as Projection Heads in Self-Supervised Learning

यह शोध पत्र स्व-पर्यवेक्षित शिक्षण (self-supervised learning) में मानक MLP प्रोजेक्शन हेड को रेडियल बेसिस फंक्शन नेटवर्क (RBFN) से बदलने का प्रस्ताव करता है ताकि एक नवीन स्केल-नॉर्मलाइज्ड सेपरेशन (SNS) मीट्रिक के माध्यम से लेबल-मुक्त प्रतिनिधित्व गुणवत्ता का आकलन किया जा सके, जबकि कई आर्किटेक्चर और डेटासेट पर प्रतिस्पर्धी प्रदर्शन बनाए रखा जा सके।

Andreas Schliebitz, Heiko Tapken, Martin Atzmueller2026-06-23