⚡ electrical engineering

Accelerating Merge with Motion Vector Difference via Filter Difference Analysis for VVenC

यह शोध पत्र VVenC एनकोडर के लिए एक नवीन फास्ट MMVD एल्गोरिदम का प्रस्ताव करता है जो कोडिंग दक्षता को बनाए रखते हुए कम्प्यूटेशनल जटिलता को महत्वपूर्ण रूप से कम करने के लिए फ्रैक्शनल मोशन वेक्टर फिल्टर डिफरेंस विश्लेषण और कार्यान्वयन अनुकूलन का उपयोग करता है।

Xinmin Feng, Shengyang Xu, Jianhua Chen, Li Li, Dong Liu, Feng Wu2026-07-01
💻 computer science

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

CasaMaestro एक नवीन फीडफॉरवर्ड मॉडल है जो केवल 20 से 50 विरल मल्टी-व्यू इनडोर पैनोरमा से सीधे कैमरा पोज और डेप्थ का अनुमान लगाकर तेज़, मेट्रिक, हाउस-स्केल 3D पुनर्निर्माण को सक्षम बनाता है, जो बड़े आवासीय स्थानों को कवर करने में पारंपरिक पिनहोल-कैमरा पाइपलाइनों की सीमाओं को दूर करता है।

Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang2026-07-01
💻 computer science

Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving

Horizon3D एक नवीन स्पार्स रडार-कैमरा फ्यूजन फ्रेमवर्क है जो गॉसियन प्रिमिटिव्स को स्पार्स BEV फीचर्स के साथ जोड़ता है और TruckScenes डेटासेट पर अत्याधुनिक लॉन्ग-रेंज 3D ऑब्जेक्ट डिटेक्शन प्रदर्शन प्राप्त करने के लिए एक ड्यूल-पाथ टेम्पोरल फ्यूजन रणनीति का उपयोग करता है।

Geonho Bang, Geunju Baek, Dongyoung Lee, Wonjun Jeong, Jun Won Choi2026-07-01
💻 computer science

PiLoT v2: Pixel-to-Orthogonal Map Alignment for Free-view UAV Geo-localization

PiLoT v2 एक हल्का और सुदृढ़ UAV जियो-लोकलाइजेशन सिस्टम है जो भारी 3D मेश रेंडरिंग को TDOMs और DSMs का उपयोग करके कुशल पिक्सेल-टू-ऑर्थोगोनल मैप रजिस्ट्रेशन से बदल देता है, जिसे क्रॉस-व्यू फीचर नेटवर्क और ऑनबोर्ड सेंसर प्रायर्स द्वारा बढ़ाया गया है ताकि GNSS-रहित वातावरण में काफी कम स्टोरेज और कंप्यूटेशनल लागत के साथ रियल-टाइम, ड्रिफ्ट-फ्री प्रदर्शन प्राप्त किया जा सके।

Xinyi Liu, Xiaoya Cheng, Rouwan Wu, Zhaochen Wang, Shen Yan, Maojun Zhang, Yu Liu2026-07-01
💻 computer science

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

इन्फिनीवर्स (InfiniVerse) एक एकीकृत पाइपलाइन है जो एकल फ्रेम से 3D ऑक्यूपेंसी को पुनर्गठित करके, इसे ऑटोरेग्रेसिव रूप से विस्तारित करके, और एक पदानुक्रमित स्केच-एंड-रिफाइन प्रतिमान के माध्यम से इसे परिष्कृत करके जो वीडियो डिफ्यूजन आउटपुट को 3D स्थानिक निरूपणों के साथ संरेखित करता है, स्वायत्त ड्राइविंग के लिए यथार्थवादी, नियंत्रणीय और सामयिक रूप से सुसंगत लंबी दूरी के शहरी दृश्यों को उत्पन्न करता है।

Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui (…)2026-07-01
💻 computer science

WildProp: Visual Estimation of Wildlife Body Proportions at Scale

वाइल्डप्रॉप (WildProp) एक प्रशिक्षण-मुक्त, रिट्रीवल-संचालित ढांचा है जो फाउंडेशन मॉडल फीचर्स और ज्यामितीय निरंतरता का लाभ उठाकर, प्रति-प्रजाति प्रशिक्षण के बिना विविध टैक्सों (taxa) में स्केलेबल मॉर्फोमेट्रिक विश्लेषण सक्षम करने के लिए बड़े पैमाने पर, अनकन्स्ट्रेंड इमेज रिपॉजिटरी से सीधे जनसंख्या-स्तर के वन्यजीव शरीर के अनुपात का अनुमान लगाता है।

Mustafa Chasmai, Aaron Sun, Subhransu Maji2026-07-01
🤖 machine learning

MSNN-LINet: Cross-Modal Learning via Continuous Linear Integration

यह शोध पत्र LINet को प्रस्तुत करता है, जो RGB-D दृश्य वर्गीकरण के लिए एक मल्टी-स्ट्रीम न्यूरल नेटवर्क है जो एक नवीन लीनियर इंटीग्रेशन कनवल्शन ऑपरेटर के माध्यम से निरंतर क्रॉस-मोडल लर्निंग द्वारा विविक्त संलयन (डिस्क्रीट फ्यूजन) को प्रतिस्थापित करता है, और 1/N कांस्टेंट इनिशियलाइज़ेशन एवं प्रोग्रेसिव मोडैलिटी ड्रॉपआउट के माध्यम से इनिशियलाइजेशन और पाथवे कोलैप्स की समस्याओं का समाधान करते हुए SUN RGB-D डेटासेट पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Gabriel Clinger2026-07-01
💻 computer science

FROST: Training-Free Few-Shot Segmentation with Frozen Features and Nonparametric Statistics

FROST रिमोट सेंसिंग के लिए एक ट्रेनिंग-फ्री फ्यू-शॉट सेगमेंटेशन विधि है जो सपोर्ट सेट्स से सीधे क्लास डिस्ट्रीब्यूशंस को मॉडल करने के लिए फ्रोजन DINOv3 फीचर्स और नॉनपैरामीट्रिक डेंसिटी एस्टीमेशन का लाभ उठाती है, जिससे बिना किसी मॉडल ट्यूनिंग के सत्रह बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Junghwan Park2026-07-01
💬 NLP

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround एक प्लग-एंड-प्ले फ्रेमवर्क है जो 3D विजुअल ग्राउंडिंग के लिए, अप्रासंगिक स्थानिक क्षेत्रों को छाँटने के लिए एक फ्रोजन विजन लैंग्वेज मॉडल का उपयोग करके, मल्टी-व्यू रीजनिंग के माध्यम से विवरणों को पुनर्गठित करके, और कम किए गए खोज स्थान के भीतर सटीक स्थानीयकरण के लिए एक स्थानिक LLM का लाभ उठाकर सटीकता और दक्षता में सुधार करता है।

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin2026-07-01
💻 computer science

Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving

यह शोध पत्र 'रीज़निंग-अवेयर स्पेक्युलेटिव डिकोडिंग' का प्रस्ताव करता है, जो फ्लैट-रोपी (FlatRoPE) एम्बेडिंग्स और एक्शन-अवेयर आरएल (Action-aware RL) के साथ एक विशेष "रूटीन रीज़नर" का उपयोग करके स्वायत्त ड्राइविंग के लिए विजन-लैंग्वेज-एक्शन मॉडल्स को त्वरित करता है, जिससे पूर्वानुमानित रीज़निंग स्टेप्स को कुशलतापूर्वक संभालते हुए मूल प्लानर की तुलना में इन्फरेंस लेटेंसी में 4 गुना की कमी आती है।

Anh Dung Dinh, Simon Khan, Flora Salim2026-07-01