💻 computer science

MVGS: Multi-view Regulated Gaussian Splatting for Novel View Synthesis

यह शोध पत्र MVGS का प्रस्ताव करता है, जो एक नवीन मल्टी-व्यू रेगुलेटेड गॉसियन स्प्लेटिंग फ्रेमवर्क है जो मल्टी-व्यू ऑप्टिमाइज़ेशन रणनीति, क्रॉस-इंट्रिन्सिक गाइडेंस और एक एडेप्टिव मल्टी-व्यू डेंसिफिकेशन स्कीम को पेश करके सिंगल-व्यू 3DGS ट्रेनिंग की ओवरफिटिंग और ज्यामितीय अशुद्धियों पर काबू पाता है ताकि बेहतर नोवेल व्यू सिंथेसिस और 3D रिकंस्ट्रक्शन प्राप्त किया जा सके।

Xiaobiao Du, Yida Wang, Xin Yu2026-06-29
💻 computer science

Tortho-Gaussian: Splatting True Digital Orthophoto Maps

Ortho-Gaussian एक नवीन विधि है जो उच्च-गुणवत्ता वाले ट्रू डिजिटल ऑर्थोफोटो मैप्स उत्पन्न करने के लिए अनिसोट्रोपिक कर्नेल्स और डिवाइड-एंड-कन्कर रणनीति के साथ 3D गॉसियन स्प्लेटिंग का लाभ उठाती है, जो प्रभावी रूप से सटीक DSMs और ऑक्लूजन डिटेक्शन जैसी पारंपरिक चुनौतियों पर विजय प्राप्त करती है और सीमा सटीकता एवं दृश्य निष्ठा में वाणिज्यिक सॉफ्टवेयर से बेहतर प्रदर्शन करती है।

Xin Wang, Wendi Zhang, Hong Xie, Haibin Ai, Qiangqiang Yuan, Zongqian Zhan2026-06-29
💻 computer science

Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet?

यह शोध पत्र अत्याधुनिक ब्लैक-बॉक्स विजन-लैंग्वेज मॉडल्स का ज़ीरो-शॉट, स्टैंड-अलोन इमेज जियो-लोकलाइज़ेशन सिस्टम के रूप में मूल्यांकन करने वाला पहला व्यवस्थित अध्ययन प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ उनके पास मजबूत कोर्स-लेवल नेविगेशन प्रायर्स हैं, वहीं यथार्थवादी विविधताओं के तहत उनकी फाइन-ग्रेंड लोकलाइज़ेशन सटीकता और निरंतरता काफी कम हो जाती है, जो रोबोटिक परिनियोजन के लिए विश्वसनीयता संबंधी चुनौतियों को उजागर करती है।

Sania Waheed, Bruno Ferrarini, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan2026-06-29
💬 NLP

SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning

यह शोध पत्र SIGNER को प्रस्तुत करता है, जो एक साइन लैंग्वेज जनरेशन फ्रेमवर्क है जो समय-समाधान आधारित कंडीशनिंग (time-resolved conditioning) और टेम्पोरल ग्राउंडिंग को लागू करने के लिए एक स्थानीय टेम्पोरल फ्यूजन मॉड्यूल का उपयोग करके मौजूदा विधियों की सीमाओं को संबोधित करता है, जिससे बेंचमार्क डेटासेट्स पर लेक्सिकल ऑर्डरिंग और सिमेंटिक सटीकता दोनों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Taeryung Lee, Hyeongjin Nam, Gyeongsik Moon, Kyoung Mu Lee2026-06-29
💻 computer science

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

यह शोध पत्र एक हाइब्रिड जियो-लोकलाइजेशन फ्रेमवर्क प्रस्तावित करता है जो विजन-लैंग्वेज मॉडल्स का लाभ उठाकर भौगोलिक पूर्व-सूचनाएं (geographic priors) उत्पन्न करता है और रिट्रीवल-आधारित विजुअल प्लेस रिकग्निशन के लिए खोज स्थान को सीमित करता है, जिससे स्टैंडअलोन VLMs के मतिभ्रम (hallucination) के जोखिमों को कम करते हुए स्ट्रीट और सिटी स्तरों पर अत्याधुनिक सटीकता प्राप्त की जाती है।

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan2026-06-29
🤖 AI

SIDA: Synthetic Image Driven Zero-shot Domain Adaptation

SIDA एक नवीन, कुशल ज़ीरो-शॉट डोमेन अडैप्टेशन विधि है जो टेक्स्ट-ड्रिवन दृष्टिकोणों को सिंथेटिक इमेज जनरेशन और विशिष्ट मॉड्यूल्स (डोमेन मिक्स और पैच स्टाइल ट्रांसफर) से बदल देती है ताकि जटिल वास्तविक दुनिया के स्टाइल वेरिएशन्स को बेहतर ढंग से कैप्चर किया जा सके और अनुकूलन समय को काफी कम करते हुए स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Taewhan Kim, Dong-Jin Kim2026-06-29
🤖 AI

SRMA-Mamba: Spatial Reverse Mamba Attention Network for Pathological Liver Segmentation in MRI Volumes

यह शोध पत्र SRMA-Mamba को प्रस्तुत करता है, जो एक नवीन Mamba-आधारित नेटवर्क है जो MRI वॉल्यूम में अत्याधुनिक 3D पैथोलॉजिकल लिवर सेगमेंटेशन के लिए जटिल स्थानिक संबंधों को प्रभावी ढंग से मॉडल करने और सीमा विवरणों को परिष्कृत करने हेतु एक स्थानिक एनाटॉमी-आधारित Mamba मॉड्यूल और एक स्थानिक रिवर्स Mamba अटेंशन मॉड्यूल का लाभ उठाता है।

Jun Zeng, Quoc-Huy Trinh, Deepak Ranjan Nayak, Nikhil Kumar Tomar, Ulas Bagci, Debesh Jha2026-06-29
💻 computer science

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

यह शोध पत्र टेक्स्ट-टू-साउंडिंग-वीडियो जनरेशन की चुनौतियों को संबोधित करने के लिए टेक्स्ट कंडीशन्स को अलग करने हेतु 'Hierarchical Visual-Grounded Captioning' (HVGC) फ्रेमवर्क और मजबूत सिमेंटिक एवं टेम्पोरल सिंक्रोनाइज़ेशन प्राप्त करने के लिए 'Dual CrossAttention' मैकेनिज्म के साथ 'BridgeDiT' मॉडल का प्रस्ताव करता है, जिसके परिणामस्वरूप कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao2026-06-29
💻 computer science

Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

यह शोध पत्र VLM3D का प्रस्ताव करता है, जो एक सामान्य ढांचा है जो ऑप्टिमाइज़ेशन-आधारित और फीड-फॉरवर्ड दोनों पाइपलाइनों में मोटे तौर पर सेमेंटिक अलाइनमेंट और ज्यामितीय विसंगतियों को संबोधित करके टेक्स्ट-टू-3D जनरेशन को महत्वपूर्ण रूप से सुधारने के लिए बड़े विजन-लैंग्वेज मॉडल्स को डिफरेंशिएबल सेमेंटिक और स्पेशियल क्रिटिक्स के रूप में उपयोग करता है।

Weimin Bai, Yubo Li, Weijian Luo, Zeqiang Lai, Yequan Wang, Wenzheng Chen, He Sun2026-06-29
🤖 machine learning

Complex-Valued 2D Gaussian Representation for Computer-Generated Holography

यह शोध पत्र कंप्यूटर-जनित होलोग्राफी के लिए जटिल-मान वाले (complex-valued) 2D गॉसियन प्रिमिटिव्स का उपयोग करते हुए एक संरचित प्रतिनिधित्व प्रस्तावित करता है, जो स्पेस-फ्रीक्वेंसी अनिश्चितता को न्यूनतम करने के लिए गेबर के सिद्धांत का लाभ उठाता है और पैरामीटर खोज स्थान को महत्वपूर्ण रूप से कम करता है, जिसके परिणामस्वरूप एक डिफरेंशिएबल, GPU-अनुकूलित ढांचा प्राप्त होता है जो मौजूदा विधियों की तुलना में तेज़ अनुकूलन, कम मेमोरी उपयोग और बेहतर छवि गुणवत्ता प्राप्त करता है।

Yicheng Zhan, Xiangjun Gao, Long Quan, Kaan Akşit2026-06-29