💻 computer science

GENA3D: Generative Amodal 3D Modeling by Bridging 2D Priors and 3D Coherence

GENA3D एक अभिनव ढांचा है जो विशेष ध्यान तंत्रों (specialized attention mechanisms) के माध्यम से 2D जनरेटिव प्रायर्स और स्पष्ट 3D ज्यामितीय तर्क के बीच सेतु बनाता है ताकि आंशिक रूप से बाधित अवलोकनों से पूर्ण, सुसंगत और विश्वसनीय 3D वस्तुओं को उत्पन्न किया जा सके।

Junwei Zhou, Yu-Wing Tai2026-06-24
💻 computer science

EchoFoley: Event-Centric Hierarchical Control for Video Grounded Creative Sound Generation

मौजूदा वीडियो-टेक्स्ट-टू-ऑडियो मॉडलों की प्रमुख सीमाओं को दूर करने के लिए, यह शोध पत्र इकोफ़ोली (EchoFoley) पेश करता है, जो पदानुक्रमित नियंत्रण (hierarchical control) के साथ एक नया इवेंट-केंद्रित कार्य है, जिसे इकोफ़ोली-6k (EchoFoley-6k) बेंचमार्क और इकोविडिया (EchoVidia) फ्रेमवर्क द्वारा समर्थित किया गया है, जो वीडियो-आधारित ध्वनि निर्माण में नियंत्रणीयता और संवेदी गुणवत्ता दोनों में महत्वपूर्ण सुधार करता है।

Bingxuan Li, Yiming Cui, Yicheng He, Yiwei Wang, Shu Zhang, Longyin Wen, Yulei Niu2026-06-24
💻 computer science

A Geometry-Informed Computer Vision Method for Detecting and Examining Overtaking Vehicles From A Bicycle

यह शोध पत्र एक ज्यामिति-सूचित (geometry-informed) कंप्यूटर विज़न पाइपलाइन प्रस्तुत करता है जो एकल साइकिल-माउंटेड कैमरों से ओवरटेकिंग वाहनों के पता लगाने और विश्लेषण को स्वचालित करता है, जो साइकिलिंग सुरक्षा अनुसंधान में मैनुअल एनोटेशन की बाधाओं को दूर करने के लिए इवेंट पहचान और पार्श्व दूरी अनुमान (lateral distance estimation) में उच्च सटीकता प्राप्त करता है।

Gandhimathi Padmanaban, Rayane Moustafa, Fred Feng2026-06-24
🤖 machine learning

Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search

यह शोध पत्र LEMUR डेटासेट के भीतर विषम 4-एक्सपर्ट मिक्स्चर-ऑफ-एक्सपर्ट आर्किटेक्चर की खोज के लिए एक स्वचालित पाइपलाइन प्रस्तुत करता है, जो एक महत्वपूर्ण वर्णमाला क्रम संबंधी पूर्वाग्रह (alphabetical enumeration bias) को प्रकट करता है जिसने खोज स्थान को AirNet-केंद्रित संयोजनों तक सीमित कर दिया था, जबकि उच्च-सटीकता वाले एन्सेम्बल्स के लिए ShuffleNet और MobileNetV3 को इष्टतम भागीदारों के रूप में पहचाना।

Yashkumar R Lukhi, Harsh Rameshbhai Moradiya, Radu Timofte, Dmitry Ignatov2026-06-24
💻 computer science

Listening makes Vision Clear for VLMs

यह शोध पत्र प्रॉम्प्ट-विज़न टोकन एक्टिवेशन मैप (PV-TAM) प्रस्तुत करता है, जो एक नवीन मूल्यांकन पद्धति है जो पारंपरिक उत्तर-पक्ष (answer-side) दृष्टिकोणों में निहित डिकोडिंग ड्रिफ्ट और अटेंशन मिसअलाइनमेंट की समस्याओं को संबोधित करके, प्रॉम्प्ट-पक्ष की सिमेंटिक्स का लाभ उठाती है और स्ट्रक्चरल बायस को फ़िल्टर करती है ताकि बड़े VLMs में विज़न-लैंग्वेज कंसिस्टेंसी को अधिक सटीक रूप से मापा जा सके।

Yiyang Chen, Yixin Tan, Binrui Shen2026-06-24
💻 computer science

From Spatial to Spectral: An Efficient, Frequency-Guided Feature Representation Learner for Small Object Detection

यह शोध पत्र DERNet को प्रस्तुत करता है, जो एक आवृत्ति-निर्देशित फीचर प्रतिनिधित्व ढांचा (frequency-guided feature representation framework) है जो एक हल्के डिकंपोज़-एनहांस-रिकंस्ट्रक्ट (Decompose–Enhance–Reconstruct) ऑपरेटर का उपयोग करके लघु वस्तु पहचान (small object detection) को स्थानिक डोमेन से स्पेक्ट्रल डोमेन में स्थानांतरित करता है ताकि महत्वपूर्ण उच्च-आवृत्ति विवरणों को पुनर्प्राप्त किया जा सके, जिससे अत्याधुनिक स्थानिक-डोमेन मॉडलों की तुलना में काफी कम मापदंडों के साथ बेहतर प्रदर्शन प्राप्त होता है।

Yuhan Rui, Shihan Qiao, Yibin Lou, Mingxi Yu, Yutong Wan, Yanqiao Chen, Dongsheng Hou, Zhen Cao, Athena Zhuoming Zhong (…)2026-06-24
💻 computer science

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

HANCLIP हाइपरबोलिक ज्योमेट्री और एंगुलर ट्रिपलेट ऑब्जेक्टिव्स का लाभ उठाते हुए विजन-लैंग्वेज मॉडल्स के एक परिवार को पेश करता है जो एक कॉम्पैक्ट ट्रेनिंग फ्रेमवर्क के भीतर स्पष्ट रूप से नेगेशन (नकारात्मकता) को एनकोड करता है, जिससे बड़े पैमाने पर पुन: प्रशिक्षण की आवश्यकता के बिना मानक कार्यों पर प्रदर्शन बनाए रखते हुए NegBench जैसे बेंचमार्क पर नेगेशन संवेदनशीलता में महत्वपूर्ण सुधार होता है।

Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin2026-06-24
💬 NLP

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

यह शोध पत्र एक प्रशिक्षण-मुक्त, विच्छेदित (decoupled) "ग्राउंड देन रैंक" फ्रेमवर्क का प्रस्ताव करता है जो पहले संभावित नामों से संस्थाओं (entities) की पहचान करके और फिर पाठ्य साक्ष्यों को पुन: रैंक करके नॉलेज-बेस्ड विजुअल क्वेश्चन अनसरिंग में सुधार करता है, जो Encyclopedic-VQA और InfoSeek जैसे बेंचमार्क पर जटिल फाइन-ट्यून्ड बेसलाइन से बेहतर प्रदर्शन करता है।

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma2026-06-24
💻 computer science

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

यह शोधपत्र HeRA का प्रस्ताव करता है, जो एक नवीन विधि है जो व्यक्तिगत अटेंशन हेड स्तर पर टोपोलॉजिकल रिप्रेजेंटेशन अलाइनमेंट को लागू करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सुधार करती है, जिससे यह पता चलता है कि सबसे कम अलाइन्ड हेड्स को लक्षित करने से महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं और विजुअल हैलुसिनेशन कम होते हैं।

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Corn (…)2026-06-24
💻 computer science

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

यह शोध पत्र REALM को प्रस्तुत करता है, जो भौतिक-जगत के विजन-लैंग्वेज मॉडल्स (Vision-Language Models) के लिए पहला एकीकृत रेड-टीमिंग बेंचमार्क है, जो वर्तमान सुरक्षा मूल्यांकनों में बिखराव को दूर करने के लिए एक साझा, भौतिक रूप से आधारित लक्ष्य-निर्माण पाइपलाइन के माध्यम से विविध हमले के तरीकों और सुरक्षा उपायों के मूल्यांकन को मानकीकृत करता है।

Yifei Zhao, Qian Lou, Mengxin Zheng2026-06-24