💻 computer science

A Geometry-Informed Computer Vision Method for Detecting and Examining Overtaking Vehicles From A Bicycle

यह शोध पत्र एक ज्यामिति-सूचित (geometry-informed) कंप्यूटर विज़न पाइपलाइन प्रस्तुत करता है जो एकल साइकिल-माउंटेड कैमरों से ओवरटेकिंग वाहनों के पता लगाने और विश्लेषण को स्वचालित करता है, जो साइकिलिंग सुरक्षा अनुसंधान में मैनुअल एनोटेशन की बाधाओं को दूर करने के लिए इवेंट पहचान और पार्श्व दूरी अनुमान (lateral distance estimation) में उच्च सटीकता प्राप्त करता है।

Gandhimathi Padmanaban, Rayane Moustafa, Fred Feng2026-06-24
🤖 machine learning

Systematic Exploration of 4-Expert Heterogeneous Mixture-of-Experts via Automated Pipeline Search

यह शोध पत्र LEMUR डेटासेट के भीतर विषम 4-एक्सपर्ट मिक्स्चर-ऑफ-एक्सपर्ट आर्किटेक्चर की खोज के लिए एक स्वचालित पाइपलाइन प्रस्तुत करता है, जो एक महत्वपूर्ण वर्णमाला क्रम संबंधी पूर्वाग्रह (alphabetical enumeration bias) को प्रकट करता है जिसने खोज स्थान को AirNet-केंद्रित संयोजनों तक सीमित कर दिया था, जबकि उच्च-सटीकता वाले एन्सेम्बल्स के लिए ShuffleNet और MobileNetV3 को इष्टतम भागीदारों के रूप में पहचाना।

Yashkumar R Lukhi, Harsh Rameshbhai Moradiya, Radu Timofte, Dmitry Ignatov2026-06-24
💻 computer science

Listening makes Vision Clear for VLMs

यह शोध पत्र प्रॉम्प्ट-विज़न टोकन एक्टिवेशन मैप (PV-TAM) प्रस्तुत करता है, जो एक नवीन मूल्यांकन पद्धति है जो पारंपरिक उत्तर-पक्ष (answer-side) दृष्टिकोणों में निहित डिकोडिंग ड्रिफ्ट और अटेंशन मिसअलाइनमेंट की समस्याओं को संबोधित करके, प्रॉम्प्ट-पक्ष की सिमेंटिक्स का लाभ उठाती है और स्ट्रक्चरल बायस को फ़िल्टर करती है ताकि बड़े VLMs में विज़न-लैंग्वेज कंसिस्टेंसी को अधिक सटीक रूप से मापा जा सके।

Yiyang Chen, Yixin Tan, Binrui Shen2026-06-24
💻 computer science

From Spatial to Spectral: An Efficient, Frequency-Guided Feature Representation Learner for Small Object Detection

यह शोध पत्र DERNet को प्रस्तुत करता है, जो एक आवृत्ति-निर्देशित फीचर प्रतिनिधित्व ढांचा (frequency-guided feature representation framework) है जो एक हल्के डिकंपोज़-एनहांस-रिकंस्ट्रक्ट (Decompose–Enhance–Reconstruct) ऑपरेटर का उपयोग करके लघु वस्तु पहचान (small object detection) को स्थानिक डोमेन से स्पेक्ट्रल डोमेन में स्थानांतरित करता है ताकि महत्वपूर्ण उच्च-आवृत्ति विवरणों को पुनर्प्राप्त किया जा सके, जिससे अत्याधुनिक स्थानिक-डोमेन मॉडलों की तुलना में काफी कम मापदंडों के साथ बेहतर प्रदर्शन प्राप्त होता है।

Yuhan Rui, Shihan Qiao, Yibin Lou, Mingxi Yu, Yutong Wan, Yanqiao Chen, Dongsheng Hou, Zhen Cao, Athena Zhuoming Zhong (…)2026-06-24
💻 computer science

HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models

HANCLIP हाइपरबोलिक ज्योमेट्री और एंगुलर ट्रिपलेट ऑब्जेक्टिव्स का लाभ उठाते हुए विजन-लैंग्वेज मॉडल्स के एक परिवार को पेश करता है जो एक कॉम्पैक्ट ट्रेनिंग फ्रेमवर्क के भीतर स्पष्ट रूप से नेगेशन (नकारात्मकता) को एनकोड करता है, जिससे बड़े पैमाने पर पुन: प्रशिक्षण की आवश्यकता के बिना मानक कार्यों पर प्रदर्शन बनाए रखते हुए NegBench जैसे बेंचमार्क पर नेगेशन संवेदनशीलता में महत्वपूर्ण सुधार होता है।

Hoang-Bao Le, Aiden Durrant, Thai Son Mai, Binh T. Nguyen, Liting Zhou, Cathal Gurrin2026-06-24
💬 NLP

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

यह शोध पत्र एक प्रशिक्षण-मुक्त, विच्छेदित (decoupled) "ग्राउंड देन रैंक" फ्रेमवर्क का प्रस्ताव करता है जो पहले संभावित नामों से संस्थाओं (entities) की पहचान करके और फिर पाठ्य साक्ष्यों को पुन: रैंक करके नॉलेज-बेस्ड विजुअल क्वेश्चन अनसरिंग में सुधार करता है, जो Encyclopedic-VQA और InfoSeek जैसे बेंचमार्क पर जटिल फाइन-ट्यून्ड बेसलाइन से बेहतर प्रदर्शन करता है।

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma2026-06-24
💻 computer science

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

यह शोधपत्र HeRA का प्रस्ताव करता है, जो एक नवीन विधि है जो व्यक्तिगत अटेंशन हेड स्तर पर टोपोलॉजिकल रिप्रेजेंटेशन अलाइनमेंट को लागू करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में सुधार करती है, जिससे यह पता चलता है कि सबसे कम अलाइन्ड हेड्स को लक्षित करने से महत्वपूर्ण प्रदर्शन लाभ प्राप्त होते हैं और विजुअल हैलुसिनेशन कम होते हैं।

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Corn (…)2026-06-24
💻 computer science

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

यह शोध पत्र REALM को प्रस्तुत करता है, जो भौतिक-जगत के विजन-लैंग्वेज मॉडल्स (Vision-Language Models) के लिए पहला एकीकृत रेड-टीमिंग बेंचमार्क है, जो वर्तमान सुरक्षा मूल्यांकनों में बिखराव को दूर करने के लिए एक साझा, भौतिक रूप से आधारित लक्ष्य-निर्माण पाइपलाइन के माध्यम से विविध हमले के तरीकों और सुरक्षा उपायों के मूल्यांकन को मानकीकृत करता है।

Yifei Zhao, Qian Lou, Mengxin Zheng2026-06-24
💻 computer science

DivRL: Disentangled Self-Similarity Rewards for Diverse Subject-Driven Generation

यह शोध पत्र DivRL का प्रस्ताव करता है, जो एक पोस्ट-ट्रेनिंग फ्रेमवर्क है जो स्ट्रक्चरल डायवर्सिटी (संरचनात्मक विविधता) और आइडेंटिटी कंसिस्टेंसी (पहचान की निरंतरता) को संयुक्त रूप से अनुकूलित करने के लिए एक गेटेड कंस्ट्रेंट के साथ "एक्सप्लोर-एंड-सप्रेस" रणनीति का उपयोग करके सब्जेक्ट-ड्रिवन जनरेशन में आइडेंटिटी-डायवर्सिटी विरोधाभास को हल करता है।

Qian Wang, Zhenyu Li, Abdelrahman Eldesokey, Peter Wonka2026-06-24
🧬 biology

3D Masked Autoencoders are Robust Learners of Volumetric and Multimodal Cellular Representations for Microscopy

यह शोध पत्र प्रदर्शित करता है कि 3D मास्क किए गए ऑटोएनकोडर (masked autoencoders), विशेष रूप से जब उन्हें प्रोटीन लैंग्वेज मॉडल्स के साथ क्रॉस-मोडल अलाइनमेंट और विशिष्ट 3D-सचेत आर्किटेक्चरल घटकों के साथ उन्नत किया जाता है, प्रोटीन लोकलाइजेशन और इंटरेक्शन प्रेडिक्शन जैसे सिंगल-सेल माइक्रोस्कोपी कार्यों के लिए मजबूत वॉल्यूमेट्रिक रिप्रजेंटेशन सीखने में 2D-आधारित दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

Amirhossein Kardoost, Lion Gleiter, Tingying Peng, Carsten Marr2026-06-24