💻 computer science

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

यह शोध पत्र Mixture of Probes (MoP) को प्रस्तुत करता है, जो एक नया ढांचा है जो केवल प्रशिक्षण के दौरान उपलब्ध विशेषाधिकार प्राप्त मोडालिटीज़ का लाभ उठाकर, संरचित प्रोबिंग और एक विशेष क्रॉस-मोडल प्रशिक्षण रणनीति के माध्यम से मोडालिटी-विशिष्ट और सामान्य संकेतों को अलग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को महत्वपूर्ण रूप से उन्नत करता है, जिससे अनुमान (inference) के समय सहायक मोडालिटीज़ की अनुपस्थिति में भी पर्याप्त प्रदर्शन लाभ प्राप्त होता है।

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji2026-07-13
💻 computer science

Secure-by-Disguise: A Systematic Evaluation of Image Disguising for Confidential Medical Image Modeling

यह शोध पत्र गोपनीय चिकित्सा एआई के लिए इमेज डिसगाइजिंग (छवि छिपाने की) विधियों का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि ये गोपनीयता-बढ़ाने वाली तकनीकें वर्गीकरण कार्यों के लिए उपयोगिता को प्रभावी ढंग से संरक्षित करती हैं, वे सिमेंटिक सेगमेंटेशन में प्रदर्शन को महत्वपूर्ण रूप से कम कर देती हैं, जिसमें रैंडमाइज्ड मल्टीडायमेंशनल ट्रांसफॉर्मेशन (RMT) सुरक्षा और कार्यक्षमता के बीच सर्वोत्तम संतुलन प्रदान करता है।

Jason Rojas, Jiajie He, Yash Patel, Yuechun Gu, Zeyun Yu, Keke Chen2026-07-13
💻 computer science

HAT Super-Resolution and a PARSeq+CLIP4STR Voting Ensemble for Extreme In-the-Wild License Plate Recognition

यह शोध पत्र ICIP 2026 XLPSR चुनौती के लिए एक लाइसेंस प्लेट पहचान प्रणाली प्रस्तुत करता है जो सख्त अनुमान समय बाधाओं का पालन करते हुए 9.73 wECR स्कोर प्राप्त करने के लिए HAT सुपर-रिज़ॉल्यूशन को PARSeq और CLIP4STR वोटिंग एन्सेम्बल के साथ जोड़ता है।

Karthik Sivarama Krishnan, Koushik Sivarama Krishnan2026-07-13
💻 computer science

Is sub-metre resolution necessary for cocoa mapping? A landscape-stratified evaluation of very high resolution imagery, decametric Earth Observation inputs, and operational products in Cote d'Ivoire

यह अध्ययन विविध परिदृश्यों में कोको मैपिंग का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ अत्यंत उच्च-रिज़ॉल्यूशन वाली इमेजरी उच्चतम सटीकता प्रदान करती है और जटिल, खंडित क्षेत्रों में विशेष रूप से लाभकारी है, वहीं डेकामेट्रिक डेटा से प्राप्त फाउंडेशन-मॉडल एम्बेडिंग एक स्केलेबल विकल्प प्रदान करती है जो मानक सेंटिनल-2 इनपुट और मौजूदा परिचालन उत्पादों की तुलना में काफी बेहतर प्रदर्शन करती है।

Kasimir Orlowski, Filip Sabo, Michele Meroni, Astrid Verhegghen, Mariana Belgiu, Felix Rembold2026-07-13
🤖 AI

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

यह शोध पत्र MultiView-Bench प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक विजन-लैंग्वेज मॉडल मल्टी-व्यू अवलोकनों को एक सुसंगत विश्व-केंद्रित 3D मॉडल में एकीकृत करने में संघर्ष करते हैं, और ViewNavigator प्रस्तावित करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो सूचनात्मक दृष्टिकोणों को सक्रिय रूप से चुनने और संलयित करने द्वारा प्रदर्शन में महत्वपूर्ण सुधार करता है।

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang2026-07-13
🤖 AI

Video Generation Models are General-Purpose Vision Learners

यह शोध पत्र GenCeption का प्रस्ताव करता है, जो एक प्री-ट्रेंड टेक्स्ट-टू-वीडियो डिफ्यूजन बैकबोन पर निर्मित एक फीड-फॉरवर्ड परसेप्शन मॉडल है, जो यह प्रदर्शित करता है कि बड़े पैमाने पर वीडियो जनरेशन, विविध कंप्यूटर विज़न कार्यों में अत्याधुनिक, डेटा-कुशल और सामान्य-उद्देश्य वाली दृश्य बुद्धिमत्ता प्राप्त करने के लिए एक श्रेष्ठ प्री-ट्रेनिंग प्रतिमान के रूप में कार्य करता है।

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He (…)2026-07-13
🤖 AI

On Locality and Length Generalization in Visual Reasoning

यह शोध पत्र यह प्रदर्शित करता है कि जबकि मानक वैश्विक विज़न मॉडल अक्सर शॉर्टकट का लाभ उठाकर कार्य जटिलता के बीच सामान्यीकरण करने में विफल रहते हैं, कड़ाई से स्थानीय धारणा पर आधारित आवर्ती नीतियां (recurrent policies) इन सीमाओं को पार करने और सुदृढ़ संरचनात्मक सामान्यीकरण (compositional generalization) प्राप्त करने में सक्षम हैं, जो यह सुझाव देता है कि दृश्य तर्क के लिए स्थानीय ध्यान (local attention) आवश्यक है।

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic2026-07-13
🤖 AI

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

OmniMapBench एक नया बेंचमार्क है जिसमें विविध मानचित्र दस्तावेजों में से 2,000 से अधिक मैन्युअल रूप से एनोटेट किए गए प्रश्न-उत्तर जोड़े शामिल हैं, जिसे विजुअल डिपेंडेंसी इंडेक्स को पेश करके अपरिहार्य विजुअल ग्राउंडिंग को मापने और लार्ज विजन-लैंग्वेज मॉडल्स में विजुअल-केंद्रित तर्क को विकसित करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi2026-07-13
💻 computer science

REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

REBASE एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो लो-रैंक सबस्पेस प्रोजेक्शन के माध्यम से स्प्यूरियस बैकग्राउंड कोरेस्पोंडेंस (spurious background correspondences) को स्पष्ट रूप से समाप्त करके इन-कॉन्टेक्स्ट सेगमेंटेशन में सुधार करता है, जिससे बिना किसी मॉडल रिट्रेनिंग के विभिन्न डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee, Uma Mahesh2026-07-13
💻 computer science

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

यह शोध पत्र जनरेटिव ऑडियो-विजुअल मॉडल्स के लिए एक रेफरेंस-फ्री मूल्यांकन ढांचा प्रस्तुत करता है जो जनरेटिव विफलताओं के एक डेटासेट, एक अनुकूलित Omni-LLM और क्रॉस-मोडल सिंक्रोनाइज़ेशन के आकलन के लिए मानव प्राथमिकताओं के साथ अत्याधुनिक संरेखण प्राप्त करने हेतु रियल-वैल्यूड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का लाभ उठाकर सापेक्ष मानवीय धारणा और पूर्ण स्वचालित मेट्रिक्स के बीच के विरोधाभास को हल करता है।

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang2026-07-13