💬 NLP

Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models

यह शोध पत्र एक एकीकृत ढांचे का प्रस्ताव करता है जो विज़ुअल-टोकन रिप्रजेंटेशन और प्रॉम्प्ट-कंडीशन्ड हिडन स्टेट्स से प्री-जनरेशन सिग्नल्स का उपयोग करके यह अनुमान लगाने और अलग करने के लिए है कि विज़न-लैंग्वेज मॉडल की त्रुटियां धारणा/पहचान संबंधी बाधाओं (perception/recognition bottlenecks) से उत्पन्न होती हैं या ज्ञान प्राप्ति की विफलताओं (knowledge retrieval failures) से, जिससे उत्तर जनरेशन से पहले लक्षित हस्तक्षेप सक्षम हो सके।

Khang Nhat Hoang Vo, Artem Vazhentsev, Artem Shelmanov, Timothy Baldwin, Yova Kementchedjhieva2026-07-13
💻 computer science

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

यह शोध पत्र GReFEM को प्रस्तुत करता है, जो एक ज़ीरो-शॉट फ्रेमवर्क है जो भौतिकी-निर्देशित परिशोधन (physics-guided refinement) के लिए 3D मेश में तनाव-महत्वपूर्ण क्षेत्रों को सटीक रूप से स्थानीयकृत करने हेतु orthoViews मॉड्यूल के साथ मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो बिना किसी कार्य-विशिष्ट प्रशिक्षण के पारंपरिक ज्यामितीय ह्यूरिस्टिक्स की तुलना में बेहतर सटीकता प्रदर्शित करता है।

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin2026-07-13
💻 computer science

Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing

यह शोध पत्र Mixture of Probes (MoP) को प्रस्तुत करता है, जो एक नया ढांचा है जो केवल प्रशिक्षण के दौरान उपलब्ध विशेषाधिकार प्राप्त मोडालिटीज़ का लाभ उठाकर, संरचित प्रोबिंग और एक विशेष क्रॉस-मोडल प्रशिक्षण रणनीति के माध्यम से मोडालिटी-विशिष्ट और सामान्य संकेतों को अलग करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को महत्वपूर्ण रूप से उन्नत करता है, जिससे अनुमान (inference) के समय सहायक मोडालिटीज़ की अनुपस्थिति में भी पर्याप्त प्रदर्शन लाभ प्राप्त होता है।

Dominick Reilly, Qiyu Wu, Hiromi Wakaki, Srijan Das, Yuki Mistufuji2026-07-13
💻 computer science

Secure-by-Disguise: A Systematic Evaluation of Image Disguising for Confidential Medical Image Modeling

यह शोध पत्र गोपनीय चिकित्सा एआई के लिए इमेज डिसगाइजिंग (छवि छिपाने की) विधियों का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि जबकि ये गोपनीयता-बढ़ाने वाली तकनीकें वर्गीकरण कार्यों के लिए उपयोगिता को प्रभावी ढंग से संरक्षित करती हैं, वे सिमेंटिक सेगमेंटेशन में प्रदर्शन को महत्वपूर्ण रूप से कम कर देती हैं, जिसमें रैंडमाइज्ड मल्टीडायमेंशनल ट्रांसफॉर्मेशन (RMT) सुरक्षा और कार्यक्षमता के बीच सर्वोत्तम संतुलन प्रदान करता है।

Jason Rojas, Jiajie He, Yash Patel, Yuechun Gu, Zeyun Yu, Keke Chen2026-07-13
💻 computer science

HAT Super-Resolution and a PARSeq+CLIP4STR Voting Ensemble for Extreme In-the-Wild License Plate Recognition

यह शोध पत्र ICIP 2026 XLPSR चुनौती के लिए एक लाइसेंस प्लेट पहचान प्रणाली प्रस्तुत करता है जो सख्त अनुमान समय बाधाओं का पालन करते हुए 9.73 wECR स्कोर प्राप्त करने के लिए HAT सुपर-रिज़ॉल्यूशन को PARSeq और CLIP4STR वोटिंग एन्सेम्बल के साथ जोड़ता है।

Karthik Sivarama Krishnan, Koushik Sivarama Krishnan2026-07-13
💻 computer science

Is sub-metre resolution necessary for cocoa mapping? A landscape-stratified evaluation of very high resolution imagery, decametric Earth Observation inputs, and operational products in Cote d'Ivoire

यह अध्ययन विविध परिदृश्यों में कोको मैपिंग का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ अत्यंत उच्च-रिज़ॉल्यूशन वाली इमेजरी उच्चतम सटीकता प्रदान करती है और जटिल, खंडित क्षेत्रों में विशेष रूप से लाभकारी है, वहीं डेकामेट्रिक डेटा से प्राप्त फाउंडेशन-मॉडल एम्बेडिंग एक स्केलेबल विकल्प प्रदान करती है जो मानक सेंटिनल-2 इनपुट और मौजूदा परिचालन उत्पादों की तुलना में काफी बेहतर प्रदर्शन करती है।

Kasimir Orlowski, Filip Sabo, Michele Meroni, Astrid Verhegghen, Mariana Belgiu, Felix Rembold2026-07-13
🤖 AI

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

यह शोध पत्र MultiView-Bench प्रस्तुत करता है, जो एक नैदानिक बेंचमार्क है जो यह प्रकट करता है कि अत्याधुनिक विजन-लैंग्वेज मॉडल मल्टी-व्यू अवलोकनों को एक सुसंगत विश्व-केंद्रित 3D मॉडल में एकीकृत करने में संघर्ष करते हैं, और ViewNavigator प्रस्तावित करता है, जो एक मल्टी-एजेंट फ्रेमवर्क है जो सूचनात्मक दृष्टिकोणों को सक्रिय रूप से चुनने और संलयित करने द्वारा प्रदर्शन में महत्वपूर्ण सुधार करता है।

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang2026-07-13
🤖 AI

Video Generation Models are General-Purpose Vision Learners

यह शोध पत्र GenCeption का प्रस्ताव करता है, जो एक प्री-ट्रेंड टेक्स्ट-टू-वीडियो डिफ्यूजन बैकबोन पर निर्मित एक फीड-फॉरवर्ड परसेप्शन मॉडल है, जो यह प्रदर्शित करता है कि बड़े पैमाने पर वीडियो जनरेशन, विविध कंप्यूटर विज़न कार्यों में अत्याधुनिक, डेटा-कुशल और सामान्य-उद्देश्य वाली दृश्य बुद्धिमत्ता प्राप्त करने के लिए एक श्रेष्ठ प्री-ट्रेनिंग प्रतिमान के रूप में कार्य करता है।

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He (…)2026-07-13
🤖 AI

On Locality and Length Generalization in Visual Reasoning

यह शोध पत्र यह प्रदर्शित करता है कि जबकि मानक वैश्विक विज़न मॉडल अक्सर शॉर्टकट का लाभ उठाकर कार्य जटिलता के बीच सामान्यीकरण करने में विफल रहते हैं, कड़ाई से स्थानीय धारणा पर आधारित आवर्ती नीतियां (recurrent policies) इन सीमाओं को पार करने और सुदृढ़ संरचनात्मक सामान्यीकरण (compositional generalization) प्राप्त करने में सक्षम हैं, जो यह सुझाव देता है कि दृश्य तर्क के लिए स्थानीय ध्यान (local attention) आवश्यक है।

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic2026-07-13
🤖 AI

OmniMapBench: Benchmarking Visual-Centric Reasoning on Diverse Map Documents

OmniMapBench एक नया बेंचमार्क है जिसमें विविध मानचित्र दस्तावेजों में से 2,000 से अधिक मैन्युअल रूप से एनोटेट किए गए प्रश्न-उत्तर जोड़े शामिल हैं, जिसे विजुअल डिपेंडेंसी इंडेक्स को पेश करके अपरिहार्य विजुअल ग्राउंडिंग को मापने और लार्ज विजन-लैंग्वेज मॉडल्स में विजुअल-केंद्रित तर्क को विकसित करने और मूल्यांकन करने के लिए डिज़ाइन किया गया है।

Yang Chen, Yunwen Li, Yufan Shen, Minghao Liu, Tianyu Zheng, Bin Fu, Qunshu Lin, Zhi Yu, Botian Shi2026-07-13