💻 computer science

UtVAA: Ultra-tiny Vision Transformer with Affix Attention for Mobile Image Classification

यह शोध पत्र UtVAA को प्रस्तुत करता है, जो एक नवीन Affix Attention ब्लॉक और Dilated Bottleneck ब्लॉकों वाली एक अल्ट्रा-टाइनी विजन ट्रांसफॉर्मर आर्किटेक्चर है, जो दस लाख से कम पैरामीटर गणना के साथ मोबाइल और एज डिवाइस पर प्रतिस्पर्धी इमेज क्लासिफिकेशन सटीकता प्राप्त करती है।

Romiyal George, Sathiyamohan Nishankar, Selvarajah Thuseethan, Roshan G. Ragel2026-06-16
💻 computer science

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

यह शोध पत्र GridVQA-X प्रस्तुत करता है, जो एक नवीन नैदानिक ढांचा (diagnostic framework) है जो मल्टीमॉडल व्याख्यात्मक एआई (Multimodal Explainable AI) विधियों का कठोरता से मूल्यांकन करने के लिए गणितीय रूप से गारंटीकृत सिंथेटिक स्पष्टीकरणों का उपयोग करता है, जिससे यह पता चलता है कि वर्तमान दृष्टिकोण वास्तविक क्रॉस-मोडल तर्क और उथले फीचर-मैचिंग शॉर्टकट्स के बीच अंतर करने में विफल रहते हैं।

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal2026-06-16
🤖 machine learning

HorusEye: Language as Dynamic Attention for Emergency Visual Analysis

यह शोध पत्र HorusEye पेश करता है, जो आपातकालीन दृश्य विश्लेषण के पांच चरणों में RefCOCO-Degraded डेटासेट पर VLMs का मूल्यांकन करने वाला एक फ्रेमवर्क है, जो यह प्रकट करता है कि भाषाई फीडबैक की प्रभावशीलता मॉडल-निर्भर है और क्रॉपिंग जैसी मानक डिग्रेडेशन शमन रणनीतियां थर्मल इमेजरी में विनाशकारी रूप से विफल हो सकती हैं।

Armel Yara2026-06-16
🤖 AI

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

यह शोध पत्र MMLongEmbed प्रस्तुत करता है, जो लॉन्ग-कॉन्टेक्स्ट परिदृश्यों में मल्टीमॉडल एम्बेडिंग मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल गहरे अर्थपूर्ण समझ (डीप सिमेंटिक अंडरस्टैंडिंग) के साथ संघर्ष करते हैं और कॉन्टेक्स्ट की लंबाई बढ़ने के साथ प्रदर्शन में महत्वपूर्ण गिरावट प्रदर्शित करते हैं।

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang2026-06-16
⚡ electrical engineering

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

यह शोध पत्र Pixel-TTS का परिचय देता है, जो एक नवीन ढांचा है जो टेक्स्ट को छवियों के रूप में रेंडर करके दृश्य संकेतों (visual cues) का लाभ उठाने के लिए टेक्स्ट-टू-स्पीच की मजबूती और ज़ीरो-शॉट सामान्यीकरण को बढ़ाता है, जिससे क्रॉस-लिंगुअल अनुकूलन के दौरान एम्बेडिंग मैट्रिक्स विस्तार की आवश्यकता समाप्त हो जाती है।

Adarsh Arigala, Arjun Gangwar, S Umesh, Yova Kementchedjhieva2026-06-16
🤖 AI

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer एक हल्का, मल्टीमॉडल एक्शन टोकेनाइज़र है जो एक एसिमेट्रिक सिमेंटिक रेसिडुअल क्वांटिज़ेशन आर्किटेक्चर और कॉन्ट्रास्टिव प्रीट्रेनिंग को नियोजित करके एक्शन टोकेनाइज़ेशन को एक सिमेंटिक इंटरफ़ेस लर्निंग टास्क के रूप में पुनर्गठित करता है ताकि विजन-लैंग्वेज रीजनिंग को सटीक निरंतर रोबोट नियंत्रण के साथ जोड़ा जा सके, जो सिमुलेशन और वास्तविक दुनिया के लॉन्ग-होरिज़न कार्यों दोनों में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Z (…)2026-06-16
🤖 AI

Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning

यह शोध पत्र इमेज कैप्शनिंग के लिए एक सब-क्वाड्रेटिक विजन ट्रांसफॉर्मर प्रस्तावित करता है जो कम्प्यूटेशनल जटिलता को O(n²) से घटाकर O(nK) करने के लिए मानक सेल्फ-अटेंशन को गॉसियन मिक्सचर मॉडल-आधारित क्लस्टरिंग मैकेनिज्म से बदल देता है और साथ ही फ्लिकर 30K डेटासेट पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Chiradeep Ghosh, Dakshina Ranjan Kisku2026-06-16
🤖 AI

Divide-and-Denoise: A Game-Theoretic Method for Fairly Composing Diffusion Models

यह शोध पत्र 'डिवाइड-एंड-डीनॉइज़' (Divide-and-Denoise) को प्रस्तुत करता है, जो एक गेम-थ्योoretic ढांचा है जो नमूने के क्षेत्रों को प्रत्येक मॉडल की विशेषज्ञता के आधार पर गतिशील रूप से आवंटित करके कई पूर्व-प्रशिक्षित डिफ्यूजन मॉडलों को निष्पक्ष रूप से समन्वित करता है, जिससे संघर्षों का समाधान होता है और मिश्रित छवि निर्माण की गुणवत्ता में सुधार होता है।

Abhi Gupta, Polina Barabanshchikova, Vikas Garg, Samuel Kaski, Tommi Jaakkola2026-06-16
🤖 machine learning

Spatial Priors via Space Filling Curves for Small and Limited Data Vision Transformers

यह शोध पत्र VIOLIN को प्रस्तुत करता है, जो एक हल्का (lightweight) मास्कड अटेंशन मैकेनिज्म है जो विजन ट्रांसफॉर्मर्स में स्पष्ट स्थानिक इंडक्टिव बायस (spatial inductive biases) को इंजेक्ट करने के लिए स्पेस फिलिंग कर्व्स (Space Filling Curves) का लाभ उठाता है, जिससे नगण्य कम्प्यूटेशनल ओवरहेड के साथ छोटे मॉडल और सीमित डेटा वाले परिदृश्यों में प्रदर्शन में उल्लेखनीय वृद्धि होती है।

Leyla Naz Candogan, Arshia Afzal, Pol Puigdemont, Volkan Cevher2026-06-16
🤖 AI

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

यह शोध पत्र एक एकीकृत सैद्धांतिक ढांचे और एक ज्यामितीय हस्तक्षेप जिसे ऑर्थोगोनल सिमेंटिक प्रोजेक्शन (OSP) कहा जाता है, प्रस्तुत करता है ताकि विजन-लैंग्वेज मॉडल स्पष्टीकरणों में सिमेंटिक मतिभ्रम (hallucinations) को गणितीय रूप से समझाने और कम करने के लिए क्वेरी वेक्टर्स को डिस्ट्रैक्टर अवधारणाओं के विरुद्ध ऑर्थोगोनलाइज़ किया जा सके ताकि सुदृढ़ व्याख्यात्मकता सुनिश्चित की जा सके।

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi2026-06-16