💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

यह शोध पत्र FUSE को प्रस्तुत करता है, जो एक बेयसियन ढांचा (Bayesian framework) है जो आउटपुट की शुद्धता को विश्वसनीय रूप से अनुमानित करने और विजन-लैंग्वेज मॉडल्स में अत्याधुनिक अंशांकन (state-of-the-art calibration) प्राप्त करने के लिए एलीटोरिक एम्बेडिंग-स्तरीय (aleatoric embedding-level) और एपिस्टेमिक मॉडल-स्तरीय (epistemic model-level) अनिश्चितताओं को विश्लेषणात्मक रूप से संलयित (fuse) करके एक स्केलर माप उत्पन्न करता है।

Harry Zhang, Luca Carlone2026-06-16
💻 computer science

Hierarchical GRU with Input-Conditioned Slot Queries for Ball Action Anticipation

यह शोध पत्र SoccerNet बेंचमार्क पर अत्याधुनिक बॉल एक्शन एंटिसिपेशन प्राप्त करने के लिए इनपुट-कंडीशन्ड स्लॉट क्वेरीज़ और फ्रीक्वेंसी-रीवेटेड हंगेरियन मैचिंग से उन्नत एक पदानुक्रमित (hierarchical) GRU मॉडल प्रस्तावित करता है, जो 30 सेकंड की अवलोकन विंडो से भविष्य की क्रियाओं को प्रभावी ढंग से भविष्यवाणी करके 17.91% mAP प्राप्त करता है।

Parthsarthi Rawat2026-06-16
💻 computer science

BBR-Net: Boundary-Balanced Replay for Continual Medical Image Segmentation

यह शोध पत्र BBR-Net का प्रस्ताव करता है, जो मेडिकल इमेज सेगमेंटेशन के लिए एक निरंतर सीखने (continual learning) वाला फ्रेमवर्क है जो शारीरिक संरचनाओं को संरक्षित करने के लिए बाउंड्री-अवेयर और क्लास-बैलेंस्ड रिप्ले का उपयोग करता है, और यह प्रदर्शित करता है कि डोमेन शिफ्ट के तहत ज्ञान प्रतिधारण (knowledge retention) की प्रभावशीलता केवल मेमोरी क्षमता पर नहीं, बल्कि संग्रहीत रिप्ले नमूनों की संरचनात्मक विश्वसनीयता पर महत्वपूर्ण रूप से निर्भर करती है।

Zahid Ullah, Sieun Choi, Jihie Kim2026-06-16
💻 computer science

UtVAA: Ultra-tiny Vision Transformer with Affix Attention for Mobile Image Classification

यह शोध पत्र UtVAA को प्रस्तुत करता है, जो एक नवीन Affix Attention ब्लॉक और Dilated Bottleneck ब्लॉकों वाली एक अल्ट्रा-टाइनी विजन ट्रांसफॉर्मर आर्किटेक्चर है, जो दस लाख से कम पैरामीटर गणना के साथ मोबाइल और एज डिवाइस पर प्रतिस्पर्धी इमेज क्लासिफिकेशन सटीकता प्राप्त करती है।

Romiyal George, Sathiyamohan Nishankar, Selvarajah Thuseethan, Roshan G. Ragel2026-06-16
💻 computer science

GridVQA-X: A Framework for Evaluating Multimodal Explainability Methods

यह शोध पत्र GridVQA-X प्रस्तुत करता है, जो एक नवीन नैदानिक ढांचा (diagnostic framework) है जो मल्टीमॉडल व्याख्यात्मक एआई (Multimodal Explainable AI) विधियों का कठोरता से मूल्यांकन करने के लिए गणितीय रूप से गारंटीकृत सिंथेटिक स्पष्टीकरणों का उपयोग करता है, जिससे यह पता चलता है कि वर्तमान दृष्टिकोण वास्तविक क्रॉस-मोडल तर्क और उथले फीचर-मैचिंग शॉर्टकट्स के बीच अंतर करने में विफल रहते हैं।

Sujay Belsare, Sudarshan Nikhil, Sushant Kumar, Ponnurangam Kumaraguru, Chirag Agarwal2026-06-16
🤖 machine learning

HorusEye: Language as Dynamic Attention for Emergency Visual Analysis

यह शोध पत्र HorusEye पेश करता है, जो आपातकालीन दृश्य विश्लेषण के पांच चरणों में RefCOCO-Degraded डेटासेट पर VLMs का मूल्यांकन करने वाला एक फ्रेमवर्क है, जो यह प्रकट करता है कि भाषाई फीडबैक की प्रभावशीलता मॉडल-निर्भर है और क्रॉपिंग जैसी मानक डिग्रेडेशन शमन रणनीतियां थर्मल इमेजरी में विनाशकारी रूप से विफल हो सकती हैं।

Armel Yara2026-06-16
🤖 AI

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

यह शोध पत्र MMLongEmbed प्रस्तुत करता है, जो लॉन्ग-कॉन्टेक्स्ट परिदृश्यों में मल्टीमॉडल एम्बेडिंग मॉडल्स का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल गहरे अर्थपूर्ण समझ (डीप सिमेंटिक अंडरस्टैंडिंग) के साथ संघर्ष करते हैं और कॉन्टेक्स्ट की लंबाई बढ़ने के साथ प्रदर्शन में महत्वपूर्ण गिरावट प्रदर्शित करते हैं।

Haitian Wang, Ruoxi Sun, Quantong Qiu, Juntao Li, Junhui Li, Hua Chen, Jinxiong Chang, Min Zhang2026-06-16
⚡ electrical engineering

Pixel-TTS: Image based Text Rendering for Robust Text-to-Speech

यह शोध पत्र Pixel-TTS का परिचय देता है, जो एक नवीन ढांचा है जो टेक्स्ट को छवियों के रूप में रेंडर करके दृश्य संकेतों (visual cues) का लाभ उठाने के लिए टेक्स्ट-टू-स्पीच की मजबूती और ज़ीरो-शॉट सामान्यीकरण को बढ़ाता है, जिससे क्रॉस-लिंगुअल अनुकूलन के दौरान एम्बेडिंग मैट्रिक्स विस्तार की आवश्यकता समाप्त हो जाती है।

Adarsh Arigala, Arjun Gangwar, S Umesh, Yova Kementchedjhieva2026-06-16
🤖 AI

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer एक हल्का, मल्टीमॉडल एक्शन टोकेनाइज़र है जो एक एसिमेट्रिक सिमेंटिक रेसिडुअल क्वांटिज़ेशन आर्किटेक्चर और कॉन्ट्रास्टिव प्रीट्रेनिंग को नियोजित करके एक्शन टोकेनाइज़ेशन को एक सिमेंटिक इंटरफ़ेस लर्निंग टास्क के रूप में पुनर्गठित करता है ताकि विजन-लैंग्वेज रीजनिंग को सटीक निरंतर रोबोट नियंत्रण के साथ जोड़ा जा सके, जो सिमुलेशन और वास्तविक दुनिया के लॉन्ग-होरिज़न कार्यों दोनों में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

Xirui Kang, Yanpei Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Danpeng Chen, Xiaoyi Qin, Yinan Zheng, Jinliang Z (…)2026-06-16
🤖 AI

Beyond Self-Attention: Sub-Quadratic Vision Transformers for Fast Image Captioning

यह शोध पत्र इमेज कैप्शनिंग के लिए एक सब-क्वाड्रेटिक विजन ट्रांसफॉर्मर प्रस्तावित करता है जो कम्प्यूटेशनल जटिलता को O(n²) से घटाकर O(nK) करने के लिए मानक सेल्फ-अटेंशन को गॉसियन मिक्सचर मॉडल-आधारित क्लस्टरिंग मैकेनिज्म से बदल देता है और साथ ही फ्लिकर 30K डेटासेट पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।

Chiradeep Ghosh, Dakshina Ranjan Kisku2026-06-16