💻 computer science

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI

यह शोध पत्र MICViT को प्रस्तुत करता है, जो एक नवीन 3D विजन ट्रांसफॉर्मर है जो कई MRI मोडैलिटीज को प्रभावी ढंग से एकीकृत करने के लिए स्थानीय और वैश्विक इंट्रा- और क्रॉस-मोडल इंटरैक्शन को स्पष्ट रूप से मॉडल करता है, और बड़े पैमाने पर विषम डेटासेट्स में मौजूदा CNN और ट्रांसफॉर्मर बेसलाइन्स की तुलना में ब्रेन एज प्रेडिक्शन (मस्तिष्क आयु भविष्यवाणी) में बेहतर प्रदर्शन प्रदर्शित करता है।

Minh Duc Do, Tillmann Rheude, Noel Kronenberg, Roland Eils, Benjamin Wild2026-06-26
🤖 AI

Confidence-Aware Tool Orchestration for Robust Video Understanding

यह शोध पत्र Robust-TO को प्रस्तुत करता है, जो एक एजेंटिक वीडियो समझ ढांचा (framework) है जो प्रति-फ्रेम विश्वसनीयता स्कोर को एक एकीकृत टूल ऑर्केस्ट्रेशन सिस्टम में एकीकृत करके "ब्लाइंड ट्रस्ट प्रॉब्लम" को कम करता है, जिससे अत्याधुनिक मॉडलों की तुलना में सटीकता और दृश्य भ्रष्टाचार (visual corruptions) के विरुद्ध मजबूती में महत्वपूर्ण सुधार होता है।

Yangfan He, Yujin Choi, Jaehong Yoon2026-06-26
💻 computer science

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

यह शोध पत्र Qwen-Image-Agent को प्रस्तुत करता है, जो एक एकीकृत एजेंटिक फ्रेमवर्क है जो तर्क, खोज, स्मृति और फीडबैक के माध्यम से गतिशील रूप से योजना बनाने और लुप्त जानकारी को एकत्रित करके वास्तविक दुनिया में इमेज जनरेशन के "कॉन्टेक्स्ट गैप" (संदर्भ अंतराल) को पाटता है, और नए प्रस्तावित Image Agent Bench पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue C (…)2026-06-26
💻 computer science

Neural Texture Compression using Hypernetworks

यह शोध पत्र न्यूरल टेक्चर कम्प्रेशन के लिए एक हाइपरनेटवर्क-आधारित दृष्टिकोण प्रस्तुत करता है जो एकल नेटवर्क को सीधे लेटेंट फीचर्स और डिकोडर वेट्स दोनों आउटपुट करने के लिए प्रशिक्षित करके प्रति-मटेरियल ग्रेडिएंट-डिसेन्ट ऑप्टिमाइज़ेशन की आवश्यकता को समाप्त करता है, जिससे मौजूदा विधियों के तुलनीय गुणवत्ता प्राप्त होती है और मल्टी-डिकोडर इन्फरेंस एवं सुपर-रिज़ॉल्यूशन क्षमताएं सक्षम होती हैं।

Belcour Laurent2026-06-26
💻 computer science

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

माधो (TraMP-LLaMA) एक नवीन मल्टीमॉडल फ्रेमवर्क है जो नव-निर्मित PFED5-plus डेटासेट पर एक डिकपल्ड इंस्ट्रक्शन-ट्यूनिंग रणनीति के माध्यम से चेहरे के भावों की गंभीरता के स्कोर की संयुक्त रूप से भविष्यवाणी करके और संरचित पाठ्य रिपोर्ट उत्पन्न करके पार्किंसंस रोग के मूल्यांकन में व्याख्यात्मकता को बढ़ाता है।

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi2026-06-26
🤖 AI

Scaling Multi-Reference Image Generation with Dynamic Reward Optimization

यह शोध पत्र OmniRef-Bench प्रस्तुत करता है, जो जटिल बहु-संदर्भ (multi-reference) छवि निर्माण में वर्तमान मॉडलों की सीमाओं को उजागर करने वाला एक व्यापक बेंचमार्क है, और DyRef का प्रस्ताव करता है, जो 'डिफिकल्टी-अवेयर एडवांटेज रीवेटिंग' (Difficulty-aware Advantage Reweighting) और 'डिस्क्रिमिनेटिव रिवॉर्ड स्केलिंग' (Discriminative Reward Scaling) का उपयोग करने वाला एक दो-चरणीय प्रशिक्षण ढांचा है जो इन चुनौतीपूर्ण परिदृश्यों में मॉडल के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Wenwang Huang, Yusen Fu, Junjie Wang, Mengfei Huang, Yulin Li, Gan Liu, Jing Cai, Yancheng He, Zhuotao Tian2026-06-26
🤖 AI

Einstein World Models

यह शोध पत्र "आइंस्टीन वर्ल्ड मॉडल्स" का प्रस्ताव करता है, जो एक फ्रेमवर्क है जो एक वर्ल्ड-मॉड्यूल द्वारा जनरेट किए गए विजुअल-टेम्पोरल रोलआउट्स को रीजनिंग ट्रेस के भीतर निरीक्षण योग्य परिकल्पनाओं के रूप में एकीकृत करके LLM तर्क क्षमता को बढ़ाता है, जिससे सिस्टम को भाषा-आधारित विश्लेषण के पूरक के रूप में विजुअल थॉट एक्सपेरिमेंट्स (दृश्य विचार प्रयोग) करने में सक्षम बनाया जा सके।

Munachiso Samuel Nwadike, Zangir Iklassov, Ali Mekky, Zayd M. Kawakibi Zuhri, Kentaro Inui2026-06-26✓ Author reviewed
🤖 machine learning

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

यह शोध पत्र एक नवीन प्रशिक्षण-आधारित ढांचे का प्रस्ताव करता है जो इमेज-टेक्स्ट संरेखण और नियमितीकरण पदों के साथ एक मिश्रित हानि फलन (composite loss function) का उपयोग करके मेडिकल विजुअल क्वेश्चन अनस्विंग (VQA) में मौखिक अनिश्चितता अंशांकन (verbalized uncertainty calibration) को बढ़ाता है, जिससे भविष्य कहने वाली सटीकता को बनाए रखते हुए कई बेंचमार्क और आर्किटेक्चर में अंशांकन त्रुटि में महत्वपूर्ण कमी और भेदभाव में सुधार प्राप्त होता है।

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman2026-06-26
💻 computer science

PanoImager: Geometry-Guided Novel View Synthesis and Reconstruction from Sparse Panoramic Views

PanoImager एक SfM-मुक्त ढांचा है जो फीड-फॉरवर्ड प्रायर्स (priors), ज्योमेट्री-कंडीशन्ड डिफ्यूजन और डेप्थ-गाइडेड 3DGS का लाभ उठाता है ताकि उन विरल पैनोरमिक छवियों से मजबूत 3D पुनर्निर्माण और नवीन दृश्य संश्लेषण (novel view synthesis) प्राप्त किया जा सके जहाँ कमजोर पैरलैक्स के कारण पारंपरिक विधियाँ विफल हो जाती हैं।

Zhisong Xu, Takeshi Oishi2026-06-26
💻 computer science

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

यह शोधपत्र FlameVQA प्रस्तुत करता है, जो UAV-आधारित जंगल की आग की निगरानी के लिए एक नवीन बहुविकल्पीय विजुअल क्वेश्चन अनस्वर्सिंग बेंचमार्क है, जो तापमान-आधारित तर्क को सक्षम करने के लिए युग्मित RGB और रेडियोमेट्रिक थर्मल इमेजरी का लाभ उठाता है, जबकि क्रॉस-मोडल कार्यों में उनकी शक्तियों और धुएं से बाधित पहचान एवं कवरेज अनुमान में उनकी सीमाओं को उजागर करने के लिए वर्तमान मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करता है।

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah2026-06-26