🤖 AI

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow एक नवीन फ्यू-स्टेप टेक्स्ट-टू-इमेज जनरेशन फ्रेमवर्क है जो स्टैटिक, ब्लाइंड क्लासिफायर-फ्री गाइडेंस डिस्टिलेशन को इंस्टेंस-अवेयर टारगेट सिलेक्शन और एंट्रॉपी-अवेयर स्ट्रेंथ शेड्यूलिंग वाले ड्यूल-ट्रैक अडैप्टिव मैकेनिज्म से बदलने के लिए इंफॉर्मेशन बॉटलनेक सिद्धांत का लाभ उठाता है, जिससे ओवर-कंडीशनिंग आर्टिफैक्ट्स समाप्त हो जाते हैं और केवल दो स्टेप्स में स्टेट-ऑफ-द-आर्ट फिडेलिटी प्राप्त होती है।

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao2026-07-13
💻 computer science

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

यह शोध पत्र Evita को पेश करता है, जो एक नवीन एकीकृत बैकबोन है जो स्थानिक मिसअलाइनमेंट (spatial misalignment) और मोडैलिटीज के बीच प्रतिनिधित्व संबंधी असमानता (representational disparity) की चुनौतियों को प्रभावी ढंग से संबोधित करते हुए, डेंस RGB-इवेंट पार्सिंग में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए विशिष्ट ज्यामितीय, स्पेक्ट्रल और अटेंशन मॉड्यूल के साथ-साथ एक नए प्रीट्रेनिंग प्रोटोकॉल को एकीकृत करता है।

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li2026-07-13
💻 computer science

What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks

यह शोधपत्र SEAMS को प्रस्तुत करता है, जो एक पर्याप्तता-आधारित (sufficiency-based) सैलिएंसी विधि है जो बिना किसी सहायक डेटासेट या आर्किटेक्चर-विशिष्ट तंत्र की आवश्यकता के, विशिष्ट मॉडल आउटपुट को संरक्षित करने के लिए सॉफ्ट मास्क को सीधे अनुकूलित करके संक्षिप्त और स्थिर व्याख्यात्मक (interpretability) मास्क उत्पन्न करती है।

Magdalena Trędowicz, Łukasz Struski, Arkadiusz Lewicki, Karolina Pachota, Andrzej Grudzień, Mateusz Jagła, Jacek Tabor2026-07-13
⚡ electrical engineering

Joint-Embedding Predictive Architecture for Solar PV Panel Fault Classification

यह शोध पत्र JEFFNet का प्रस्ताव करता है, जो एक पैरामीटर-कुशल मल्टीब्रान्च आर्किटेक्चर है जो विविध डेटासेट्स में थर्मल इन्फ्रारेड सोलर पीवी फॉल्ट वर्गीकरण के लिए अत्याधुनिक सटीकता प्राप्त करने हेतु JEPA-आधारित सेल्फ-सुपरवाइज्ड रिप्रेजेंटेशन लर्निंग को EfficientNetV2-S सुपरवाइज्ड फीचर एक्सट्रैक्शन के साथ जोड़ता है।

Seyyedhamid Azimidokht, Mehdi Monemi, Abdelhak Kharbouch, Farid Hamzehaghdam, Mehdi Rasti, Jamshid Aghaei, Emil Kurvinen2026-07-13
💻 computer science

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Glob3R एक फ्रोजन बैकबोन को एक डेंस मैचिंग हेड के साथ संवर्धित करके 3D फाउंडेशन मॉडल्स को वैश्विक स्ट्रक्चर-फ्रॉम-मोशन के लिए उन्नत करता है ताकि विश्वसनीय मल्टी-व्यू ट्रैक्स उत्पन्न किए जा सकें, जिन्हें फिर विविध और बड़े पैमाने के इमेज सेट्स में मजबूत और सटीक पुनर्निर्माण प्राप्त करने के लिए एक स्केलेबल स्लाइडिंग-विंडो रणनीति और ग्लोबल ऑप्टिमाइज़ेशन के माध्यम से परिष्कृत किया जाता है।

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan2026-07-13
💻 computer science

Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval

यह शोध पत्र साइन-अवेयर हार्ड नेगेटिव माइनिंग (SAN) का प्रस्ताव करता है, जो भाषाई समानता के बजाय दृश्य भ्रमशीलता (visual confusability) के आधार पर हार्ड नेगेटिव्स का निर्माण करके सूक्ष्म-स्तरीय संकेत भाषा पुनर्प्राप्ति (fine-grained sign language retrieval) में सुधार करता है, जिससे इस सीमा को संबोधित किया जाता है कि अर्थ संबंधी विशिष्टता, दृश्य विशिष्टता की गारंटी नहीं देती है।

Junmyeong Lee, Chan Hur, ChangSu Choi, Sukmin Cho, Fitsum Gaim, Eui Jun Hwang, Hoyun Song, KyungTae Lim2026-07-13
💻 computer science

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition

यह शोध पत्र एक गतिशील इनवर्स रेंडरिंग फ्रेमवर्क प्रस्तुत करता है जो सामग्री और प्रकाश व्यवस्था के गुणों को प्रभावी ढंग से अलग करने के लिए कठोर वस्तु गति (rigid object motion) का लाभ उठाता है, जो यह प्रदर्शित करता है कि सिंथेटिक और वास्तविक दुनिया दोनों परिदृश्यों में स्थिर दृश्यों की तुलना में गतिशील वस्तुओं का अवलोकन विघटन सटीकता में महत्वपूर्ण सुधार करता है।

Raza Yunus, Benjamin Ummenhofer, Jan Eric Lenssen, Eddy Ilg2026-07-13
💻 computer science

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

यह शोध पत्र Simon-SR को प्रस्तुत करता है, जो एक सुदृढ़ मल्टी-मोडल सिंगल इमेज सुपर-रिज़ॉल्यूशन फ्रेमवर्क है जो टेक्स्ट और इमेज फीचर्स को प्रभावी ढंग से फ्यूज करने के लिए लर्नबल प्रॉम्प्ट्स और स्पैटियली एडेप्टिव रिफाइनमेंट का उपयोग करता है, जिससे त्रुटिपूर्ण प्रायर्स (erroneous priors) के प्रति संवेदनशीलता को कम करते हुए और एनोटेशन लागत को घटाते हुए अत्याधुनिक प्रदर्शन प्राप्त होता है।

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang2026-07-13
🤖 AI

Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation

यह शोध पत्र BTHA को प्रस्तुत करता है, जो एक बैकबोन-स्थानांतरणीय पदानुक्रमित एडेप्टर ढांचा है जो एक स्थिर फीचर-स्तर के इंटरफेस और एक मोटे-से-सूक्ष्म (coarse-to-fine) पर्यवेक्षण रणनीति के माध्यम से भाषा मार्गदर्शन को विशिष्ट विजन और टेक्स्ट एनकोडर से अलग करता है, जिससे विविध मॉडल आर्किटेक्चर में प्रभावी और कुशल टेक्स्ट-निर्देशित चिकित्सा छवि विभाजन सक्षम होता है।

Yungeng Liu, Xuanzi Fang, Haijin Zeng, Qi Dai, Yongyong Chen2026-07-13
🤖 AI

What VGGT Knows About Overlap: Probing Geometric Foundation Models for Co-Visibility

यह शोध पत्र प्रकट करता है कि VGGT फाउंडेशन मॉडल एक पदानुक्रमित परत विशेषज्ञता (hierarchical layer specialization) के माध्यम से सह-दृश्यता (co-visibility) को अंतर्निहित रूप से एनकोड करता है, जिसका उपयोग लेखक Co-VGGT विकसित करने के लिए करते हैं—जो एक हल्का, परत-वार मिश्रण-विशेषज्ञों वाला क्लासिफायर (layer-wise mixture-of-experts classifier) है जो Co-VisiON बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और डाउनस्ट्रीम 3D पुनर्निर्माण पाइपलाइनों के लिए उपयुक्त सुव्यवस्थित भविष्यवाणियां प्रदान करता है।

Filippo Ziliotto, Luciano Serafini, Lamberto Ballan, Tommaso Campari2026-07-13