💻 computer science

REBASE: Reference-Background Subspace Elimination for Training-Free In-Context Segmentation

REBASE एक प्रशिक्षण-मुक्त (training-free) फ्रेमवर्क है जो लो-रैंक सबस्पेस प्रोजेक्शन के माध्यम से स्प्यूरियस बैकग्राउंड कोरेस्पोंडेंस (spurious background correspondences) को स्पष्ट रूप से समाप्त करके इन-कॉन्टेक्स्ट सेगमेंटेशन में सुधार करता है, जिससे बिना किसी मॉडल रिट्रेनिंग के विभिन्न डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Mantha Sai Gopal, Jaison Saji Chacko, Harsh Nandwana, Sandesh Hegde, Debarshi Banerjee, Uma Mahesh2026-07-13
💻 computer science

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

यह शोध पत्र जनरेटिव ऑडियो-विजुअल मॉडल्स के लिए एक रेफरेंस-फ्री मूल्यांकन ढांचा प्रस्तुत करता है जो जनरेटिव विफलताओं के एक डेटासेट, एक अनुकूलित Omni-LLM और क्रॉस-मोडल सिंक्रोनाइज़ेशन के आकलन के लिए मानव प्राथमिकताओं के साथ अत्याधुनिक संरेखण प्राप्त करने हेतु रियल-वैल्यूड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन का लाभ उठाकर सापेक्ष मानवीय धारणा और पूर्ण स्वचालित मेट्रिक्स के बीच के विरोधाभास को हल करता है।

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang2026-07-13
🤖 AI

IB-Flow: Information Bottleneck-Guided CFG Distillation for Few-Step Text-to-Image Generation

IB-Flow एक नवीन फ्यू-स्टेप टेक्स्ट-टू-इमेज जनरेशन फ्रेमवर्क है जो स्टैटिक, ब्लाइंड क्लासिफायर-फ्री गाइडेंस डिस्टिलेशन को इंस्टेंस-अवेयर टारगेट सिलेक्शन और एंट्रॉपी-अवेयर स्ट्रेंथ शेड्यूलिंग वाले ड्यूल-ट्रैक अडैप्टिव मैकेनिज्म से बदलने के लिए इंफॉर्मेशन बॉटलनेक सिद्धांत का लाभ उठाता है, जिससे ओवर-कंडीशनिंग आर्टिफैक्ट्स समाप्त हो जाते हैं और केवल दो स्टेप्स में स्टेट-ऑफ-द-आर्ट फिडेलिटी प्राप्त होती है।

Yiting Wang, Jingyi Zhang, Wenhu Zhang, Ke Chao, Yves Liang, Kun Cheng, Kang Zhao2026-07-13
💻 computer science

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

यह शोध पत्र Evita को पेश करता है, जो एक नवीन एकीकृत बैकबोन है जो स्थानिक मिसअलाइनमेंट (spatial misalignment) और मोडैलिटीज के बीच प्रतिनिधित्व संबंधी असमानता (representational disparity) की चुनौतियों को प्रभावी ढंग से संबोधित करते हुए, डेंस RGB-इवेंट पार्सिंग में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए विशिष्ट ज्यामितीय, स्पेक्ट्रल और अटेंशन मॉड्यूल के साथ-साथ एक नए प्रीट्रेनिंग प्रोटोकॉल को एकीकृत करता है।

Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li2026-07-13
💻 computer science

What Pixels Are Enough? SEAMS: Sufficiency Saliency via MSE-Preservation Soft-Masks

यह शोधपत्र SEAMS को प्रस्तुत करता है, जो एक पर्याप्तता-आधारित (sufficiency-based) सैलिएंसी विधि है जो बिना किसी सहायक डेटासेट या आर्किटेक्चर-विशिष्ट तंत्र की आवश्यकता के, विशिष्ट मॉडल आउटपुट को संरक्षित करने के लिए सॉफ्ट मास्क को सीधे अनुकूलित करके संक्षिप्त और स्थिर व्याख्यात्मक (interpretability) मास्क उत्पन्न करती है।

Magdalena Trędowicz, Łukasz Struski, Arkadiusz Lewicki, Karolina Pachota, Andrzej Grudzień, Mateusz Jagła, Jacek Tabor2026-07-13
⚡ electrical engineering

Joint-Embedding Predictive Architecture for Solar PV Panel Fault Classification

यह शोध पत्र JEFFNet का प्रस्ताव करता है, जो एक पैरामीटर-कुशल मल्टीब्रान्च आर्किटेक्चर है जो विविध डेटासेट्स में थर्मल इन्फ्रारेड सोलर पीवी फॉल्ट वर्गीकरण के लिए अत्याधुनिक सटीकता प्राप्त करने हेतु JEPA-आधारित सेल्फ-सुपरवाइज्ड रिप्रेजेंटेशन लर्निंग को EfficientNetV2-S सुपरवाइज्ड फीचर एक्सट्रैक्शन के साथ जोड़ता है।

Seyyedhamid Azimidokht, Mehdi Monemi, Abdelhak Kharbouch, Farid Hamzehaghdam, Mehdi Rasti, Jamshid Aghaei, Emil Kurvinen2026-07-13
💻 computer science

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Glob3R एक फ्रोजन बैकबोन को एक डेंस मैचिंग हेड के साथ संवर्धित करके 3D फाउंडेशन मॉडल्स को वैश्विक स्ट्रक्चर-फ्रॉम-मोशन के लिए उन्नत करता है ताकि विश्वसनीय मल्टी-व्यू ट्रैक्स उत्पन्न किए जा सकें, जिन्हें फिर विविध और बड़े पैमाने के इमेज सेट्स में मजबूत और सटीक पुनर्निर्माण प्राप्त करने के लिए एक स्केलेबल स्लाइडिंग-विंडो रणनीति और ग्लोबल ऑप्टिमाइज़ेशन के माध्यम से परिष्कृत किया जाता है।

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan2026-07-13
💻 computer science

Semantic Hardness Is Not Visual Hardness: Sign-Aware Hard Negative Mining for Sign Language Retrieval

यह शोध पत्र साइन-अवेयर हार्ड नेगेटिव माइनिंग (SAN) का प्रस्ताव करता है, जो भाषाई समानता के बजाय दृश्य भ्रमशीलता (visual confusability) के आधार पर हार्ड नेगेटिव्स का निर्माण करके सूक्ष्म-स्तरीय संकेत भाषा पुनर्प्राप्ति (fine-grained sign language retrieval) में सुधार करता है, जिससे इस सीमा को संबोधित किया जाता है कि अर्थ संबंधी विशिष्टता, दृश्य विशिष्टता की गारंटी नहीं देती है।

Junmyeong Lee, Chan Hur, ChangSu Choi, Sukmin Cho, Fitsum Gaim, Eui Jun Hwang, Hoyun Song, KyungTae Lim2026-07-13
💻 computer science

Dynamic Inverse Rendering for Enhanced Material-Lighting Decomposition

यह शोध पत्र एक गतिशील इनवर्स रेंडरिंग फ्रेमवर्क प्रस्तुत करता है जो सामग्री और प्रकाश व्यवस्था के गुणों को प्रभावी ढंग से अलग करने के लिए कठोर वस्तु गति (rigid object motion) का लाभ उठाता है, जो यह प्रदर्शित करता है कि सिंथेटिक और वास्तविक दुनिया दोनों परिदृश्यों में स्थिर दृश्यों की तुलना में गतिशील वस्तुओं का अवलोकन विघटन सटीकता में महत्वपूर्ण सुधार करता है।

Raza Yunus, Benjamin Ummenhofer, Jan Eric Lenssen, Eddy Ilg2026-07-13
💻 computer science

Simon-SR: Spatially Adaptive Modulation and Visual Prompt Adaptation for Text-Reinforced Super-Resolution

यह शोध पत्र Simon-SR को प्रस्तुत करता है, जो एक सुदृढ़ मल्टी-मोडल सिंगल इमेज सुपर-रिज़ॉल्यूशन फ्रेमवर्क है जो टेक्स्ट और इमेज फीचर्स को प्रभावी ढंग से फ्यूज करने के लिए लर्नबल प्रॉम्प्ट्स और स्पैटियली एडेप्टिव रिफाइनमेंट का उपयोग करता है, जिससे त्रुटिपूर्ण प्रायर्स (erroneous priors) के प्रति संवेदनशीलता को कम करते हुए और एनोटेशन लागत को घटाते हुए अत्याधुनिक प्रदर्शन प्राप्त होता है।

Haotong Cheng, Yuxuan Li, Zijie Cui, Rongling Tan, Chenyuan Wang2026-07-13