⚡ electrical engineering

Fortifying Fully Convolutional Generative Adversarial Networks for Image Super-Resolution Using Divergence Measures

यह शोध पत्र SuRGe को प्रस्तुत करता है, जो इमेज सुपर-रिज़ॉल्यूशन के लिए एक पूर्णतः कनवल्शनल GAN-आधारित आर्किटेक्चर है, जो मल्टी-डेप्थ फीचर्स को सीखने योग्य वेट्स (learnable weights) के साथ संयोजित करके और विशिष्ट डाइवर्जेंस मापों (जेन्सन-शैनन, ग्रोमोव-वासरस्टीन, और ग्रेडिएंट पेनल्टी के साथ वासरस्टीन) का उपयोग करके प्रदर्शन को बढ़ाता है, जिससे 28 अत्याधुनिक तरीकों की तुलना में 10 बेंचमार्क डेटासेट पर बेहतर परिणाम प्राप्त होते हैं।

Arkaprabha Basu, Kushal Bose, Sankha Subhra Mullick, Anish Chakrabarty, Swagatam Das2026-07-07
🤖 machine learning

Explainable Concept Generation through Vision-Language Preference Learning for Understanding Neural Networks' Internal Representations

यह शोध पत्र एक सुदृढीकरण शिक्षण-आधारित प्राथमिकता अनुकूलन (RLPO) एल्गोरिदम प्रस्तावित करता है जो पाठ्य विवरणों से अवधारणा छवि सेटों के निर्माण को स्वचालित करता है, जिससे न्यूरल नेटवर्क के आंतरिक निरूपणों की व्याख्या करने में मैनुअल अवधारणा संग्रह की श्रमसाध्य और त्रुटिपूर्ण सीमाओं को दूर किया जा सके।

Aditya Taparia, Som Sagar, Ransalu Senanayake2026-07-07
🧬 biology

Cell as Point: One-Stage Framework for Efficient Cell Tracking

यह शोध पत्र CAP को प्रस्तुत करता है, जो एक कुशल एंड-टू-एंड वन-स्टेज सेल ट्रैकिंग फ्रेमवर्क है जो कोशिकाओं को बिंदुओं के रूप में मानकर स्पष्ट डिटेक्शन या सेगमेंटेशन की आवश्यकता को समाप्त करता है, और इवेंट इम्बैलेंस तथा लंबी अनुक्रमों को संभालने के लिए एडेप्टिव इवेंट-गाइडेड सैंपलिंग और रोलिंग-एज़-ए-विंडो इन्फरेंस का उपयोग करता है, जिससे मौजूदा विधियों के समान प्रदर्शन के साथ 8 से 32 गुना अधिक दक्षता प्राप्त होती है।

Yaxuan Song, Jianan Fan, Heng Huang, Mei Chen, Weidong Cai2026-07-07
🤖 AI

FuseMamba-VD: Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection

यह शोधपत्र FuseMamba-VD का प्रस्ताव करता है, जो एक कुशल द्विशाखीय (dual-branch) VideoMamba आर्किटेक्चर है जिसमें गेटेड क्लास टोकन फ्यूजन का उपयोग किया गया है, जो स्टेट-स्पेस मॉडल बैकबोन के माध्यम से सटीकता और कम्प्यूटेशनल दक्षता को प्रभावी ढंग से संतुलित करके कई बेंचमार्क पर अत्याधुनिक हिंसा पहचान प्रदर्शन प्राप्त करता है।

Damith Chamalke Senadeera, Muhammad Awais, Shibo Li, Dimitrios Kollias, Gregory Slabaugh2026-07-07
💻 computer science

Physical Annotation for Automated Optical Inspection: A Concept for In-Situ, Pointer-Based Training Data Generation

यह शोध पत्र एक नवीन भौतिक एनोटेशन प्रणाली प्रस्तुत करता है जो पॉइंटर-आधारित इन-सिटू (in-situ) इंटरेक्शन और प्रोजेक्टर मार्गदर्शन का उपयोग करके विशेषज्ञ मानव निरीक्षण ज्ञान को स्वचालित ऑप्टिकल निरीक्षण के लिए मानकीकृत प्रशिक्षण डेटा में कुशलतापूर्वक परिवर्तित करती है, जिससे गैर-आईटी विशेषज्ञों और मशीन लर्निंग पाइपलाइनों के बीच के अंतर को पाटा जा सके।

Oliver Krumpek, Oliver Heimann, Jörg Krüger2026-07-07
💻 computer science

CDST: Color Disentangled Style Transfer for Universal Style Reference Customization

यह शोध पत्र CDST को प्रस्तुत करता है, जो एक नवीन टू-स्ट्रीम प्रशिक्षण प्रतिमान (training paradigm) है जो रंग को शैली से अलग करता है ताकि सामग्री की विशेषताओं को संरक्षित करते हुए अत्याधुनिक प्रदर्शन के साथ ट्यूनिंग-मुक्त, सार्वभौमिक शैली हस्तांतरण (style transfer) सक्षम किया जा सके।

Shiwen Zhang, Zhuowei Chen, Lang Chen, Yanze Wu2026-07-07
💻 computer science

NABLA: Neighborhood Adaptive Block-Level Attention

यह शोध पत्र NABLA को प्रस्तुत करता है, जो वीडियो डिफ्यूजन ट्रांसफॉर्मर के लिए एक नवीन नेबरहुड एडेप्टिव ब्लॉक-लेवल अटेंशन मैकेनिज्म है, जो कस्टम ऑपरेटर डिज़ाइन की आवश्यकता के बिना उच्च जनरेटिव गुणवत्ता बनाए रखते हुए डायनेमिक स्पैरसिटी अडैप्टेशन के माध्यम से प्रशिक्षण और अनुमान को 2.7x तक महत्वपूर्ण रूप से तेज करता है।

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Via (…)2026-07-07
⚡ electrical engineering

GlaBoost: A Multimodal Structured Framework for Glaucoma Risk Stratification

GlaBoost एक नवीन, व्याख्यात्मक मल्टीमॉडल फ्रेमवर्क है जो मौजूदा यूनिमोडल और जेनेरिक मल्टीमॉडल दृष्टिकोणों की तुलना में बेहतर और नैदानिक रूप से सुसंगत ग्लूकोमा जोखिम स्तरीकरण प्राप्त करने के लिए एक उन्नत XGBoost मॉडल के माध्यम से फंडस इमेज एम्बेडिंग, मुक्त-पाठ नैदानिक आकलन और संरचित बायोमार्कर को एकीकृत करता है।

Cheng Huang, Zeyu Han, Weizheng Xie, Karanjit Kooner, Tsengdar Lee, Jui-Kai Wang, Jia Zhang2026-07-07
💻 computer science

Enhancing Monocular 3D Hand Reconstruction with Learned Texture Priors

यह शोधपत्र एक हल्का, प्लग-एंड-प्ले टेक्सचर मॉड्यूल प्रस्तावित करता है जो मोनोकुलर 3D हैंड रिकंस्ट्रक्शन की सटीकता और यथार्थवाद को महत्वपूर्ण रूप से सुधारने के लिए सीखे गए टेक्सचर प्रायर्स (learned texture priors) और अनुमानित एवं प्रेक्षित हाथ की उपस्थिति के बीच एक डेंस अलाइनमेंट लॉस का लाभ उठाता है।

Giorgos Karvounas, Nikolaos Kyriazis, Iason Oikonomidis, Georgios Pavlakos, Antonis A. Argyros2026-07-07
💻 computer science

CoDoL: Conditional Domain Prompt Learning for Out-of-Distribution Generalization

यह शोध पत्र CoDoL का प्रस्ताव करता है, जो एक नवीन कंडीशनल डोमेन प्रॉम्प्ट लर्निंग विधि है जो इनपुट-कंडीशनल टोकन उत्पन्न करने के लिए एक लाइटवेट डोमेन मेटा नेटवर्क का लाभ उठाता है, जिससे CLIP-आधारित मॉडलों में विजन-लैंग्वेज एम्बेडिंग अलाइनमेंट में सुधार होता है और आउट-ऑफ-डिस्ट्रीब्यूशन जनरलाइजेशन को बढ़ाता है।

Min Zhang, Yuyin Wang, Zhongxiang Dai, Zhikang Chen, Jie Zhou, Miao Liu, Sen Cui2026-07-07