💻 computer science

Generative Refinement Networks for Visual Synthesis

यह शोध पत्र जेनेरेटिव रिफाइनमेंट नेटवर्क (GRN) को प्रस्तुत करता है, जो एक नवीन विजुअल सिंथेसिस प्रतिमान है जो डिफ्यूजन मॉडल्स की कम्प्यूटेशनल अक्षमता और ऑटोरेग्रेसिव मॉडल्स के एरर एक्यूमुलेशन (त्रुटि संचय) को दूर करने के लिए ग्लोबल रिफाइनमेंट मैकेनिज्म और एंट्रॉपी-गाइडेड सैंपलिंग के साथ नियर-लॉसलेस हिरार्किकल बाइनरी क्वांटाइजेशन को जोड़ता है, जिससे इमेज, टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो जनरेशन में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan2026-07-08
💻 computer science

Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training

यह शोध पत्र DynamiCS को प्रस्तुत करता है, जो एक गतिशील क्लस्टर-आधारित नमूनाकरण (sampling) विधि है जो प्रत्येक इपोक (epoch) में बड़े क्लस्टरों को डाउनसैंपल करके और छोटे क्लस्टरों को अपसैंपल करके सेमेंटिक डेटा वितरण को संतुलित करती है, जिससे कंप्यूटिंग लागत कम होती है और लॉन्ग-टेल अवधारणाओं (long-tail concepts) पर विजन-लैंग्वेज मॉडल के प्रदर्शन में महत्वपूर्ण सुधार होता है।

Mingliang Liang, Zhuoran Liu, Arjen P. de Vries, Martha Larson2026-07-08
💻 computer science

FPGA-Based Hardware Architecture for Contrast Maximization in Event-Based Vision

यह शोध पत्र पहला FPGA-आधारित हार्डवेयर आर्किटेक्चर प्रस्तुत करता है जो इवेंट-आधारित विजन के लिए कॉन्ट्रास्ट मैक्सिमाइजेशन एल्गोरिदम को त्वरित करता है, जो CPU और GPU कार्यान्वयन की तुलना में मोशन पैरामीटर अनुमान में 200 गुना से अधिक तेज़ गति प्राप्त करता है और साथ ही वास्तविक समय, ऊर्जा-कुशल एम्बेडेड अनुप्रयोगों को सक्षम बनाता है।

Michal Filipkowski, Marcin Kowalczyk, Tomasz Kryjak2026-07-08
💻 computer science

Filtering Memorization from Parameter-Space in Diffusion Models

यह शोध पत्र बेस-एंकोर्ड फ़िल्टरिंग (BAF) का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त और डेटा-मुक्त ढांचा है जो अपडेट को स्पेक्ट्रल चैनलों में विघटित करके और उन चैनलों को दबाकर जो प्री-ट्रेंड बैकबोन के प्रिंसिपल सबस्पेस के साथ कमजोर रूप से संरेखित हैं, डिफ्यूजन मॉडल LoRA में मेमोराइजेशन को कम करता है, जिससे जनरेशन की गुणवत्ता से समझौता किए बिना कॉपीराइट या संवेदनशील सामग्री के पुनरुत्पादन को कम किया जा सके।

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen2026-07-08
🤖 machine learning

CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

CONFLUX एक लेटेंट डिफ्यूजन मॉडल है जो 3D चेस्ट-CT संश्लेषण के लिए एक वेरिएशनल ऑटोएन्कोडर को रेक्टिफाइड-फ्लो ट्रांसफार्मर और सुदृढीकरण शिक्षण (रीइन्फोर्समेंट लर्निंग) पोस्ट-ट्रेनिंग के साथ जोड़ता है ताकि उच्च-निष्ठा वाले, नियंत्रणीय मेडिकल वॉल्यूम उत्पन्न किए जा सकें जो इमेज गुणवत्ता और निर्दिष्ट नैदानिक गुणों के पालन, दोनों में मौजूदा बेसलाइनों से काफी बेहतर प्रदर्शन करते हैं।

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert2026-07-08
🤖 machine learning

Wan-Streamer v0.2: Higher Resolution, Same Latency

Wan-Streamer v0.2 एक एंड-टू-एंड ऑडियो-विजुअल इंटरेक्शन मॉडल का लेटेंसी-प्रिजर्विंग अपग्रेड है जो एक स्प्लिट आर्किटेक्चर का उपयोग करके आउटपुट रेजोल्यूशन को 192x336 से दोगुना कर 640x368 कर देता है, जहाँ एक सिंगल-जीपीयू "थिंकर" धारणा और भाषा की स्थिति को संभालता है जबकि एक मल्टी-जीपीयू "परफ़ॉर्मर" समूह हाई-रेजोल्यूशन वीडियो जनरेशन को समानांतर (पैरेललाइज) करता है, जिससे लगभग 550 ms की एंड-टू-एंड लेटेंसी बनी रहती है।

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang (…)2026-07-08
🤖 machine learning

Beyond Modality Fusion: Deep Ensembles for Multimodal Classification

यह शोध पत्र यह प्रदर्शित करता है कि यूनिमॉडल नेटवर्कों के डीप एंसेम्बल्स, मॉडल आवंटन के लिए एक स्केलेबल ह्यूरिस्टिक प्रस्तावित करके और सिंथेटिक एवं वास्तविक दुनिया के डेटासेट पर इन निष्कर्षों को मान्य करके, विशेष रूप से मोडैलिटी इम्बैलेंस (modality imbalance) के तहत, अत्याधुनिक लेट-फ्यूजन और इंटरमीडिएट-फ्यूजन मल्टीमॉडल वर्गीकरण विधियों से बेहतर प्रदर्शन कर सकते हैं।

Ilya Burenko, Dmitry Vetrov2026-07-08
🤖 machine learning

Shape Over Intensity: Directional Topological Encoding for False Positive Reduction in Intracranial Aneurysm Detection

यह शोध पत्र स्मूथ यूलर कैरेक्टरिस्टिक ट्रांसफॉर्म (SECT) का उपयोग करने वाले एक प्लग-एंड-प्ले फ्रेमवर्क को प्रस्तुत करता है जो तीव्रता से स्वतंत्र रूप से वैश्विक 3D संवहनी ज्यामिति (वैस्कुलर ज्योमेट्री) को एनकोड करके इंट्राक्रेनियल एन्यूरिज्म डिटेक्शन में फॉल्स पॉजिटिव्स को काफी कम करता है, जिससे यह पारंपरिक पर्सिस्टेंस-आधारित विधियों की तुलना में, विशेष रूप से 3 मिमी से कम के छोटे घावों और विभिन्न स्कैनर निर्माताओं के लिए बेहतर प्रदर्शन करता है।

Akshay Gokhale, Mansi Dhamne2026-07-08✓ Author reviewed
⚡ electrical engineering

A Task-Driven Evaluation of UAV Detection and Tracking under Synthetic Fog

यह शोध पत्र एक कार्य-संचालित मूल्यांकन ढांचा प्रस्तुत करता है जो यह प्रदर्शित करता है कि जहाँ सिंथेटिक कोहरा UAV डिटेक्शन और ट्रैकिंग को गंभीर रूप से बाधित करता है, वहीं कोहरे-समावेशी प्रशिक्षण (fog-inclusive training) सबसे मजबूत प्रदर्शन लाभ प्रदान करता है, जबकि टेस्ट-टाइम इमेज रेस्टोरेशन मुख्य रूप से तब महत्वपूर्ण लाभ देता है जब डिटेक्टरों को केवल स्वच्छ डेटा पर प्रशिक्षित किया गया हो।

Amir Pouladi, Vesal Ahsani, Haijun Li, Homayoun Najjaran, Afzal Suleman2026-07-08
💻 computer science

Multi-Teacher Contrastive Distillation for Edge-Efficient Pathology Foundation Models

यह शोध पत्र MuCoDi को प्रस्तुत करता है, जो एक मल्टी-टीचर कंट्रास्टिव डिस्टिलेशन फ्रेमवर्क है जो बड़े पैथोलॉजी फाउंडेशन मॉडल्स को हल्के, एज-एफिशिएंट एनकोडर्स में संकुचित करता है जो रास्पबेरी पाई 5 जैसे उपकरणों पर व्यावहारिक परिनियोजन सक्षम करने के साथ-साथ टीचर के करीब प्रदर्शन बनाए रखने में सक्षम हैं।

Tim Lenz, Maurice Heide, Marco Gustav, Nic G. Reitsam, Jakob Nikolas Kather2026-07-08