🤖 AI

Efficient Reinforcement for Visual-Textual Thinking with Discrete Diffusion Model

यह शोध पत्र एकीकृत मल्टीमॉडल मॉडलों के लिए एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचे का प्रस्ताव करता है जो स्थानीयकृत संपादन के माध्यम से कुशल विज़ुअल रोलआउट्स को सक्षम करने के लिए डिस्क्रीट डिफ्यूजन मॉडलों का लाभ उठाता है और क्रॉस-मोडल हस्तक्षेप को समाप्त करने के लिए फैक्टराइज्ड रिवॉर्ड असाइनमेंट पेश करता है, जिससे ऑटोरिग्र्रेसिव बेसलाइन की तुलना में महत्वपूर्ण कम्प्यूटेशनल बचत और प्रदर्शन लाभ प्राप्त होता है।

Yoonjeon Kim, Yuhta Takida, Chieh-Hsin Lai, Eunho Yang, Yuki Mitsufuji2026-06-16
💻 computer science

S23DR 2026: End-to-End 3D Wireframe Prediction via DETR-Style Set Prediction with Contrastive Denoising

यह शोध पत्र WireframeDETR प्रस्तुत करता है, जो S23DR 2026 चुनौती के लिए एक नवीन दृष्टिकोण है, जो अत्याधुनिक प्रदर्शन प्राप्त करने के लिए कंट्रास्टिव डीनॉइज़िंग, मल्टी-स्केल एनकोडिंग और प्रोग्रेसिव ऑक्सिलरी लॉस वेटिंग द्वारा संवर्धित एक DETR-शैली के सेट प्रेडिक्शन फ्रेमवर्क का उपयोग करके मल्टी-व्यू पॉइंट क्लाउड्स से सीधे 3D बिल्डिंग वायरफ्रेम की भविष्यवाणी करता है।

Nitiz Khanal2026-06-16
💻 computer science

An Ensemble Deep Learning Approach for Reliable and Scalable Lemon Leaf Disease Classification

यह शोध पत्र 1,354 छवियों के एक डेटासेट से नींबू के पत्तों की नौ श्रेणियों की बीमारियों को वर्गीकृत करने के लिए एडवरसैरियल ट्रेनिंग और ग्रेड-कैम (Grad-CAM) विज़ुअलाइज़ेशन के साथ इनसेप्शनवी3 (InceptionV3) और मोबाइलनेटवी2 (MobileNetV2) को संयोजित करने वाले एक सुदृढ़ और स्केलेबल एन्सेम्बल डीप लर्निंग फ्रेमवर्क का प्रस्ताव करता है, जो 99.27% सटीकता प्राप्त करता है।

Shayan Abrar, Sudeepta Mandal, Abdul Awal Yasir, Sonjoy Bhattacharjee, Sadman Haque Bhuiyan, Samanta Ghosh, Rafi Ahamed2026-06-16
💻 computer science

VANDERER: Map-Free Exploration using Future-Aware and Visual-Curiosity-Guided Diffusion Policy

VANDERER एक मैप-मुक्त अन्वेषण ढांचा (map-free exploration framework) है जो एक विजुअल क्यूरियोसिटी मॉड्यूल (Visual Curiosity Module) का उपयोग करके सेंसर-सीमित मोबाइल एजेंटों के लिए प्री-ट्रेंड डिफ्यूजन पॉलिसियों को बढ़ाता है, जो क्रिया परिणामों की भविष्यवाणी करता है और अनछुए क्षेत्र के कवरेज को अधिकतम करने के लिए नेविगेशन को निर्देशित करता है।

Venkata Naren Devarakonda, Raktim Gautam Goswami, Prashanth Krishnamurthy, Farshad Khorrami2026-06-16
💻 computer science

Improved Knowledge Distillation for Land-Use Image Classification

यह शोध पत्र एक उन्नत नॉलेज डिस्टिलेशन फ्रेमवर्क का प्रस्ताव करता है जो VGG16 टीचर से MobileNetV2 स्टूडेंट में ज्ञान स्थानांतरित करने के लिए कुलबैक-लीब्लर डाइवर्जेंस (Kullback-Leibler divergence) और कोसाइन सिमिलैरिटी (Cosine Similarity) लॉस का उपयोग करते हुए हार्ड सुपरविजन को सॉफ्ट सुपरविजन के साथ जोड़ता है, जिससे लैंड-यूज़ इमेज क्लासिफिकेशन पर 99.04% सटीकता प्राप्त होती है और साथ ही कंप्यूटेशनल जटिलता में काफी कमी आती है।

Arundhuti Sur, Abhiroop Chatterjee, Susmita Ghosh, Emmett Ientilucci2026-06-16
💻 computer science

Deep Learning in Seismic Interpretation: Federated Advances in Salt Dome Segmentation

यह शोध पत्र FedSaltNet को प्रस्तुत करता है, जो एक फेडरेटेड लर्निंग फ्रेमवर्क है जो विविध भूकंपीय (seismic) डेटासेट में मजबूत, गोपनीयता-संरक्षित साल्ट-डोम सेगमेंटेशन प्राप्त करने के लिए एक हल्के Small U-Net आर्किटेक्चर को एक नवीन फोरग्राउंड-वेटेड (Foreground-Weighted) एग्रीगेशन रणनीति के साथ जोड़ता है, जबकि डेटा विषमता और क्लास असंतुलन को प्रभावी ढंग से दूर करता है।

Muhammad Zain Mehdi, Muhammad Zaid, Owais Aleem2026-06-16
💻 computer science

FlexPooling with Simple Auxiliary Classifiers in Deep Networks

यह शोध पत्र FlexPooling का प्रस्ताव करता है, जो एक अनुकूलन योग्य (adaptive) पूलिंग विधि है जो सक्रियणों (activations) के भारित औसत (weighted averages) को सीखती है और उन्हें सरल सहायक वर्गीकरणकर्ताओं (Simple Auxiliary Classifiers) के साथ जोड़ती है ताकि मानक पूलिंग बेसलाइन की तुलना में इमेज क्लासिफिकेशन सटीकता में लगातार 1-3% का सुधार किया जा सके।

Muhammad Ali (Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence), Omar Alsuwaidi (D (…)2026-06-16
💻 computer science

MVEB: Massive Video Embedding Benchmark

यह शोध पत्र MVEB को प्रस्तुत करता है, जो कि 184-टास्क के एक बड़े पूल से व्युत्पन्न एक व्यापक 23-टास्क बेंचमार्क है जो विविध मोडैलिटीज़ और कार्यों में 33 वीडियो एम्बेडिंग मॉडलों का मूल्यांकन करता है, यह प्रकट करते हुए कि कोई भी एकल मॉडल सभी श्रेणियों में हावी नहीं है और प्रदर्शन पर ऑडियो के महत्वपूर्ण, संदर्भ-निर्भर प्रभाव को उजागर करता है।

Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wi (…)2026-06-16
💻 computer science

ReGenHuman: Re-Generating Human Appearances for Realistic Full-Body Video Anonymization

यह शोध पत्र ReGenHuman को प्रस्तुत करता है, जो एक नवीन फुल-बॉडी वीडियो अनाइमिज़ेशन पाइपलाइन है जो "एडिट न करें, बल्कि पुनर्गठित करें" (regenerate, don't edit) के प्रतिमान से पहचान-मुक्त संरचनात्मक संकेतों (identity-free structural cues) से यथार्थवादी और टेम्पोरल रूप से सुसंगत मानवीय स्वरूपों को संश्लेषित करता है, जिससे गोपनीयता, दृश्य गुणवत्ता और डाउनस्ट्रीम टास्क उपयोगिता के बीच एक इष्टतम संतुलन प्राप्त होता है।

Adam Sun, Eshaan Barkataki, Arnold Milstein, Gordon Wetzstein, Ehsan Adeli2026-06-16
💻 computer science

Towards Global AI-Driven Cervical Cancer Screening

यह शोध पत्र पहले डीप लर्निंग-आधारित गर्भाशय ग्रीवा के कैंसर की स्क्रीनिंग मॉडल को प्रस्तुत करता है जिसे कई देशों में मान्य किया गया है, जिसने आंतरिक डेटा पर घावों को वर्गीकृत करने में चिकित्सा विशेषज्ञों से बेहतर प्रदर्शन किया और विविध अंतर्राष्ट्रीय डेटासेट पर आधारभूत विधियों की तुलना में श्रेष्ठ प्रदर्शन प्रदर्शित किया, बावजूद इसके कि इसने सह-रुग्णता और रोगी जनसांख्यिकी जैसे कारकों से प्रभावित महत्वपूर्ण परिवर्तनशीलता दिखाई।

Thuy Nuong Tran, Ömer Sümer, Evangelia Christodoulou, Lennart Nauschütte, Simon Kalteis, Martin Paulikat, Esmira Pashaye (…)2026-06-16