💻 computer science

MSA-DCNN: A Data-Efficient Multi-Scale Deformable CNN for Medical Image Classification

यह शोध पत्र MSA-DCNN का प्रस्ताव करता है, जो एक डेटा-कुशल मल्टी-स्केल डिफॉर्मेबल CNN फ्रेमवर्क है जो लेबल की कमी और वितरण बदलाव (डिस्ट्रीब्यूशन शिफ्ट) की स्थितियों में मेडिकल इमेज क्लासिफिकेशन के तहत मौजूदा बेसलाइन्स से बेहतर प्रदर्शन करने के लिए एडेप्टिव सैंपलिंग, क्रॉस-स्केल फ्यूजन और सेल्फ-डिस्टिलेशन को एकीकृत करता है।

Hamza Hussaini, Shahana Bano, Eyad Elyan, Carlos Francisco Moreno-García2026-07-08
💻 computer science

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

यह शोधपत्र WebRetriever प्रस्तुत करता है, जो 800 विविध वेबसाइटों में 1,550 कार्यों वाला एक बड़े पैमाने का बेंचमार्क है, साथ ही एक नवीन NavEval फ्रेमवर्क और तीन पूरक मूल्यांकन प्रोटोकॉल भी प्रदान करता है, ताकि वास्तविक दुनिया के परिदृश्यों में वेब एजेंट के प्रदर्शन का अधिक व्यापक और सूक्ष्म मूल्यांकन प्रदान करके मौजूदा बेंचमार्क की सीमाओं को संबोधित किया जा सके।

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen (…)2026-07-08
💻 computer science

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

यह शोध पत्र AEGIS को प्रस्तुत करता है, जो एक मैकेनिज्म-गाइडेड डिफेंस है जो टेक्स्ट-टू-इमेज मॉडल्स में विजुअल सिनोनिम जेलब्रेक्स को प्रभावी ढंग से बेअसर करने के लिए इन्फरेंस के दौरान स्पार्स सिमेंटिक-इंजेक्टिंग अटेंशन हेड्स की गतिशील रूप से पहचान करता है और उन्हें निर्देशित करता है, जबकि सौहार्दपूर्ण अवधारणाओं (benign concepts) की शुद्धता को बनाए रखता है।

Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang2026-07-08
🤖 machine learning

Enhanced Seam Segmentation for Automated Welding Robot in Construction Through Transfer Learning: Addressing Limitations of Bilateral Segmentation Network

यह शोध पत्र स्वचालित निर्माण वेल्डिंग के लिए एक रिफ्लेक्शन-रोबस्ट सीम सेगमेंटेशन फ्रेमवर्क प्रस्तावित करता है जो ट्रांसफर लर्निंग और एक हाइब्रिड क्रॉस-एन्ट्रॉपी-लोवाज़ लॉस के माध्यम से BiSeNetV2 बैकबोन को उन्नत करता है, जिससे बिना किसी कम्प्यूटेशनल जटिलता को बढ़ाए चुनौतीपूर्ण परावर्तक वातावरण में महत्वपूर्ण प्रदर्शन लाभ प्राप्त होता है।

Keonvin Park, Yong Ann Voeurn, Hyeokjun Kweon, Doyun Lee2026-07-08
💻 computer science

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan एक नवीन फ्रेमवर्क पेश करता है जो रिकरेंट रीफॉर्मुलेशन (recurrent reformulation), स्ट्रक्चर्ड अटेंशन प्रूनिंग (structured attention pruning) और डिस्टिलेशन के माध्यम से मेमोरी-सीमित मोबाइल उपकरणों पर एक उच्च-गुणवत्ता वाले 5B-पैरामीटर वीडियो डिफ्यूजन ट्रांसफार्मर की कुशल तैनाती को सक्षम बनाता है, जिससे कम विलंबता (low latency) के साथ अत्याधुनिक जनरेशन प्रदर्शन प्राप्त होता है।

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Bori (…)2026-07-08
💻 computer science

WING: A Window-Prior-Based Generative Network with Gated Inception for Cross-Modality CT Synthesis

यह शोध पत्र WING को प्रस्तुत करता है, जो एक नवीन जनरेटिव नेटवर्क है जो CT संश्लेषण में हाई डायनेमिक रेंज की चुनौतियों से पार पाने के लिए एक विंडो-प्रायर रणनीति और गेटेड इनसेप्शन आर्किटेक्चर का लाभ उठाता है, जिससे एडेप्टिव रेडियोथेरेपी के लिए क्रॉस-मोडैलिटी MRI-टू-CT और CBCT-टू-CT रूपांतरण में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Siyuan Mei, Yan Xia, Yipeng Sun, Siming Bayer, Zirong Li, Chengze Ye, Daiqi Liu, Fuxin Fan, Yixing Huang, Andreas Maier2026-07-08
💻 computer science

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

यह शोध पत्र PhyMRI-SR का प्रस्ताव करता है, जो एक नवीन भौतिकी-जागरूक (physics-aware) ढांचा है, जो शारीरिक और प्रणालीगत पूर्वग्रहों (anatomical and system priors), भौतिकी-प्रतिबंधित सिग्नल मॉडलिंग और मेटा-लर्निंग को अनुकूलित करते हुए 2D गॉसियन स्प्लेटिंग को पुनर्गठित करके एमआरआई सुपर-रिज़ॉल्यूशन को एक गतिशील पुनर्निर्माण समस्या के रूप में पुनर्परिभाषित करता है, ताकि विषम निम्न-रिज़ॉल्यूशन इनपुट से उच्च-गुणवत्ता वाली, जैव-भौतिक रूप से प्रशंसनीय छवियां उत्पन्न की जा सकें।

Lihua Wei, Huatong Gao, Jia Gong, Zhiyu Tan, Hao Li, Jun Liu, Zhihua Ren2026-07-08
🤖 AI

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

यह शोध पत्र VendorBench-100 को प्रस्तुत करता है, जो एक एकीकृत क्रॉस-पैराडाइम बेंचमार्क है जो एक क्यूरेटेड 100-छवि कॉर्पस का उपयोग करके कमर्शियल एपीआई (commercial APIs), विजन-लैंग्वेज मॉडल्स और ओपन-सोर्स डिटेक्टर्स के माध्यम से 36 डीपफेक डिटेक्शन मॉडल्स का मूल्यांकन करता है, जिससे यह खुलासा होता है कि हालांकि कमर्शियल एपीआई मेडियन प्रदर्शन में अग्रणी हैं, फिर भी रैंकिंग क्षमता (ROC-AUC) और विश्वसनीय निर्णय लेने (MCC) के बीच एक महत्वपूर्ण विचलन मौजूद है।

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh2026-07-08
🤖 AI

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

यह शोध पत्र UI2App को प्रस्तुत करता है, जो केवल स्थिर UI स्क्रीनशॉट से निष्पादन योग्य इंटरैक्शन व्यवहारों को अनुमानित करने की विजन-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो वर्तमान मॉडल्स की दृश्य पुनर्निर्माण क्षमताओं और जटिल, स्टेट-कोहेरेंट वेब एप्लिकेशन उत्पन्न करने की उनकी क्षमता के बीच एक महत्वपूर्ण अंतर को प्रकट करता है।

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen2026-07-08
🤖 AI

Driving the Wrong Way: Leveraging Interpretability in End2End Autonomous Driving Models

यह शोध पत्र अनसुपरवाइज्ड डिक्शनरी लर्निंग का उपयोग करके एक पोस्ट-हॉक इंटरप्रिटेबिलिटी फ्रेमवर्क प्रस्तावित करता है ताकि एंड-टू-एंड ऑटोनॉमस ड्राइविंग मॉडल्स को अर्थपूर्ण अवधारणाओं में विघटित किया जा सके, जिससे त्रुटिपूर्ण व्यवहारों की पहचान और लक्षित हस्तक्षेप सक्षम हो सके जो समग्र ड्राइविंग प्रदर्शन में सुधार करते हैं।

Franz Motzkus, Sebastian Bernhard2026-07-08