🤖 AI

Rethinking Depth Pruning for Vision Transformers: A Heterogeneity-Aware Perspective

यह शोध पत्र HetDPT को प्रस्तुत करता है, जो एक विषमता-जागरूक (heterogeneity-aware) डेप्थ प्रूनिंग विधि है जो इंटर-लेयर विषमता को संबोधित करके मौजूदा दृष्टिकोणों की सटीकता रिकवरी चुनौतियों पर विजय प्राप्त करती है, जिससे कई बेंचमार्क पर विजन ट्रांसफॉर्मर (Vision Transformers) पर न्यूनतम सटीकता हानि के साथ महत्वपूर्ण गति वृद्धि प्राप्त होती है।

Zhenfeng Su, Kang Zhao, Han Bao, Tao Yuan, Zhongzhe Hu, Xianzhi Yu, Wenxuan Wang2026-07-07
💻 computer science

G2^2TAM: Geometry Grounded Track Anything Model

यह शोध पत्र G2^2TAM को प्रस्तुत करता है, जो एक एकीकृत ढांचा (framework) है जो विभिन्न दृष्टिकोणों और अवरोधों (occlusions) के बीच सुदृढ़, प्रॉम्प्टेबल 3D इंस्टेंस ट्रैकिंग और वीडियो सेगमेंटेशन प्राप्त करने के लिए स्थानिक रूप से संरेखित ज्यामितीय निरूपणों को एक अंतर्निहित स्मृति (implicit memory) के रूप में उपयोग करता है, जिसे नवनिर्मित InsTrack डेटासेट द्वारा समर्थित किया गया है।

Chenming Zhu, Peizhou Cao, Jingli Lin, Wenbo Hu, Yunlong Ran, Jiangmiao Pang, Tai Wang, Xihui Liu2026-07-07
💻 computer science

InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection

इन्फ्रानेट (InfraNet) एक कुशल, IR-केंद्रित ऑब्जेक्ट डिटेक्शन फ्रेमवर्क है जो एक क्वालिटी-अवेयर फ्यूजन मॉड्यूल (QualGate) का उपयोग करता है ताकि प्रशिक्षण के दौरान RGB मार्गदर्शन को गतिशील रूप से नियंत्रित किया जा सके, जिससे प्रतिकूल परिस्थितियों में मजबूत प्रदर्शन सक्षम होता है और साथ ही RGB-IR और केवल IR दोनों मोड में लचीले परिनियोजन का समर्थन मिलता है।

Zichao Feng, Haodong Zhu, Jingying Yang, Sheng Xu, Yangyang Ren, Yuguang Yang, Xuhui Liu, Juan Zhang, Tian Wang, Linlin (…)2026-07-07
⚡ electrical engineering

Probabilistic Robustness in Medical Image Classification

यह शोध पत्र मेडिकल इमेजिंग में डीप लर्निंग मॉडल्स के मूल्यांकन के लिए वर्स्ट-केस एडवर्सरियल रोबस्टनेस (worst-case adversarial robustness) के एक अधिक व्यावहारिक विकल्प के रूप में प्रोबेबिलिस्टिक रोबस्टनेस (probabilistic robustness) का समर्थन करता है, जो प्राकृतिक भ्रष्टाचार (natural corruptions) के तहत मेडमिनिस्ट v2 (MedMNIST v2) डेटासेट पर व्यवस्थित मूल्यांकन के माध्यम से यह प्रदर्शित करता है कि यह दृष्टिकोण विश्वसनीय नैदानिक परिनियोजन (clinical deployment) के लिए एक सांख्यिकीय रूप से पुष्ट दृष्टिकोण प्रदान करता है।

Yi Zhang, Siddartha Khastgir, Xingyu Zhao2026-07-07
🤖 AI

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile एक ऑन-डिवाइस इमेज-टू-वीडियो डिफ्यूजन फ्रेमवर्क है जो एक बड़े DiT मॉडल को 1GB से कम के जनरेटर में कंप्रेस करने के लिए डिस्टिलेशन-गाइडेड प्रूनिंग, रीइन्फोर्समेंट लर्निंग-आधारित डिस्टिलेशन और हाइब्रिड क्वांटाइजेशन का उपयोग करता है, जो मोबाइल हार्डवेयर पर सिनेमैटिक वीडियो बनाने के लिए 40x की गति वृद्धि और कम लेटेंसी सक्षम करता है।

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng2026-07-07
💻 computer science

TestMate: Test-Time Domain Adaptation Aided by Lightweight Vision Foundation Model

टेस्टमेट (TestMate) एक नवीन, वास्तविक समय (real-time) और बैकप्रोपैगेशन-मुक्त टेस्ट-टाइम डोमेन एडाप्टेशन फ्रेमवर्क है जो ज़ीरो-शॉट मास्क प्रस्तावों को उत्पन्न करने के लिए एक हल्के विज़ुअल फाउंडेशन मॉडल का लाभ उठाता है, जिन्हें तत्काल अनुकूलन प्राप्त करने, कैटास्ट्रोफिक फॉरगेटिंग को रोकने और बिना लेबल वाले डेटा की आवश्यकता के सूक्ष्म ऑब्जेक्ट बाउंड्रीज़ को संरक्षित करने के लिए एक प्रतिस्पर्धी योजना के माध्यम से प्राथमिक मॉडल भविष्यवाणियों के साथ संलयित (fuse) किया जाता है।

Dimitrios Fotiou, Vasileios Mygdalis, Ioannis Pitas2026-07-07
🤖 AI

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

यह शोध पत्र डिफ्यूजन क्लासिफायर (diffusion classifiers) का तीन पूर्वाग्रह आयामों (bias dimensions) के आधार पर मूल्यांकन करने के लिए ASOB-Bench प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ वे एट्रिब्यूट बाइंडिंग (attribute binding) में विजन-लैंग्वेज बेसलाइन से बेहतर प्रदर्शन करते हैं, वहीं वे साइज-ऑर्डर शॉर्टकट्स (size-order shortcuts) और बैकग्राउंड डिपेंडेंसी (background dependency) के प्रति विशिष्ट और गंभीर कमजोरियां प्रदर्शित करते हैं, जिनके विफलता तंत्र (failure mechanisms) टेक्स्ट-टू-इमेज जनरेशन की मजबूती (robustness) के बारे में भी जानकारी देते हैं।

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi2026-07-07
💬 NLP

When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts

यह शोध पत्र इंटरप्रेस-पैरेलल-कॉर्पस (Interpres-Parallel-Corpus) डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि मध्यकालीन लैटिन पांडुलिपियों के अनुवाद के लिए, एक विशेष ओसीआर (OCR) को विजन लैंग्वेज मॉडल (Vision Language Model) के साथ संयोजित करने वाला एक सरल पाइपलाइन, त्रुटि प्रसार (error propagation) और प्रॉम्प्ट संतृप्ति (prompt saturation) से बचकर अधिक जटिल बहु-घटक दृष्टिकोणों से बेहतर प्रदर्शन करता है।

Nguyen Kim Hai Bui, Md. Easin Arafat, Tamás Gábor Orosz, Mufti Mahmud2026-07-07
💻 computer science

BAT3R: Bootstrapping Articulated 3D Reconstruction from 2D Image Collections

यह शोध पत्र BAT3R का प्रस्ताव करता है, जो एक ऐसा प्रशिक्षण ढांचा है जो अनएनोटेटेड (unannotated) 2D इमेज संग्रहों से आर्टिकुलेटेड 3D पुनर्निर्माण को बूटस्ट्रैप करता है, जो मेश फिटिंग और सिंथेटिक डेटा जनरेशन के माध्यम से एक कमजोर 3D प्रेडिक्टर को पुनरावर्ती रूप से परिष्कृत करके, उन विधियों के समान प्रदर्शन प्राप्त करता है जिनमें महंगी मैन्युअल रूप से क्यूरेट की गई डेटासेट की आवश्यकता होती है।

Jakub Zadrozny, Oisin Mac Aodha, Hakan Bilen2026-07-07
🤖 machine learning

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

यह शोध पत्र USE का प्रस्ताव करता है, जो एक एकीकृत स्व-एन्सेम्बलिंग फ्रेमवर्क है जो विश्वसनीय छद्म लेबल (pseudo labels) उत्पन्न करने के लिए मूल परीक्षण छवियों पर अनुकूल रूप से बल देकर टेस्ट-टाइम प्रॉम्प्ट ट्यूनिंग में सुधार करता है, जिससे अनुकूलन और अनुमान चरणों के बीच निरंतरता सुनिश्चित होती है और साथ ही यह एक हल्के अनुकूलन-रहित अनुकूलन पद्धति के रूप में भी कार्य करता है।

Siru Jiang, Jian Liang, Ran He, Tieniu Tan2026-07-07