🤖 machine learning

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

यह शोध पत्र MeanFlowNFT प्रस्तुत करता है, जो एक नवीन ढांचा है जो एक प्रेरित तात्कालिक-वेग भविष्यवक्ता (induced instantaneous-velocity predictor) का निर्माण करके फॉरवर्ड-प्रोसेस सुदृढीकरण शिक्षण (Reinforcement Learning) विधि DiffusionNFT को MeanFlow जनरेटरों के अनुकूल बनाता है, जिससे कुशल रिवॉर्ड ऑप्टिमाइज़ेशन सक्षम होता है जो तेज़ कुछ-चरणों वाले सैंपलिंग को सुरक्षित रखते हुए इमेज और वीडियो जनरेशन में मौजूदा कुछ-चरणों और यहाँ तक कि बहु-चरण RL-ट्यून्ड मॉडल्स से भी काफी बेहतर प्रदर्शन करता है।

Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang2026-07-17
💻 computer science

Hierarchical Denoising For Multi-Step Visual Reasoning

यह शोध पत्र HDR को प्रस्तुत करता है, जो एक एकीकृत ढांचा (unified framework) है जो वीडियो जनरेशन में कुशल, कम-विलंबता (low-latency), बहु-चरणीय दृश्य तर्क (multi-step visual reasoning) को सक्षम करने के लिए पदानुक्रमित लैटेंट्स (hierarchical latents) और स्पार्स अटेंशन का उपयोग करता है, जो तर्क सटीकता और अनुमान गति (inference speed) दोनों में मौजूदा स्ट्रीमिंग ऑटोरेग्रेसिव और द्विदिश प्रसार मॉडलों (bidirectional diffusion models) से काफी बेहतर प्रदर्शन करता है।

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyua (…)2026-07-17
⚡ electrical engineering

Global and Local Contrastive Learning for Joint Representations from Cardiac MRI and ECG

यह शोध पत्र PTACL प्रस्तुत करता है, जो एक मल्टीमॉडल कंट्रास्टिव लर्निंग फ्रेमवर्क है जो कार्डिएक एमआरआई से संरचनात्मक अंतर्दृष्टि को ईसीजी (ECG) निरूपणों में एकीकृत करने के लिए वैश्विक रोगी-स्तरीय और स्थानीय टेम्पोरल-स्तरीय संरेखण दोनों का लाभ उठाता है, जिससे बिना किसी नए सीखने योग्य पैरामीटर को जोड़े, कार्डिएक फेनोटाइप रिट्रीवल और कार्यात्मक पैरामीटर भविष्यवाणी में महत्वपूर्ण सुधार होता है।

Alexander Selivanov, Philip Müller, Özgün Turgut, Nil Stolt-Ansó, Daniel Rückert2026-07-16
🤖 AI

Integrating Skeleton Based Representations for Robust Yoga Pose Classification Using Deep Learning Models

यह अध्ययन 'Yoga-16' डेटासेट प्रस्तुत करता है और यह प्रदर्शित करता है कि कंकाल-आधारित (skeleton-based) निरूपण, विशेष रूप से जब उन्हें MediaPipe Pose इनपुट के साथ VGG16 द्वारा संसाधित किया जाता है, स्वचालित योग मुद्रा वर्गीकरण में 96.09% की सुदृढ़ सटीकता प्राप्त करने के लिए कच्चे इमेज इनपुट से बेहतर प्रदर्शन करते हैं।

Mohammed Mohiuddin, Syed Mohammod Minhaz Hossain, Sumaiya Khanam, Prionkar Barua, Aparup Barua, MD Tamim Hossain2026-07-16
💻 computer science

When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs

यह शोध पत्र LIBERO-CF प्रस्तुत करता है, जो विज़न-लैंग्वेज-एक्शन मॉडल्स के लिए पहला काउंटरफैक्चुअल बेंचमार्क है, और काउंटरफैक्चुअल एक्शन गाइडेंस (CAG) का प्रस्ताव करता है, जो एक ट्रेनिंग-फ्री ड्यूल-ब्रांच इन्फरेंस विधि है जो विज़ुअल शॉर्टकट्स के विरुद्ध लैंग्वेज कंडीशनिंग को स्पष्ट रूप से रेगुलराइज़ करके लैंग्वेज-फॉलोइंग विफलताओं को महत्वपूर्ण रूप से कम करती है।

Yu Fang, Yuchun Feng, Dong Jing, Jiaqi Liu, Yue Yang, Zhenyu Wei, Daniel Szafir, Mingyu Ding2026-07-16
💻 computer science

When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization

यह शोध पत्र COD-TDQ को प्रस्तुत करता है, जो एक टोकन-ग्रुप डुअल-कन्स्ट्रेंट एक्टिवेशन क्वांटाइजेशन विधि है जो क्रॉस-टोकन रेंज डोमिनेशन को दबाकर और ज़ीरो-बिन मास को सीमित करके छलावरण वाले ऑब्जेक्ट डिटेक्शन (camouflaged object detection) में आक्रामक W4A4 क्वांटाइजेशन की अनूठी चुनौतियों पर विजय प्राप्त करता है, जिससे यह बिना रिट्रेनिंग के मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।

Tianqi Li, Wenyu Fang, Xin He, Xue Geng, Xu Cheng, Yun Liu2026-07-16
🤖 machine learning

BiLoG-Net: A Bi-Context Location-Guided Network for Breast Mass Segmentation and Malignancy Classification in Mammography

BiLoG-Net एक नवीन एंड-टू-एंड डीप लर्निंग फ्रेमवर्क है जो बायो-कॉन्टेक्स्ट लोकेशन-अवेयर फीचर मॉडलिंग और सेगमेंटेशन-गाइडेड अटेंशन मैकेनिज्म को एकीकृत करके मैमोग्राफी में ब्रेस्ट मास सेगमेंटेशन और मैलिग्नेंसी क्लासिफिकेशन को संयुक्त रूप से निष्पादित करता है, जिससे CBIS-DDSM और INBreast बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

Abu Fatema Mohammad Abdun Noor, Md Imam Ahasan, Md Samiul Ahasan, Kah Ong Michael Goh, S M Hasan Mahmud, Raihana Zannat2026-07-16
🤖 machine learning

Beyond Backbone Backpropagation: A Decoupled Strategy for Efficient Transfer Learning

यह शोध पत्र एक हल्का, विच्छेदित (decoupled) ट्रांसफर लर्निंग रणनीति प्रस्तावित करता है जो एंड-टू-एंड बैकप्रोपैगेशन के बिना नॉर्मलाइजेशन परतों को अनुकूलित करती है और एक पुनर्गठित क्लासिफायर हेड को अनुकूलित करती है, जिससे विविध सीएनएन (CNN) और ट्रांसफॉर्मर आर्किटेक्चर पर मेडिकल इमेजिंग डेटासेट के माध्यम से प्रतिस्पर्धी सटीकता बनाए रखते हुए कम्प्यूटेशनल लागत और कार्बन उत्सर्जन को काफी कम किया जाता है।

Daniel Vila-Cruz, Laura Morán-Fernández, Verónica Bolón-Canedo2026-07-16
💬 NLP

Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation

यह शोध पत्र Text2Sign को प्रस्तुत करता है, जो एक लागत प्रभावी, सिंगल-जीपीयू डिफ्यूजन बेसलाइन है जो एक फ्रोजन विजन-लैंग्वेज एनकोडर और फैक्टराइज्ड स्पैटियोटेम्पोरल अटेंशन का लाभ उठाकर लघु, कम-रिज़ॉल्यूशन वाले साइन लैंग्वेज वीडियो उत्पन्न करता है, हालांकि वर्तमान में इसमें सीमित प्रॉम्प्ट संवेदनशीलता प्रदर्शित होती है और यह मुख्य रूप से एक प्रोडक्शन-रेडी सिस्टम के बजाय एक रिसर्च स्टार्टिंग पॉइंट के रूप में कार्य करता है।

Ruize Xia2026-07-16
💻 computer science

MGFace: Mask-Gated Face Matching via Conditional Similarity Routing

MGFace एक मास्क-गेटेड फेस आइडेंटिफिकेशन पाइपलाइन है जो अनमास्क्ड क्वेरीज़ को ग्लोबल एम्बेडिंग मैचिंग के लिए सशर्त रूप से रूट करके और केवल मास्क्ड क्वेरीज़ के लिए मास्क-अवेयर पैच-लेवल री-रैंकिंग को सक्रिय करके सटीकता और दक्षता में सुधार करती है, जिससे मौजूदा विधियों की तुलना में काफी कम कम्प्यूटेशनल ओवरहेड के साथ बेहतर प्रदर्शन प्राप्त होता है।

Huy Che, Hoang-Minh Trinh, Dinh-Duy Phan, Duc-Lung Vu2026-07-16