💻 computer science

Learning to Unify Deformable Shape and Texture Representations for Cardiac Video Classification

यह शोध पत्र एक नवीन कार्डिएक वीडियो वर्गीकरण मॉडल प्रस्तावित करता है जो एक लेटेंट स्पेस में द्वि-दिशीय क्रॉस-अटेंशन तंत्र के माध्यम से विरूपणीय आकार (deformable shape) और बनावट (texture) के निरूपणों को एकीकृत करता है, जिससे सिने सीएमआर (cine CMR) डेटासेट पर अत्याधुनिक प्रदर्शन और बेहतर व्याख्यात्मकता प्राप्त करने के लिए गतिशील, चरण-विशिष्ट फीचर फ्यूजन सक्षम होता है।

Tonmoy Hossain, Miaomiao Zhang2026-07-09
🤖 machine learning

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC एक स्वचालित फ्रेमवर्क पेश करता है जो 6.1 मिलियन PubMed Central लेखों से 11 मिलियन उच्च-सटीकता वाले मेडिकल इमेज-टेक्स्ट पेयर्स को क्यूरेट करता है, जो मौजूदा बेसलाइन्स की तुलना में ज़ीरो-शॉट क्लासिफिकेशन, विजुअल क्वेश्चन अनस्वर्सिंग और क्लिनिकल रिट्रीवल बेंचमार्क में मेडिकल मल्टीमॉडल फाउंडेशन मॉडल्स के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाता है।

Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei (…)2026-07-09
💻 computer science

Freqformer: Image-Demoiréing Transformer via Effective Frequency Decomposition

फ्रिक्वेंटीफॉर्मर (Freqformer) एक संक्षिप्त, ट्रांसफॉर्मर-आधारित फ्रेमवर्क है जो इमेज डेमोइरिंग (image demoiréing) के लिए प्रभावी फ्रीक्वेंसी डिकंपोजिशन का उपयोग करके पैटर्न को अलग-अलग उच्च और निम्न-आवृत्ति घटकों में विभाजित करता है, जिन्हें फिर एक डुअल-ब्रांच आर्किटेक्चर के माध्यम से संसाधित किया जाता है और एक सीखने योग्य फ्रीक्वेंसी कंपोजिशन ट्रांसफॉर्म का उपयोग करके अनुकूल रूप से संलयित (fuse) किया जाता है, जिससे यह अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xiaoyang Liu, Bolin Qiu, Zheng Chen, Libo Zhu, Zihan Zhou, Kai Liu, Jiezhang Cao, Yulun Zhang2026-07-08
🤖 machine learning

FedDAF: Federated Domain Adaptation Using Model Functional Distance

यह शोध पत्र FedDAF को प्रस्तुत करता है, जो एक नवीन फेडेरेटेड डोमेन एडाप्टेशन विधि है जो स्रोत और लक्ष्य मॉडलों को उनके माध्य ग्रेडिएंट क्षेत्रों से प्राप्त एक सामान्यीकृत मॉडल फंक्शनल दूरी के आधार पर एकत्रित करके डोमेन शिफ्ट और लक्ष्य डेटा की कमी दोनों को संबोधित करती है, जिससे मौजूदा दृष्टिकोणों की तुलना में बेहतर परीक्षण सटीकता प्राप्त होती है।

Mrinmay Sen, Ankita Das, Sidhant Nair, C Krishna Mohan2026-07-08
💻 computer science

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

यह शोध पत्र VisCoP को प्रस्तुत करता है, जो एक पैरामीटर-कुशल ढांचा है जो विजन एनकोडर को सीखने योग्य विजुअल प्रोब्स के साथ संवर्धित करके, महत्वपूर्ण वितरण बदलावों वाले नवीन वीडियो डोमेन के अनुकूल बड़े विजन लैंग्वेज मॉडल्स को अनुकूलित करता है, जिससे पूर्व-प्रशिक्षित क्षमताओं को बनाए रखते हुए और कैटास्ट्रोफिक फॉरगेटिंग (विस्मृति) को रोके बिना उत्कृष्ट टार्गेट-डोमेन प्रदर्शन प्राप्त किया जाता है।

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das2026-07-08
💻 computer science

Did Models Learn Sufficiently? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation

यह शोध पत्र सबसेट-सिलेक्टेड काउंटरफैक्चुअल ऑग्मेंटेशन (SS-CA) का प्रस्ताव करता है, जो एक प्रशिक्षण रणनीति है जो निर्णय-प्रासंगिक क्षेत्रों को मास्क करके काउंटरफैक्चुअल नमूने उत्पन्न करने के लिए निष्ठावान एट्रिब्यूशन (faithful attribution) का लाभ उठाती है, जिससे मॉडल को अधिक सुदृढ़ निर्णय सीमाओं को सीखने में मार्गदर्शन मिलता है और इन-डिस्ट्रीब्यूशन सटीकता, आउट-ऑफ-डिस्ट्रीब्यूशन सामान्यीकरण और परटर्बेशन मजबूती (perturbation robustness) में प्रदर्शन में उल्लेखनीय सुधार होता है।

Yannan Chen, Ruoyu Chen, Wei Wang, Bin Zeng, Jinke Li, Shiming Liu, Qunli Zhang, Yaowei Wang, Xiaochun Cao2026-07-08
💻 computer science

FIELDS: Face reconstruction with accurate Inference of Expression using Learning with Direct Supervision

यह शोध पत्र FIELDS का प्रस्ताव करता है, जो एक टास्क-ड्रिवन फ्रेमवर्क है जो ज्यामितीय बाधाओं के तहत प्रत्यक्ष अफेक्ट सुपरविजन के माध्यम से FLAME एक्सप्रेशन कोड्स को सीखकर चेहरे के भावों की पहचान (फेशियल एक्सप्रेशन रिकग्निशन) में सुधार करता है, जिससे पारंपरिक इमेज-लेवल सेल्फ-सुपरवाइज्ड 3D फेस रिकंस्ट्रक्शन विधियों की सीमाओं को दूर किया जा सके।

Chen Ling, Henglin Shi, Hedvig Kjellström2026-07-08
💻 computer science

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

यह शोध पत्र "Superman" को प्रस्तुत करता है, जो एक विजन-गाइडेड मोशन टोकेनाइज़र (Vision-Guided Motion Tokenizer) और एक एकल MLLM आर्किटेक्चर के माध्यम से दृश्य धारणा (visual perception) और टेम्पोरल स्केलेटन-आधारित गति उत्पादन (temporal skeleton-based motion generation) को जोड़ने वाला एक एकीकृत ढांचा है, जो विविध मानव गति विश्लेषण कार्यों में अत्याधुनिक प्रदर्शन प्राप्त करता है।

Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu2026-07-08
📊 statistics

Conformal Prediction Sets for Instance Segmentation

यह शोध पत्र एक कॉन्फॉर्मल प्रेडिक्शन एल्गोरिदम प्रस्तुत करता है जो इंस्टेंस सेगमेंटेशन के लिए एडेप्टिव कॉन्फिडेंस सेट्स उत्पन्न करता है, जो यह प्रमाणित गारंटी प्रदान करता है कि सेट के भीतर कम से कम एक प्रेडिक्शन ग्राउंड ट्रुथ के साथ उच्च इंटरसेक्शन-ओवर-यूनियन प्राप्त करता है और विविध अनुप्रयोगों में संरचनात्मक अनिश्चितता को प्रभावी ढंग से कैप्चर करता है।

Kerri Lu, Dan M. Kluger, Stephen Bates, Sherrie Wang2026-07-08
💻 computer science

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1 एक एकीकृत मल्टीमॉडल डिफ्यूजन लैंग्वेज मॉडल है जो एक नवीन पोस्ट-ट्रेनिंग फ्रेमवर्क के भीतर सुपरवाइज्ड फाइनट्यूनिंग और मल्टी-टास्क रीइन्फोर्समेंट लर्निंग को एकीकृत करके तर्क क्षमताओं को उन्नत करता है, जो विविध विजुअल अंडरस्टैंडिंग और जनरेशन कार्यों में मजबूत प्रदर्शन प्रदर्शित करता है।

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen2026-07-08