🤖 AI

Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution

यह शोध पत्र पहला व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि वर्तमान डिफ्यूजन-आधारित सुपर-रिज़ॉल्यूशन मॉडल सिंथेटिक प्रशिक्षण डेटा से वास्तविक क्रॉस-सेंसर सैटेलाइट इमेजरी में संक्रमण के दौरान एक महत्वपूर्ण डोमेन गैप से ग्रस्त होते हैं, जो यह प्रकट करता है कि जहाँ सिंथेटिक प्रशिक्षण वास्तविक डेटा पर विफल रहता है, वहीं वास्तविक डेटा पर प्रशिक्षण अनुकूलन चुनौतियों को पेश करता है जो सुपर-रिज़ॉल्यूशन को डोमेन अनुकूलन से अलग करने की आवश्यकता को रेखांकित करता है।

Dawid Kopeć, Katarzyna Jabłońska, Wojciech Kozłowski, Maciej Zięba2026-06-29
💻 computer science

Diffusion Model Attribution via Spectral Coupling of Denoiser Responses

यह शोध पत्र स्पेक्ट्रल डिनोइजिंग सिग्नेचर (SDS) प्रस्तुत करता है, जो एक गैर-आक्रामक एट्रिब्यूशन विधि है जो प्रत्येक मॉडल के अद्वितीय स्पेक्ट्रल ज्योमेट्री को उसके डिनोइजिंग व्यवहार में फिंगरप्रिंट करके डिफ्यूजन-जनरेटेड छवियों के स्रोत की पहचान करती है, और बिना किसी इनवर्जन या ऑप्टिमाइजेशन के विविध आर्किटेक्चर और प्रशिक्षण स्थितियों में उच्च सटीकता प्राप्त करती है।

Pragati Shuddhodhan Meshram, Varun Chandrasekaran2026-06-29
🤖 AI

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR एक वन-स्टेप डिफ्यूजन मॉडल है जो एक ऑक्यूपेंसी-गाइडेड डिस्क्रिमिनेटर, अपूर्ण मास्क को संभालने के लिए एक अल्फा हेड, और उच्च गुणवत्ता वाले प्रशिक्षण डेटा को क्यूरेट करने के लिए एक सिमेंटिक-एंकोर्ड वेरिफिकेशन पाइपलाइन को पेश करके कुशल, इफेक्ट-अवेयर और मास्क-रोबस्ट ऑब्जेक्ट रिमूवल प्राप्त करता है, जिसके परिणामस्वरूप मल्टी-स्टेप बेसलाइन्स की तुलना में काफी तेज़ इन्फरेंस के साथ बेहतर परसेप्चुअल क्वालिटी प्राप्त होती है।

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang2026-06-29
🤖 machine learning

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

यह शोध पत्र CME-AQA का प्रस्ताव करता है, जो एक क्रॉस-व्यू मल्टीमॉडल फ्रेमवर्क है जो पारंपरिक चीनी चिकित्सा पुनर्वास प्रशिक्षण में अवरोध (occlusion) की चुनौतियों को दूर करने के लिए प्रथम-व्यक्ति और तृतीय-व्यक्ति वीडियो को एकीकृत करता है, जो मौजूदा सिंगल-व्यू विधियों की तुलना में एक्यूपंक्चर और तुइना तकनीकों के लिए एक्शन क्वालिटी असेसमेंट में बेहतर प्रदर्शन प्रदर्शित करता है।

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum2026-06-29
🤖 AI

BiDeMem: Bidirectional Degradation Memory for Explainable Image Restoration

यह शोध पत्र BiDeMem का प्रस्ताव करता है, जो एक द्विदिश क्षरण स्मृति (bidirectional degradation memory) ढांचा है जो संकुचित स्मृति स्लॉट्स को पुनर्प्राप्त करके व्याख्यात्मक छवि बहाली (explainable image restoration) को बढ़ाता है ताकि बहाली प्रक्रिया को एक साथ निर्देशित किया जा सके और एक सत्यापन योग्य स्पष्टीकरण पथ प्रदान किया जा सके, जो मौजूदा क्षरण-जागरूक विधियों की तुलना में बेहतर प्रदर्शन और व्याख्यात्मकता प्रदर्शित करता है।

Xinrui Wu, Lichen Huang2026-06-29
🤖 AI

Higher-Order Fourier Neural Operator: Explicit Mode Mixer for Nonlinear PDEs

यह शोध पत्र हायर-ऑर्डर फूरियर न्यूरल ऑपरेटर (HO-FNO) प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो गैर-रेखीय PDEs में संरचित अंतःक्रियाओं को बेहतर ढंग से पकड़ने के लिए स्पष्ट n-रेखीय मोड मिक्सिंग को शामिल करके मानक FNO को उन्नत करता है, जिससे विशेष रूप से अत्यधिक गैर-रेखीय शासन में मौजूदा स्पेक्ट्रल न्यूरल ऑपरेटर्स, ट्रांसफॉर्मर्स और स्टेट-स्पेस मॉडल्स की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Alex Colagrande, Paul Caillon, Eva Feillet, Alexandre Allauzen2026-06-29
💻 computer science

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

यह शोध पत्र हेड-कैमरा फ्रेम के भीतर सापेक्ष कलाई अनुवाद (relative wrist translation) पर आधारित एक ब्रिजिंग एक्शन रिप्रजेंटेशन को, विजन-लैंग्वेज-एक्शन मॉडल के साथ जोड़कर प्रस्तावित करता है, ताकि शोर युक्त 6DoF पोज़ अनुमान और मौलिक एम्बॉडीमेंट अंतरों की सीमाओं को पार करते हुए, विविध मानव हेरफेर कौशल को द्विपक्षीय (bi-manual) रोबोटों में प्रभावी ढंग से स्थानांतरित किया जा सके।

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu2026-06-29
🤖 AI

Toward Robust In-Context Segmentation via Concept Guidance

यह शोध पत्र कॉन्सेप्ट-गाइडेड इन-कॉन्टेक्स्ट सेगमेंटेशन (CG-ICS) को प्रस्तुत करता है, जो एक नवीन प्रतिमान है जो एक MLLM-संचालित कॉन्सेप्ट रीजनिंग मॉड्यूल और एक SAM3-आधारित विजुअल एक्सेम्पलर रूट का उपयोग करके एक फ्रोजन SAM3 बैकबोन को सक्रिय करके इन-कॉन्टेक्स्ट सेगमेंटेशन की मजबूती और सटीकता को बढ़ाता है, जिससे विविध संदर्भ विकल्पों के बीच काफी कम विचरण के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Zhigang Chen, Xiawu Zheng, Rongrong Ji2026-06-29
⚡ electrical engineering

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales

यह शोध पत्र NVRC++ को प्रस्तुत करता है, जो एक नवीन इम्प्लिसिट न्यूरल रिप्रेजेंटेशन-आधारित वीडियो कोडेक है जो उच्च-रिज़ॉल्यूशन फीचर ग्रिड और एक उन्नत एंट्रॉपी मॉडल के साथ एक हल्के आर्किटेक्चर का उपयोग करता है ताकि विभिन्न बिटरेट और जटिलता स्तरों में स्केलेबल, रीयल-टाइम डिकोडिंग प्राप्त की जा सके और गति एवं दक्षता में मौजूदा अत्याधुनिक तरीकों से बेहतर प्रदर्शन किया जा सके।

Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull2026-06-29
🤖 AI

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

यह शोध पत्र HAT-4D प्रस्तुत करता है, जो एक नवीन मानव-एजेंट सहयोगात्मक ढांचा है जो एकल (मोनोक्युलर) वीडियो से भौतिक रूप से विश्वसनीय 4D बहु-वस्तु अंतःक्रियाओं के पुनर्निर्माण के लिए विजन-लैंग्वेज मॉडल और मानव-इन-द-लूप फीडबैक का लाभ उठाता है, जिससे MVOIK-4D बेंचमार्क का निर्माण संभव होता है और एम्बॉडीड AI (Embodied AI) के लिए डेटा जनरेशन को आगे बढ़ाया जा सकता है।

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yif (…)2026-06-29