🤖 AI

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR एक वन-स्टेप डिफ्यूजन मॉडल है जो एक ऑक्यूपेंसी-गाइडेड डिस्क्रिमिनेटर, अपूर्ण मास्क को संभालने के लिए एक अल्फा हेड, और उच्च गुणवत्ता वाले प्रशिक्षण डेटा को क्यूरेट करने के लिए एक सिमेंटिक-एंकोर्ड वेरिफिकेशन पाइपलाइन को पेश करके कुशल, इफेक्ट-अवेयर और मास्क-रोबस्ट ऑब्जेक्ट रिमूवल प्राप्त करता है, जिसके परिणामस्वरूप मल्टी-स्टेप बेसलाइन्स की तुलना में काफी तेज़ इन्फरेंस के साथ बेहतर परसेप्चुअल क्वालिटी प्राप्त होती है।

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang2026-06-29
🤖 machine learning

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

यह शोध पत्र CME-AQA का प्रस्ताव करता है, जो एक क्रॉस-व्यू मल्टीमॉडल फ्रेमवर्क है जो पारंपरिक चीनी चिकित्सा पुनर्वास प्रशिक्षण में अवरोध (occlusion) की चुनौतियों को दूर करने के लिए प्रथम-व्यक्ति और तृतीय-व्यक्ति वीडियो को एकीकृत करता है, जो मौजूदा सिंगल-व्यू विधियों की तुलना में एक्यूपंक्चर और तुइना तकनीकों के लिए एक्शन क्वालिटी असेसमेंट में बेहतर प्रदर्शन प्रदर्शित करता है।

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum2026-06-29
🤖 AI

BiDeMem: Bidirectional Degradation Memory for Explainable Image Restoration

यह शोध पत्र BiDeMem का प्रस्ताव करता है, जो एक द्विदिश क्षरण स्मृति (bidirectional degradation memory) ढांचा है जो संकुचित स्मृति स्लॉट्स को पुनर्प्राप्त करके व्याख्यात्मक छवि बहाली (explainable image restoration) को बढ़ाता है ताकि बहाली प्रक्रिया को एक साथ निर्देशित किया जा सके और एक सत्यापन योग्य स्पष्टीकरण पथ प्रदान किया जा सके, जो मौजूदा क्षरण-जागरूक विधियों की तुलना में बेहतर प्रदर्शन और व्याख्यात्मकता प्रदर्शित करता है।

Xinrui Wu, Lichen Huang2026-06-29
🤖 AI

Higher-Order Fourier Neural Operator: Explicit Mode Mixer for Nonlinear PDEs

यह शोध पत्र हायर-ऑर्डर फूरियर न्यूरल ऑपरेटर (HO-FNO) प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो गैर-रेखीय PDEs में संरचित अंतःक्रियाओं को बेहतर ढंग से पकड़ने के लिए स्पष्ट n-रेखीय मोड मिक्सिंग को शामिल करके मानक FNO को उन्नत करता है, जिससे विशेष रूप से अत्यधिक गैर-रेखीय शासन में मौजूदा स्पेक्ट्रल न्यूरल ऑपरेटर्स, ट्रांसफॉर्मर्स और स्टेट-स्पेस मॉडल्स की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Alex Colagrande, Paul Caillon, Eva Feillet, Alexandre Allauzen2026-06-29
💻 computer science

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

यह शोध पत्र हेड-कैमरा फ्रेम के भीतर सापेक्ष कलाई अनुवाद (relative wrist translation) पर आधारित एक ब्रिजिंग एक्शन रिप्रजेंटेशन को, विजन-लैंग्वेज-एक्शन मॉडल के साथ जोड़कर प्रस्तावित करता है, ताकि शोर युक्त 6DoF पोज़ अनुमान और मौलिक एम्बॉडीमेंट अंतरों की सीमाओं को पार करते हुए, विविध मानव हेरफेर कौशल को द्विपक्षीय (bi-manual) रोबोटों में प्रभावी ढंग से स्थानांतरित किया जा सके।

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu2026-06-29
🤖 AI

Toward Robust In-Context Segmentation via Concept Guidance

यह शोध पत्र कॉन्सेप्ट-गाइडेड इन-कॉन्टेक्स्ट सेगमेंटेशन (CG-ICS) को प्रस्तुत करता है, जो एक नवीन प्रतिमान है जो एक MLLM-संचालित कॉन्सेप्ट रीजनिंग मॉड्यूल और एक SAM3-आधारित विजुअल एक्सेम्पलर रूट का उपयोग करके एक फ्रोजन SAM3 बैकबोन को सक्रिय करके इन-कॉन्टेक्स्ट सेगमेंटेशन की मजबूती और सटीकता को बढ़ाता है, जिससे विविध संदर्भ विकल्पों के बीच काफी कम विचरण के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Zhigang Chen, Xiawu Zheng, Rongrong Ji2026-06-29
⚡ electrical engineering

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales

यह शोध पत्र NVRC++ को प्रस्तुत करता है, जो एक नवीन इम्प्लिसिट न्यूरल रिप्रेजेंटेशन-आधारित वीडियो कोडेक है जो उच्च-रिज़ॉल्यूशन फीचर ग्रिड और एक उन्नत एंट्रॉपी मॉडल के साथ एक हल्के आर्किटेक्चर का उपयोग करता है ताकि विभिन्न बिटरेट और जटिलता स्तरों में स्केलेबल, रीयल-टाइम डिकोडिंग प्राप्त की जा सके और गति एवं दक्षता में मौजूदा अत्याधुनिक तरीकों से बेहतर प्रदर्शन किया जा सके।

Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull2026-06-29
🤖 AI

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

यह शोध पत्र HAT-4D प्रस्तुत करता है, जो एक नवीन मानव-एजेंट सहयोगात्मक ढांचा है जो एकल (मोनोक्युलर) वीडियो से भौतिक रूप से विश्वसनीय 4D बहु-वस्तु अंतःक्रियाओं के पुनर्निर्माण के लिए विजन-लैंग्वेज मॉडल और मानव-इन-द-लूप फीडबैक का लाभ उठाता है, जिससे MVOIK-4D बेंचमार्क का निर्माण संभव होता है और एम्बॉडीड AI (Embodied AI) के लिए डेटा जनरेशन को आगे बढ़ाया जा सकता है।

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yif (…)2026-06-29
💻 computer science

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

यह शोध पत्र RSICCLLM को प्रस्तुत करता है, जो रिमोट सेंसिंग इमेज चेंज कैप्शनिंग में बड़े विजन-लैंग्वेज मॉडल्स के लिए पहला पोस्ट-ट्रेनिंग फ्रेमवर्क है, जो एक कॉम्पैक्ट 7B पैरामीटर मॉडल के साथ स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए एक नवीन डेटा जनरेशन प्रतिमान, डिफरेंस-अवेयर सुपरवाइज्ड फाइन-ट्यूनिंग, और ड्यूल-नेगेटिव प्रेफरेंस ऑप्टिमाइजेशन का लाभ उठाता है।

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu2026-06-29
🤖 machine learning

Adversarial Robustness of AI-Generated Image Detectors in the Real World

यह शोध पत्र प्रदर्शित करता है कि अत्याधुनिक एआई-जनित छवि डिटेक्टर ब्लैक-बॉक्स एडवरसैरियल हमलों के प्रति अत्यधिक संवेदनशील हैं, यहाँ तक कि वास्तविक दुनिया के इमेज डिग्रेडेशन और व्यावसायिक उपकरणों के तहत भी, जो सार्वजनिक विश्वास को सुरक्षित रखने के लिए अधिक सुदृढ़ पहचान विधियों की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Sina Mavali, Jonas Ricker, David Pape, Asja Fischer, Lea Schönherr2026-06-26