🤖 AI

Higher-Order Fourier Neural Operator: Explicit Mode Mixer for Nonlinear PDEs

यह शोध पत्र हायर-ऑर्डर फूरियर न्यूरल ऑपरेटर (HO-FNO) प्रस्तुत करता है, जो एक नवीन आर्किटेक्चर है जो गैर-रेखीय PDEs में संरचित अंतःक्रियाओं को बेहतर ढंग से पकड़ने के लिए स्पष्ट n-रेखीय मोड मिक्सिंग को शामिल करके मानक FNO को उन्नत करता है, जिससे विशेष रूप से अत्यधिक गैर-रेखीय शासन में मौजूदा स्पेक्ट्रल न्यूरल ऑपरेटर्स, ट्रांसफॉर्मर्स और स्टेट-स्पेस मॉडल्स की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त होती है।

Alex Colagrande, Paul Caillon, Eva Feillet, Alexandre Allauzen2026-06-29
💻 computer science

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

यह शोध पत्र हेड-कैमरा फ्रेम के भीतर सापेक्ष कलाई अनुवाद (relative wrist translation) पर आधारित एक ब्रिजिंग एक्शन रिप्रजेंटेशन को, विजन-लैंग्वेज-एक्शन मॉडल के साथ जोड़कर प्रस्तावित करता है, ताकि शोर युक्त 6DoF पोज़ अनुमान और मौलिक एम्बॉडीमेंट अंतरों की सीमाओं को पार करते हुए, विविध मानव हेरफेर कौशल को द्विपक्षीय (bi-manual) रोबोटों में प्रभावी ढंग से स्थानांतरित किया जा सके।

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu2026-06-29
🤖 AI

Toward Robust In-Context Segmentation via Concept Guidance

यह शोध पत्र कॉन्सेप्ट-गाइडेड इन-कॉन्टेक्स्ट सेगमेंटेशन (CG-ICS) को प्रस्तुत करता है, जो एक नवीन प्रतिमान है जो एक MLLM-संचालित कॉन्सेप्ट रीजनिंग मॉड्यूल और एक SAM3-आधारित विजुअल एक्सेम्पलर रूट का उपयोग करके एक फ्रोजन SAM3 बैकबोन को सक्रिय करके इन-कॉन्टेक्स्ट सेगमेंटेशन की मजबूती और सटीकता को बढ़ाता है, जिससे विविध संदर्भ विकल्पों के बीच काफी कम विचरण के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।

Zhigang Chen, Xiawu Zheng, Rongrong Ji2026-06-29
⚡ electrical engineering

Enhanced Neural Video Representation Compression across Extreme Complexity and Quality Scales

यह शोध पत्र NVRC++ को प्रस्तुत करता है, जो एक नवीन इम्प्लिसिट न्यूरल रिप्रेजेंटेशन-आधारित वीडियो कोडेक है जो उच्च-रिज़ॉल्यूशन फीचर ग्रिड और एक उन्नत एंट्रॉपी मॉडल के साथ एक हल्के आर्किटेक्चर का उपयोग करता है ताकि विभिन्न बिटरेट और जटिलता स्तरों में स्केलेबल, रीयल-टाइम डिकोडिंग प्राप्त की जा सके और गति एवं दक्षता में मौजूदा अत्याधुनिक तरीकों से बेहतर प्रदर्शन किया जा सके।

Ho Man Kwan, Tianhao Peng, Fan Zhang, Mike Nilsson, Andrew Gower, David Bull2026-06-29
🤖 AI

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

यह शोध पत्र HAT-4D प्रस्तुत करता है, जो एक नवीन मानव-एजेंट सहयोगात्मक ढांचा है जो एकल (मोनोक्युलर) वीडियो से भौतिक रूप से विश्वसनीय 4D बहु-वस्तु अंतःक्रियाओं के पुनर्निर्माण के लिए विजन-लैंग्वेज मॉडल और मानव-इन-द-लूप फीडबैक का लाभ उठाता है, जिससे MVOIK-4D बेंचमार्क का निर्माण संभव होता है और एम्बॉडीड AI (Embodied AI) के लिए डेटा जनरेशन को आगे बढ़ाया जा सकता है।

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yif (…)2026-06-29
💻 computer science

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

यह शोध पत्र RSICCLLM को प्रस्तुत करता है, जो रिमोट सेंसिंग इमेज चेंज कैप्शनिंग में बड़े विजन-लैंग्वेज मॉडल्स के लिए पहला पोस्ट-ट्रेनिंग फ्रेमवर्क है, जो एक कॉम्पैक्ट 7B पैरामीटर मॉडल के साथ स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करने के लिए एक नवीन डेटा जनरेशन प्रतिमान, डिफरेंस-अवेयर सुपरवाइज्ड फाइन-ट्यूनिंग, और ड्यूल-नेगेटिव प्रेफरेंस ऑप्टिमाइजेशन का लाभ उठाता है।

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu2026-06-29
🤖 machine learning

Adversarial Robustness of AI-Generated Image Detectors in the Real World

यह शोध पत्र प्रदर्शित करता है कि अत्याधुनिक एआई-जनित छवि डिटेक्टर ब्लैक-बॉक्स एडवरसैरियल हमलों के प्रति अत्यधिक संवेदनशील हैं, यहाँ तक कि वास्तविक दुनिया के इमेज डिग्रेडेशन और व्यावसायिक उपकरणों के तहत भी, जो सार्वजनिक विश्वास को सुरक्षित रखने के लिए अधिक सुदृढ़ पहचान विधियों की महत्वपूर्ण आवश्यकता को रेखांकित करता है।

Sina Mavali, Jonas Ricker, David Pape, Asja Fischer, Lea Schönherr2026-06-26
💻 computer science

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

यह शोध पत्र एक नवीन डेटासेट डिस्टिलेशन फ्रेमवर्क प्रस्तावित करता है जो प्रेडिक्टेड नॉइज़ लॉस और इंट्रा-क्लास क्लस्टरिंग के आधार पर विशिष्ट इमेज पैचेस चुनने के लिए प्री-ट्रेन्ड डिफ्यूजन मॉडल्स का लाभ उठाता है, जो एक सुव्यवस्थित वन-स्टेप प्रक्रिया को सक्षम बनाता है जो बड़े पैमाने के डेटासेट्स पर मौजूदा जनरेशन-आधारित विधियों से बेहतर प्रदर्शन करता है।

Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang2026-06-26
💻 computer science

TF-TI2I: Training-Free Text-and-Image-to-Image Generation via Multi-Modal Implicit-Context Learning in Text-to-Image Models

यह शोध पत्र TF-TI2I को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो 'रेफरेंस कॉन्टेक्स्टुअल मास्किंग' और एक 'विनर-टेक्स-ऑल' मॉड्यूल के माध्यम से MM-DiT आर्किटेक्चर के भीतर निहित संदर्भ शिक्षण (इम्प्लिसिट कॉन्टेक्स्ट लर्निंग) का लाभ उठाकर टेक्स्ट-एंड-इमेज-टू-इमेज जनरेशन को बेहतर बनाता है, साथ ही मूल्यांकन अंतराल को संबोधित करने के लिए FG-TI2I बेंच का प्रस्ताव भी देता है।

Teng-Fang Hsiao, Bo-Kai Ruan, Yi-Lun Wu, Tzu-Ling Lin, Hong-Han Shuai2026-06-26
💻 computer science

Circular Quasiconformal Deturbulence: Geometry-Based Restoration from Multiple Turbulent Frames

यह शोध पत्र सर्कुलर क्वासी-कॉन्फॉर्मल डिटर्बुलेंस (CQCD) का प्रस्ताव करता है, जो एक अनसुपरवाइज्ड फ्रेमवर्क है जो फॉरवर्ड और बैकवर्ड ट्रांसफॉर्मेशन को संयुक्त रूप से अनुमानित करने के लिए एक सर्कुलर आर्किटेक्चर के भीतर क्वासी-कॉन्फॉर्मल ज्योमेट्री और टाइट-फ्रेम ब्लॉक्स का लाभ उठाता है, जिससे बिना किसी स्वच्छ युग्मित डेटा (clean paired data) की आवश्यकता के, कई टर्बुलेंट फ्रेम्स से उत्कृष्ट इमेज रेस्टोरेशन और डेफॉर्मेशन फील्ड एस्टीमेशन प्राप्त होता है।

Chu Chen, Han Zhang, Lok Ming Lui2026-06-26