🤖 machine learning

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV एक स्ट्रीमिंग वीडियो समझने वाला फ्रेमवर्क है जो सटीक नियर-विंडो KV कैशिंग और ऐतिहासिक सामग्री के लिए एक निश्चित-क्षमता वाले सारांश-अवस्था मेमोरी के हाइब्रिड दृष्टिकोण के माध्यम से एक निरंतर मेमोरी फुटप्रिंट बनाए रखकर विलंबित प्रश्नों की चुनौती का समाधान करता है, जिससे क्वेरी विलंब बढ़ने के साथ टोकन-रिटेंशन बेसलाइन्स की तुलना में सटीकता में उल्लेखनीय सुधार होता है।

Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)2026-06-26
🤖 AI

ResilPhase: Plug-and-Play Phase Mapping and Noise-Resilient Macro-Trajectory Extrapolation for Diffusion Acceleration

ResilPhase एक प्लग-एंड-प्ले फ्रेमवर्क है जो डिफ्यूजन मॉडल्स को तेज़ करता है, जो इन्फरेंस को ODE स्पेस में स्थिर मैक्रो-ट्रैजेक्टरी एक्सट्रपलेशन के रूप में पुनर्गठित करता है, और मौजूदा कैश-देन-फोरकास्ट विधियों में निहित गुणवत्ता गिरावट और अस्थिरता को दूर करने के लिए एक डेरिवेटिव-फ्री बैरीसेंट्रिक लैग्रेंज एक्सट्रैपोलेटर और बाउंडेड फेज मैपिंग का उपयोग करता है।

Qicheng Zhao, Yu Li, Qi Sun, Zheyu Yan2026-06-26
🤖 AI

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache वीडियो डिफ्यूजन मॉडल्स के लिए एक प्लग-एंड-प्ले टेस्ट-टाइम सेल्फ-कैलिब्रेशन विधि है जो फीचर इवोल्यूशन को इनर्शियल नेविगेशन सिस्टम समस्या के रूप में पुनर्कल्पित करती है ताकि ऑफलाइन कैलिब्रेशन डेटा पर निर्भर रहे बिना एरर-बाउंडेड कंप्यूटेशन स्किपिंग और बेहतर त्वरण प्रदर्शन प्राप्त किया जा सके।

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu2026-06-26
💻 computer science

Identifying the Unknown: Prompt-Free Open Vocabulary Anomaly Recognition for Robot-Object Interaction

यह शोध पत्र AnomNOVIC को प्रस्तुत करता है, जो एक दो-चरणीय ढांचा है जो विसंगति-आधारित क्षेत्र प्रस्ताव (anomaly-based region proposal) के लिए एक मास्क्ड ऑटोएन्कोडर को एक प्रॉम्प्ट-मुक्त ओपन वोकैबुलरी क्लासिफायर (NOVIC) के साथ जोड़ता है ताकि पूर्व-निर्धारित क्लास सूचियों की आवश्यकता के बिना रोबोट-वस्तु अंतःक्रियाओं में अनदेखी वस्तुओं की अत्याधुनिक वास्तविक समय पहचान प्राप्त की जा सके।

Philipp Allgeuer, Jan-Gerrit Habekost, Stefan Wermter2026-06-26
💻 computer science

Liquid Fusion of Heterogeneous Representations Towards General Salient Object Detection

यह शोध पत्र LFNet का प्रस्ताव करता है, जो एक नवीन ढांचा है जो CNN और स्टेट स्पेस मॉडल बैकबोन से पूरक स्पेक्ट्रल रिप्रजेंटेशन को गतिशील रूप से एकीकृत करने के लिए एक लिक्विड फ्यूजन मैकेनिज्म का लाभ उठाता है, जिससे विविध सामान्य सैलिएंट ऑब्जेक्ट डिटेक्शन कार्यों में अत्याधुनिक प्रदर्शन प्राप्त होता है।

Ke Chen, Ling Zhou, Guangqi Jiang, Gengshen Wu, Yi Liu, Shoukun Xu2026-06-26
💻 computer science

Rolling Shutter Relative Pose Estimation Made Practical

यह शोध पत्र एक व्यावहारिक रोलिंग शटर सापेक्ष मुद्रा अनुमान विधि प्रस्तुत करता है जो केवल सात पत्राचारों से मुद्रा और गति को हल करने के लिए एफाइन पत्राचारों और नवीन RS-सुधारित बाधाओं का उपयोग करता है, जो रोलिंग और ग्लोबल शटर दोनों डेटासेट पर अत्याधुनिक सटीकता प्राप्त करते हुए 1.2ms में इसे पूरा करता है।

Daniel Barath2026-06-26
💻 computer science

RIS-Assisted Proactive Handover for Reliable mmWave Wireless Networks

यह शोध पत्र mmWave नेटवर्क के लिए एक नवीन RIS-सहायता प्राप्त प्रोएक्टिव हैंडओवर फ्रेमवर्क प्रस्तावित करता है जो लाइन-ऑफ-साइट अवरोधों को कम करने के लिए सिग्नल गुणवत्ता, ऊर्जा दक्षता और हैंडओवर समय संबंधी बाधाओं को संतुलित करने हेतु ऑफलाइन रूप से इष्टतम RIS तत्वों की संख्या निर्धारित करने के लिए पार्टिकल स्वार्म ऑप्टिमाइज़ेशन का उपयोग करता है।

Alaa Adnan, Mohammad Al-Quraan, Ahmed Zoha, M. Majid Butt, Sami Muhaidat, Muhammad Ali Imran, Marco Di Renzo, Lina Mohja (…)2026-06-26
💻 computer science

Modeling Local, Global, and Cross-Modal Context in Multimodal 3D MRI

यह शोध पत्र MICViT को प्रस्तुत करता है, जो एक नवीन 3D विजन ट्रांसफॉर्मर है जो कई MRI मोडैलिटीज को प्रभावी ढंग से एकीकृत करने के लिए स्थानीय और वैश्विक इंट्रा- और क्रॉस-मोडल इंटरैक्शन को स्पष्ट रूप से मॉडल करता है, और बड़े पैमाने पर विषम डेटासेट्स में मौजूदा CNN और ट्रांसफॉर्मर बेसलाइन्स की तुलना में ब्रेन एज प्रेडिक्शन (मस्तिष्क आयु भविष्यवाणी) में बेहतर प्रदर्शन प्रदर्शित करता है।

Minh Duc Do, Tillmann Rheude, Noel Kronenberg, Roland Eils, Benjamin Wild2026-06-26
🤖 AI

Confidence-Aware Tool Orchestration for Robust Video Understanding

यह शोध पत्र Robust-TO को प्रस्तुत करता है, जो एक एजेंटिक वीडियो समझ ढांचा (framework) है जो प्रति-फ्रेम विश्वसनीयता स्कोर को एक एकीकृत टूल ऑर्केस्ट्रेशन सिस्टम में एकीकृत करके "ब्लाइंड ट्रस्ट प्रॉब्लम" को कम करता है, जिससे अत्याधुनिक मॉडलों की तुलना में सटीकता और दृश्य भ्रष्टाचार (visual corruptions) के विरुद्ध मजबूती में महत्वपूर्ण सुधार होता है।

Yangfan He, Yujin Choi, Jaehong Yoon2026-06-26
💻 computer science

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

यह शोध पत्र Qwen-Image-Agent को प्रस्तुत करता है, जो एक एकीकृत एजेंटिक फ्रेमवर्क है जो तर्क, खोज, स्मृति और फीडबैक के माध्यम से गतिशील रूप से योजना बनाने और लुप्त जानकारी को एकत्रित करके वास्तविक दुनिया में इमेज जनरेशन के "कॉन्टेक्स्ट गैप" (संदर्भ अंतराल) को पाटता है, और नए प्रस्तावित Image Agent Bench पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue C (…)2026-06-26