💻 computer science

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

यह शोध पत्र KeyFrame-Compass को प्रस्तुत करता है, जो कीफ्रेम-कंडीशन्ड वीडियो जनरेशन के लिए पहला व्यापक बेंचमार्क और स्वचालित मूल्यांकन ढांचा है, जो यह प्रकट करता है कि वर्तमान मॉडल कीफ्रेम निष्पादन की सत्यनिष्ठा और स्वाभाविक वीडियो संश्लेषण के बीच संतुलन बनाने में संघर्ष करते हैं, विशेष रूप से सघन बाधाओं या स्टोरीबोर्ड-ग्रिड इनपुट के तहत।

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei (…)2026-07-17
🤖 AI

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation

यह शोध पत्र Instant NuRec को प्रस्तुत करता है, जो एक फीड-फॉरवर्ड न्यूरल मॉडल है जो मल्टी-व्यू लॉग्स से एकल फॉरवर्ड पास में पूर्णतः सिमुलेबलटेबल 3D गॉसियन स्प्लेटिंग ड्राइविंग दृश्यों को तेजी से पुनर्गठित करता है, जो गतिशील तत्वों और नॉन-पिनहोल कैमरों का समर्थन करते हुए गति और रेंडरिंग गुणवत्ता दोनों में मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।

NVIDIA, :, Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning (…)2026-07-17
🤖 AI

SeeSE3: Emergence of 3D Space in Vision Features

यह शोधपत्र प्रदर्शित करता है कि स्व-पर्यवेक्षित विजन फाउंडेशन मॉडल स्वाभाविक रूप से अपने लेटेंट फीचर्स के भीतर 3D यूक्लिडियन स्पेस संरचनाओं को एनकोड करते हैं, जो स्पष्ट 3D पुनर्निर्माण के बिना विजुअल ओडोमेट्री और लोकलाइजेशन के लिए नवीन "लेटेंट-स्पेस नेविगेशन" तकनीकों को सक्षम बनाता है।

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov2026-07-17
💻 computer science

DCVC-MB: Neural B-Frame Video Compression using State Space Models

यह शोध पत्र DCVC-MB को प्रस्तुत करता है, जो B-फ्रेम्स के लिए एक न्यूरल वीडियो संपीड़न फ्रेमवर्क है जो द्विदिश भविष्यवाणी (bidirectional prediction) के लिए स्टेट-स्पेस मॉडल और मौजूदा न्यूरल कोडेक्स तथा VTM जैसे पारंपरिक मानकों की तुलना में बिटरेट में महत्वपूर्ण कमी प्राप्त करने के लिए एक एंट्रॉपी-अवेयर स्किपिंग मैकेनिज्म का लाभ उठाता है।

Arjun Arora, Calvin-Khang Ta, Carlos Restrepo-Galeano, Kruthi Murali, Naga Akhil E S, Arunkumar Mohananchettiar, Jay Shi (…)2026-07-17
💻 computer science

MixCompress: Mixture of Experts for Variable Rate Learned Image Compression

MixCompress एक एकीकृत वेरिएबल-रेट इमेज कंप्रेशन फ्रेमवर्क है जो स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स रूटिंग, स्केलेबल क्षमता के लिए एक डायनेमिक मिक्स्चर-ऑफ-डेप्थ्स एक्सटेंशन और कंडीशनल ऑक्सिलरी ट्रांसफॉर्म्स को एकीकृत करके फीचर एंटैंगलमेंट और कम्प्यूटेशनल बॉटलनेक्स पर विजय प्राप्त करता है, जिससे ऐसा प्रदर्शन प्राप्त होता है जो व्यक्तिगत रूप से अनुकूलित सिंगल-रेट मॉडल्स के बराबर या उनसे बेहतर है।

Calvin-Khang Ta, Praneet Singh, Tong Shao, Peng Yin2026-07-17
🤖 machine learning

Beyond scalar losses: calibrating segmentation models via gradient vector field surgery

यह शोध पत्र एक नवीन "ग्रेडिएंट वेक्टर फील्ड सर्जरी" प्रस्तावित करता है जो क्षेत्र-आधारित विभाजन लॉस फंक्शन्स (region-based segmentation loss functions) में अंतर्निहित अति-आत्मविश्वास और गलत अंशांकन (miscalibration) की समस्याओं को प्रभावी ढंग से कम करने के लिए प्रेडिक्शन एरर के साथ ग्रेडिएंट मैग्नीट्यूड को रैखिक रूप से स्केल करता है, जिससे सटीकता से समझौता किए बिना महत्वपूर्ण चिकित्सा इमेजिंग अनुप्रयोगों के लिए मॉडल की विश्वसनीयता में सुधार होता है।

Laurin Lux, Alexander H. Berger, Moritz Knolle, Daniel Rückert, Johannes C. Paetzold2026-07-17
💻 computer science

Dynamic Manipulation Hypergraphs for HAR: Beyond Pairwise Relations: Dynamic Manipulation Hypergraphs for Vision-Based Human Activity Recognition

यह शोध पत्र एक डायनेमिक मैनिपुलेशन हाइपरग्राफ फ्रेमवर्क प्रस्तावित करता है जो हाथों, वस्तुओं, उपकरणों और सतहों के बीच विकसित होते उच्च-क्रम संबंधों को मॉडल करता है ताकि सूक्ष्म-स्तरीय विजन-आधारित मानव गतिविधि पहचान में पारंपरिक पेयरवाइज ग्राफ विधियों से काफी बेहतर प्रदर्शन किया जा सके।

Fatemeh Ziaeetabar2026-07-17
⚡ electrical engineering

Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models

यह शोध पत्र प्रदर्शित करता है कि फ्रोजन (frozen) DINOv3 विजन फाउंडेशन मॉडल्स, जब फेस-पार्ट लेबलिंग इंटरफेस के साथ संयोजित किए जाते हैं, तो बिना किसी विशेष प्रशिक्षण के, स्ट्रॉन्ग ज़ीरो-शॉट रीजन-लेवल फेशियल कोरेस्पोंडेंस और आइडेंटिटीज के बीच टेम्पोरल ट्रैकिंग को सक्षम करते हैं, जिसमें इंटरमीडिएट फीचर लेयर्स सघन शारीरिक संरेखण (dense anatomical alignment) के लिए सबसे प्रभावी सिद्ध होती हैं।

Izaldein Al-Zyoud, Abdulmotaleb El Saddik2026-07-17
💻 computer science

Immediate 3D Gaussian Splat Reconstruction of Unordered Input with Global Consistency

यह शोधपत्र अनऑर्डर्ड इनपुट्स से 3D गॉसियन स्प्लेटिंग पुनर्निर्माण के लिए पहला तत्काल फीडबैक समाधान प्रस्तुत करता है जो विजुअल प्लेस रिकग्निशन, कोविज़िबिलिटी ग्राफ और एक प्रोग्रेसिव पदानुक्रमित ढांचे का लाभ उठाकर वैश्विक निरंतरता सुनिश्चित करता है ताकि तेज़, स्केलेबल और उच्च-गुणवत्ता वाला दृश्य रेंडरिंग सक्षम किया जा सके।

Andreas Meuleman, Linus Franke, Boris Zhestiankin, Camille Montemagni, George Drettakis2026-07-17
🤖 machine learning

Multi-Scale ViT Inference with Habitat-Fit Priors and kNN Retrieval for Multi-Species Plant Identification

यह शोध पत्र प्लांटCLEF 2026 चुनौती के लिए DS@GT ARC के तीसरे स्थान वाले समाधान को प्रस्तुत करता है, जो एक मल्टी-स्केल DINOv2 ViT क्लासिफायर को FAISS kNN रिट्रीवल, भौगोलिक आवास प्रायोरिटीज़ (geographic habitat priors) और टेम्पोरल फ्यूजन के साथ जोड़कर उच्च-रिज़ॉल्यूशन वाले क्वाड्रैट इमेजेस में मजबूत बहु-प्रजाति पौधों की पहचान प्राप्त करता है, जबकि यह प्रदर्शित करता है कि वैकल्पिक प्रशिक्षण-केंद्रित दृष्टिकोणों से कोई प्रदर्शन लाभ नहीं हुआ।

Alper Erten, Murilo Gustineli, Adrian Cheung2026-07-17