💻 computer science

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

यह शोध पत्र SegFS को प्रस्तुत करता है, जो वास्तविक समय के ओपन-वोकैबुलरी वीडियो इंस्टेंस सेगमेंटेशन के लिए एक डुअल-स्ट्रीम फास्ट-स्लो फ्रेमवर्क है, जो स्पार्स कीफ्रेम्स पर मल्टीमॉडल सिमेंटिक अंडरस्टैंडिंग को बाद के फ्रेम्स में डेंस मास्क प्रेडिक्शन के लिए कुशल फीचर-स्पेस कंडीशनिंग से अलग करके, मोबाइल-ओरिएंटेड मॉडल्स की तुलना में 14 गुना तक कम लेटेंसी प्राप्त करता है।

Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xia (…)2026-07-02
🤖 machine learning

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

यह शोध पत्र "Steal the Patch Size" को प्रस्तुत करता है, जो एक ब्लैक-बॉक्स हमला है जो विजन-लैंग्वेज मॉडल्स में टास्क-लेवल साइड-चैनल एक्यूरेसी ड्रॉप्स का फायदा उठाकर प्राइवेट टोकेनाइज़र कॉन्फ़िगरेशन, जैसे कि पैच साइज और प्रीप्रोसेसिंग पाइपलाइन्स को रिकवर करता है, जिससे लक्षित प्रतिकूल हेरफेर (एडवर्सरियल मैनिपुलेशन) सक्षम होता है।

Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson2026-07-02
💻 computer science

Does Your ViT Still Need U-Net for Segmentation?

यह शोध पत्र EoSeg को प्रस्तुत करता है, जो मल्टी-लेवल क्वेरी मॉडलिंग और लर्नबल ब्लॉक फ्यूजन के साथ आधुनिक विजन ट्रांसफॉर्मर्स का लाभ उठाने वाला एक एनकोडर-ओनली सेगमेंटेशन फ्रेमवर्क है, जो यह प्रदर्शित करता है कि विविध मोडैलिटीज में उच्च-प्रदर्शन वाले मेडिकल इमेज सेगमेंटेशन के लिए अब U-Net-शैली के डिकोडर्स की आवश्यकता नहीं है।

Xin Li, Wenhui Zhu, Xuanzhao Dong, Xiwen Chen, Yanxi Chen, Yujian Xiong, Hao Wang, Oana M. Dumitrascu, Yalin Wang2026-07-02
💻 computer science

LV-ROVER: Multi-Stream Tesseract Voting for Maltese Paragraph OCR

माल्टीज़ OCR के लिए वास्तविक दुनिया के प्रशिक्षण डेटा की कमी को दूर करने के लिए, लेखकों ने एक सिंथेटिक पाइपलाइन और एक मल्टी-स्ट्रीम टेसेरैक्ट वोटिंग एनसेम्बल (LV-ROVER) विकसित किया है जो एनसेम्बल रिकग्निशन और एक विशेष पोस्ट-प्रोसेसिंग चेन के संयोजन के माध्यम से 422-पैराग्राफ बेंचमार्क पर कैरेक्टर एरर रेट में 70% की कमी प्राप्त करता है।

Adam Darmanin2026-07-02
🤖 AI

Leveraging Phase Information to Boost Unrolled Network Learning for Image Deblurring

यह शोध पत्र UPADNet का प्रस्ताव करता है, जो एक अनरोल्ड डीप नेटवर्क है जो नवीन LMMSE एस्टिमेटर्स के माध्यम से सीखे गए आयाम (एम्प्लीट्यूड) और चरण (फेज) अपघटन का लाभ उठाता है ताकि मौजूदा अत्याधुनिक विधियों की तुलना में, विशेष रूप से उच्च-शोर और कम-डेटा वाले परिदृश्यों में, बेहतर इमेज डिब्लरिंग प्रदर्शन प्राप्त किया जा सके।

Samira Malek, Haichuan Zhang, Chul Lee, Vishal Monga2026-07-02
💻 computer science

MVDGC: Joint 3D and 2D Multi-view Pedestrian Detection via Dual Geometric Constraints

यह शोध पत्र MVDGC प्रस्तुत करता है, जो मल्टी-व्यू पेडेस्ट्रियन डिटेक्शन के लिए एक एकीकृत ढांचा है जो प्रोजेक्शन-प्रेरित विकृतियों को समाप्त करने और मजबूत ऑक्लूजन रीजनिंग के लिए दृश्यों के बीच पारस्परिक संबंध का लाभ उठाने के लिए स्पार्स 3D सिलिंड्रिकल क्वेरीज़ का उपयोग करके 3D BEV लोकेशन्स और 2D इमेज बाउंडिंग बॉक्सेस का संयुक्त रूप से अनुमान लगाता है।

Thinh Phan, Hao Vo, Khoa Vo, Thanh Ngo, Cuong Pham, Ngan Le2026-07-02
💻 computer science

OnPoint: Offline-to-Online Multi-Level Distillation for Point-Supervised Online Temporal Action Localization

यह शोध पत्र OnPoint को पेश करता है, जो एक ऑफलाइन-टू-ऑनलाइन मल्टी-लेवल डिस्टिलेशन फ्रेमवर्क है जो केवल सिंगल टेम्पोरल पॉइंट एनोटेशन का उपयोग करके, एक पॉइंट-सुपरवाइज्ड ऑफलाइन टीचर से ऑनलाइन स्टूडेंट में ज्ञान स्थानांतरित करके, स्ट्रीमिंग वीडियो परिदृश्यों में उच्च प्रदर्शन प्राप्त करके सुदृढ़ पॉइंट-सुपरवाइज्ड ऑनलाइन टेम्पोरल एक्शन लोकलाइजेशन (POTAL) को सक्षम बनाता है।

Sakib Reza, Gauri Jagatap, Mohsen Moghaddam, Octavia Camps, Andrea Fanelli2026-07-02
💻 computer science

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

यह शोध पत्र Splash को प्रस्तुत करता है, जो एक मास्क-आइसोलेटेड टैक्टाइल अलाइनमेंट फ्रेमवर्क है जो कैटास्ट्रोफिक फॉरगेटिंगिंग (catastrophic forgetting) या अतिरिक्त इन्फरेंस ओवरहेड के बिना स्टेट-ऑफ-द-आर्ट विज़ुओ-टैक्टाइल रीजनिंग सक्षम करने के लिए MLLM मापदंडों को क्रिटिकल और डॉर्मेंट सबस्पेस में विभाजित करता है।

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee2026-07-02
💻 computer science

Typography-Based Monocular Distance Estimation for Advanced Driver-Assistance Systems

यह शोध पत्र उन्नत ड्राइवर-सहायता प्रणालियों (एडवांस्ड ड्राइवर-असिस्टेंस सिस्टम्स) के लिए एक लागत प्रभावी मोनोकुलर दूरी अनुमान विधि प्रस्तावित करता है जो वाहन की दूरी, दिशा और पहचान को सटीक रूप से गणना करने के लिए एक साधारण कैमरे के साथ 0.13 मीटर से कम की त्रुटि के साथ पिछले लाइसेंस प्लेट के पात्रों के मानकीकृत आयामों का लाभ उठाता है।

Manognya Lokesh Reddy, Zheng Liu2026-07-02
💻 computer science

Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models

यह शोध पत्र मौजूदा विधियों की उस सीमा को संबोधित करने के लिए पर्सनलाइज्ड ऑब्जेक्ट आइडेंटिफिकेशन एंड लोकलाइजेशन (POIL) कार्य प्रस्तुत करता है जो यह मानती हैं कि लक्षित वस्तुएं हमेशा मौजूद रहती हैं, और IPLoc-ID का प्रस्ताव करता है, जो विजन-लैंग्वेज मॉडल का उपयोग करने वाला एक नवीन इन-कॉन्टेक्स्ट इन्फरेंस एल्गोरिदम है जो अप्रासंगिक क्वेरी छवियों को अस्वीकार करते हुए प्रभावी ढंग से लक्षित इंस्टेंस की पहचान और स्थानीयकरण करता है।

Kensuke Nakamura, Byung-Woo Hong2026-07-02