💻 computer science

From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

यह शोध पत्र ट्रैफिक दुर्घटना वीडियो-क्यू-ए (VideoQA) बेंचमार्क का ऑडिट करता है ताकि यह प्रकट किया जा सके कि उच्च सटीकता अक्सर दृश्य साक्ष्य के बजाय पाठ्य शॉर्टकट (textual shortcuts) से उत्पन्न होती है, और एक नए मेट्रिक्स तथा एक प्रशिक्षण-मुक्त फ़िल्टरिंग विधि का प्रस्ताव करता है जो शॉर्टकट-संभावित प्रश्नों की पहचान करने और उन्हें हटाने के लिए है, जिससे सुरक्षा-महत्वपूर्ण अनुप्रयोगों में वास्तविक दृश्य ग्राउंडिंग (visual grounding) सुनिश्चित की जा सके।

Sena Korkut, María Alejandra Bravo Sarmiento, Sanghwan Kim, Zeynep Akata2026-06-30
💻 computer science

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

यह शोध पत्र S4ECA का प्रस्ताव करता है, जो एक पैरामीटर-कुशल फ्रेमवर्क है जो सिमेंटिक-ड्रिवन स्केल और स्पेशियल सिलेक्शन मैकेनिज्म के साथ एक डुअल-एनकोडर एडेप्टर का उपयोग करता है ताकि बैकबोन के केवल 2.4% पैरामीटर्स को अपडेट करते हुए रिफरिंग रिमोट सेंसिंग इमेज सेगमेंटेशन में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang2026-06-30
💻 computer science

Intermediate Text Representation Guided Text-to-Image Generation for Enhancing One-and-Only Alignment

यह शोध पत्र एक मध्यवर्ती टेक्स्ट प्रतिनिधित्व-निर्देशित विधि का प्रस्ताव करके "एक और केवल एक" (one-and-only) वस्तुओं को निष्ठापूर्वक रेंडर करने में टेक्स्ट-टू-इमेज डिफ्यूजन मॉडल की विफलता को संबोधित करता है, जो दमित अवधारणा संबंधी जानकारी को पुनः प्राप्त करने के लिए प्रारंभिक-परत एनकोडर अवस्थाओं को इंजेक्ट करता है, जिससे बिना किसी अतिरिक्त प्रशिक्षण के महत्वपूर्ण संरेखण सुधार प्राप्त होता है।

Soyoun Won, Aryan Yazdan Parast, Basim Azam, Jean Honorio, Naveed Akhtar2026-06-30
💻 computer science

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

VisReflect एक नवीन फ्रेमवर्क है जो एकल फॉरवर्ड पास के भीतर प्रमुख क्षेत्रों की ओर ध्यान केंद्रित करने के लिए निरंतर लेटेंट विजुअल रिफ्लेक्शंस (latent visual reflections) उत्पन्न करके लंबे विजुअल संदर्भों में सूक्ष्म धारणा (fine-grained perception) को बढ़ाता है, जिससे यह पारंपरिक री-एनकोडिंग विधियों की तुलना में विजुअल अटेंशन सिंक समस्या को दूर करता है और कम्प्यूटेशनल ओवरहेड को कम करता है।

Xiaoqian Shen, Mohamed Elhoseiny2026-06-30
🤖 machine learning

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

DreamForge-World 0.1 Preview एक लो-कंप्यूट, कंज्यूमर-जीपीयू-फ्रेंडली फाउंडेशनल वर्ल्ड मॉडल है जो Wan2.1-व्युत्पन्न LongLive 1 आर्किटेक्चर को एक रेसिडुअल एक्शन पाथवे के साथ अनुकूलित करता है ताकि RTX 4090 पर कीबोर्ड और माउस कंट्रोल के साथ 15 FPS तक रियल-टाइम, इंटरैक्टिव वीडियो सिमुलेशन सक्षम किया जा सके।

Daniyel Ayupov, Artur Markov-Tsoy2026-06-30
💻 computer science

A Point Cloud Transformer for Remote Monitoring and Automated Assessment of Physical Rehabilitation Exercises

यह शोध पत्र एक हल्का, ट्रांसफॉर्मर-आधारित फ्रेमवर्क प्रस्तावित करता है जो घर पर शारीरिक पुनर्वास अभ्यासों के लागत प्रभावी, स्वचालित और उच्च-प्रदर्शन वाले मूल्यांकन को सक्षम करने के लिए RGBD संयुक्त डेटा पर कर्व-आधारित पॉइंट-क्लाउड फीचर एग्रीगेशन और एक्सियल सेल्फ-अटेंशन का उपयोग करता है।

Kazi Rafat, Md. Ismail Hossain, M M Lutfe Elahi, Sifat Momen, Fuad Rahman, Nabeel Mohammed, Shafin Rahman2026-06-30
🤖 machine learning

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment

यह शोध पत्र TRACE को प्रस्तुत करता है, जो RANO 2.0 मानदंडों के अनुरूप एक व्याख्या योग्य कॉन्सेप्ट बॉटलनेक मॉडल है, जो पारदर्शी तर्क और संभावित नैदानिक सुधार को सक्षम करने के लिए मध्यवर्ती अवधारणाओं के रूप में नैदानिक रूप से सार्थक ट्यूमर मापन की भविष्यवाणी करके 3D MRI पर अनुदैर्ध्य ग्लियोब्लास्टोमा प्रतिक्रिया मूल्यांकन में सुधार करता है।

Alia Tarek, Hamsa Saberr, Hamza Elghonemy, Youssef Afify, Tamer Basha, Omair Shahzad Bhatti, Abdulrahman M. Selim, Hasan (…)2026-06-30
💻 computer science

Real-Time Underwater Image Enhancement via Frequency-Guided Dual-Path Attention

यह शोध पत्र एक हल्का, वास्तविक समय वाला अंतर्जलीय छवि संवर्धन ढांचा प्रस्तावित करता है जो न्यूनतम कम्प्यूटेशनल लागत और उच्च अनुमान गति के साथ अत्याधुनिक प्रदर्शन प्राप्त करने के लिए फिक्स्ड डीटीसी (DCT) प्रायों के साथ फ्रीक्वेंसी-गाइडेड डुअल-पाथ अटेंशन और रीपैरामीटेराइज़ेबल कनवल्शन को एकीकृत करता है।

Leshen Zhang, Ao Li, Ce Zhu2026-06-30
💻 computer science

Optimizing Image Preparation and Compression for Face Recognition within 1024 Bytes

यह अध्ययन प्रदर्शित करता है कि प्रीप्रोसेसिंग चरणों और संपीड़न कॉन्फ़िगरेशन को अनुकूलित करना, विशेष रूप से नए मानकीकृत JPEG AI प्रारूप का उपयोग करके, चेहरे की पहचान के उच्च प्रदर्शन को बनाए रखते हुए मशीन-पठनीय यात्रा दस्तावेजों के लिए एक सख्त 1024-बाइट सीमा के भीतर चेहरे की छवियों को संग्रहीत करने में सक्षम बनाता है।

Paul Andreas, Torsten Schlett, Christoph Busch2026-06-30
💻 computer science

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP एक एकीकृत ढांचा है जो MMDiT पर निर्मित है जो एक सरल प्रशिक्षण रणनीति के माध्यम से नियंत्रणीय छवि निर्माण और सघन भविष्यवाणी (dense prediction) को संयुक्त रूप से सीखता है, प्रभावी रूप से छवि-ज्यामिति वितरण को कैप्चर करता है ताकि विशिष्ट तरीकों के तुलनीय प्रदर्शन प्राप्त किया जा सके और साथ ही दोनों जनरेटिव और संवेदी क्षमताओं को बढ़ाया जा सके।

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu2026-06-30